Diversity-Aware Policy Optimization for Large Language Model Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yao, Jian, Cheng, Ran, Wu, Xingyu, Wu, Jibin, Tan, Kay Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
par: Wu, Xingyu, et autres
Publié: (2023)
par: Wu, Xingyu, et autres
Publié: (2023)
LLM Cannot Discover Causality, and Should Be Restricted to Non-Decisional Support in Causal Discovery
par: Wu, Xingyu, et autres
Publié: (2025)
par: Wu, Xingyu, et autres
Publié: (2025)
HM3: Hierarchical Multi-Objective Model Merging for Pretrained Models
par: Zhou, Yu, et autres
Publié: (2024)
par: Zhou, Yu, et autres
Publié: (2024)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
par: Yao, Jian, et autres
Publié: (2025)
par: Yao, Jian, et autres
Publié: (2025)
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
par: Qiu, Haiyun, et autres
Publié: (2026)
par: Qiu, Haiyun, et autres
Publié: (2026)
CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs
par: Zhou, Yu, et autres
Publié: (2024)
par: Zhou, Yu, et autres
Publié: (2024)
Unlock the Power of Algorithm Features: A Generalization Analysis for Algorithm Selection
par: Wu, Xingyu, et autres
Publié: (2024)
par: Wu, Xingyu, et autres
Publié: (2024)
$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
par: Chen, Xianwei, et autres
Publié: (2026)
par: Chen, Xianwei, et autres
Publié: (2026)
Design Principle Transfer in Neural Architecture Search via Large Language Models
par: Zhou, Xun, et autres
Publié: (2024)
par: Zhou, Xun, et autres
Publié: (2024)
Exploring the True Potential: Evaluating the Black-box Optimization Capability of Large Language Models
par: Huang, Beichen, et autres
Publié: (2024)
par: Huang, Beichen, et autres
Publié: (2024)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
par: Zhang, Shimin, et autres
Publié: (2025)
par: Zhang, Shimin, et autres
Publié: (2025)
Fine-Grained Model Merging via Modular Expert Recombination
par: Qiu, Haiyun, et autres
Publié: (2026)
par: Qiu, Haiyun, et autres
Publié: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
par: Wang, Ziqi, et autres
Publié: (2026)
par: Wang, Ziqi, et autres
Publié: (2026)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
par: Wang, Ruhan, et autres
Publié: (2026)
par: Wang, Ruhan, et autres
Publié: (2026)
Scaling Supervised Local Learning with Augmented Auxiliary Networks
par: Ma, Chenxiang, et autres
Publié: (2024)
par: Ma, Chenxiang, et autres
Publié: (2024)
Large Language Models as Generalist Policies for Network Optimization
par: Wu, Duo, et autres
Publié: (2025)
par: Wu, Duo, et autres
Publié: (2025)
Group Causal Policy Optimization for Post-Training Large Language Models
par: Gu, Ziyin, et autres
Publié: (2025)
par: Gu, Ziyin, et autres
Publié: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
par: Zhou, Yuyan, et autres
Publié: (2026)
par: Zhou, Yuyan, et autres
Publié: (2026)
Self-Supervised On-Policy Distillation for Reasoning Language Models
par: Tan, Zhiquan, et autres
Publié: (2026)
par: Tan, Zhiquan, et autres
Publié: (2026)
Evolutionary Computation in the Era of Large Language Model: Survey and Roadmap
par: Wu, Xingyu, et autres
Publié: (2024)
par: Wu, Xingyu, et autres
Publié: (2024)
Infeasibility Aware Large Language Models for Combinatorial Optimization
par: Wang, Yakun, et autres
Publié: (2026)
par: Wang, Yakun, et autres
Publié: (2026)
Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning
par: Chen, Haoxuan, et autres
Publié: (2026)
par: Chen, Haoxuan, et autres
Publié: (2026)
A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth
par: Xu, Mingyuan, et autres
Publié: (2026)
par: Xu, Mingyuan, et autres
Publié: (2026)
DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
par: Zhao, Siyan, et autres
Publié: (2025)
par: Zhao, Siyan, et autres
Publié: (2025)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
par: Chen, Yuanteng, et autres
Publié: (2025)
par: Chen, Yuanteng, et autres
Publié: (2025)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
par: Huang, Chengyu, et autres
Publié: (2025)
par: Huang, Chengyu, et autres
Publié: (2025)
Clipping-Free Policy Optimization for Large Language Models
par: Çağatan, Ömer Veysel, et autres
Publié: (2026)
par: Çağatan, Ömer Veysel, et autres
Publié: (2026)
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
par: Ding, Yuyang, et autres
Publié: (2025)
par: Ding, Yuyang, et autres
Publié: (2025)
GAST: Gradient-aligned Sparse Tuning of Large Language Models with Data-layer Selection
par: Yao, Kai, et autres
Publié: (2026)
par: Yao, Kai, et autres
Publié: (2026)
PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation
par: Luong, Hoang-Chau, et autres
Publié: (2026)
par: Luong, Hoang-Chau, et autres
Publié: (2026)
How Multimodal Integration Boost the Performance of LLM for Optimization: Case Study on Capacitated Vehicle Routing Problems
par: Huang, Yuxiao, et autres
Publié: (2024)
par: Huang, Yuxiao, et autres
Publié: (2024)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
par: Jiang, Bingqing, et autres
Publié: (2026)
par: Jiang, Bingqing, et autres
Publié: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
par: Zhao, Siyan, et autres
Publié: (2026)
par: Zhao, Siyan, et autres
Publié: (2026)
Optimization Hyper-parameter Laws for Large Language Models
par: Xie, Xingyu, et autres
Publié: (2024)
par: Xie, Xingyu, et autres
Publié: (2024)
Self-Generative Adversarial Fine-Tuning for Large Language Models
par: Wu, Shiguang, et autres
Publié: (2026)
par: Wu, Shiguang, et autres
Publié: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models
par: Qiu, Le, et autres
Publié: (2025)
par: Qiu, Le, et autres
Publié: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
par: Rojas, Kevin, et autres
Publié: (2025)
par: Rojas, Kevin, et autres
Publié: (2025)
Documents similaires
-
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
par: Wu, Xingyu, et autres
Publié: (2023) -
LLM Cannot Discover Causality, and Should Be Restricted to Non-Decisional Support in Causal Discovery
par: Wu, Xingyu, et autres
Publié: (2025) -
HM3: Hierarchical Multi-Objective Model Merging for Pretrained Models
par: Zhou, Yu, et autres
Publié: (2024) -
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
par: Yao, Jian, et autres
Publié: (2025) -
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
par: Qiu, Haiyun, et autres
Publié: (2026)