Diversity-Aware Policy Optimization for Large Language Model Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yao, Jian, Cheng, Ran, Wu, Xingyu, Wu, Jibin, Tan, Kay Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
por: Wu, Xingyu, et al.
Publicado: (2023)
por: Wu, Xingyu, et al.
Publicado: (2023)
LLM Cannot Discover Causality, and Should Be Restricted to Non-Decisional Support in Causal Discovery
por: Wu, Xingyu, et al.
Publicado: (2025)
por: Wu, Xingyu, et al.
Publicado: (2025)
HM3: Hierarchical Multi-Objective Model Merging for Pretrained Models
por: Zhou, Yu, et al.
Publicado: (2024)
por: Zhou, Yu, et al.
Publicado: (2024)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
por: Yao, Jian, et al.
Publicado: (2025)
por: Yao, Jian, et al.
Publicado: (2025)
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
por: Qiu, Haiyun, et al.
Publicado: (2026)
por: Qiu, Haiyun, et al.
Publicado: (2026)
CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs
por: Zhou, Yu, et al.
Publicado: (2024)
por: Zhou, Yu, et al.
Publicado: (2024)
Unlock the Power of Algorithm Features: A Generalization Analysis for Algorithm Selection
por: Wu, Xingyu, et al.
Publicado: (2024)
por: Wu, Xingyu, et al.
Publicado: (2024)
$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
por: Chen, Xianwei, et al.
Publicado: (2026)
por: Chen, Xianwei, et al.
Publicado: (2026)
Design Principle Transfer in Neural Architecture Search via Large Language Models
por: Zhou, Xun, et al.
Publicado: (2024)
por: Zhou, Xun, et al.
Publicado: (2024)
Exploring the True Potential: Evaluating the Black-box Optimization Capability of Large Language Models
por: Huang, Beichen, et al.
Publicado: (2024)
por: Huang, Beichen, et al.
Publicado: (2024)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
por: Zhang, Shimin, et al.
Publicado: (2025)
por: Zhang, Shimin, et al.
Publicado: (2025)
Fine-Grained Model Merging via Modular Expert Recombination
por: Qiu, Haiyun, et al.
Publicado: (2026)
por: Qiu, Haiyun, et al.
Publicado: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
por: Wang, Ziqi, et al.
Publicado: (2026)
por: Wang, Ziqi, et al.
Publicado: (2026)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
por: Wang, Ruhan, et al.
Publicado: (2026)
por: Wang, Ruhan, et al.
Publicado: (2026)
Scaling Supervised Local Learning with Augmented Auxiliary Networks
por: Ma, Chenxiang, et al.
Publicado: (2024)
por: Ma, Chenxiang, et al.
Publicado: (2024)
Large Language Models as Generalist Policies for Network Optimization
por: Wu, Duo, et al.
Publicado: (2025)
por: Wu, Duo, et al.
Publicado: (2025)
Group Causal Policy Optimization for Post-Training Large Language Models
por: Gu, Ziyin, et al.
Publicado: (2025)
por: Gu, Ziyin, et al.
Publicado: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
por: Zhou, Yuyan, et al.
Publicado: (2026)
por: Zhou, Yuyan, et al.
Publicado: (2026)
Self-Supervised On-Policy Distillation for Reasoning Language Models
por: Tan, Zhiquan, et al.
Publicado: (2026)
por: Tan, Zhiquan, et al.
Publicado: (2026)
Evolutionary Computation in the Era of Large Language Model: Survey and Roadmap
por: Wu, Xingyu, et al.
Publicado: (2024)
por: Wu, Xingyu, et al.
Publicado: (2024)
Infeasibility Aware Large Language Models for Combinatorial Optimization
por: Wang, Yakun, et al.
Publicado: (2026)
por: Wang, Yakun, et al.
Publicado: (2026)
Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning
por: Chen, Haoxuan, et al.
Publicado: (2026)
por: Chen, Haoxuan, et al.
Publicado: (2026)
A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth
por: Xu, Mingyuan, et al.
Publicado: (2026)
por: Xu, Mingyuan, et al.
Publicado: (2026)
DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2025)
por: Zhao, Siyan, et al.
Publicado: (2025)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
por: Chen, Yuanteng, et al.
Publicado: (2025)
por: Chen, Yuanteng, et al.
Publicado: (2025)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Clipping-Free Policy Optimization for Large Language Models
por: Çağatan, Ömer Veysel, et al.
Publicado: (2026)
por: Çağatan, Ömer Veysel, et al.
Publicado: (2026)
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
por: Ding, Yuyang, et al.
Publicado: (2025)
por: Ding, Yuyang, et al.
Publicado: (2025)
GAST: Gradient-aligned Sparse Tuning of Large Language Models with Data-layer Selection
por: Yao, Kai, et al.
Publicado: (2026)
por: Yao, Kai, et al.
Publicado: (2026)
PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
Diversity-Aware Reverse Kullback-Leibler Divergence for Large Language Model Distillation
por: Luong, Hoang-Chau, et al.
Publicado: (2026)
por: Luong, Hoang-Chau, et al.
Publicado: (2026)
How Multimodal Integration Boost the Performance of LLM for Optimization: Case Study on Capacitated Vehicle Routing Problems
por: Huang, Yuxiao, et al.
Publicado: (2024)
por: Huang, Yuxiao, et al.
Publicado: (2024)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2026)
por: Zhao, Siyan, et al.
Publicado: (2026)
Optimization Hyper-parameter Laws for Large Language Models
por: Xie, Xingyu, et al.
Publicado: (2024)
por: Xie, Xingyu, et al.
Publicado: (2024)
Self-Generative Adversarial Fine-Tuning for Large Language Models
por: Wu, Shiguang, et al.
Publicado: (2026)
por: Wu, Shiguang, et al.
Publicado: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models
por: Qiu, Le, et al.
Publicado: (2025)
por: Qiu, Le, et al.
Publicado: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Ejemplares similares
-
Large Language Model-Enhanced Algorithm Selection: Towards Comprehensive Algorithm Representation
por: Wu, Xingyu, et al.
Publicado: (2023) -
LLM Cannot Discover Causality, and Should Be Restricted to Non-Decisional Support in Causal Discovery
por: Wu, Xingyu, et al.
Publicado: (2025) -
HM3: Hierarchical Multi-Objective Model Merging for Pretrained Models
por: Zhou, Yu, et al.
Publicado: (2024) -
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
por: Yao, Jian, et al.
Publicado: (2025) -
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
por: Qiu, Haiyun, et al.
Publicado: (2026)