Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Panaganti, Kishan, Liang, Zhenwen, Yu, Wenhao, Mi, Haitao, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
por: Shi, Yucheng, et al.
Publicado: (2026)
por: Shi, Yucheng, et al.
Publicado: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
por: Yu, Dian, et al.
Publicado: (2025)
por: Yu, Dian, et al.
Publicado: (2025)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
por: Zhou, Yujun, et al.
Publicado: (2025)
por: Zhou, Yujun, et al.
Publicado: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2025)
por: Huang, Chengsong, et al.
Publicado: (2025)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
por: Yue, Murong, et al.
Publicado: (2024)
por: Yue, Murong, et al.
Publicado: (2024)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
por: Xu, Zaiyan, et al.
Publicado: (2025)
por: Xu, Zaiyan, et al.
Publicado: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
por: Deng, Wenhao, et al.
Publicado: (2025)
por: Deng, Wenhao, et al.
Publicado: (2025)
LiteSearch: Efficacious Tree Search for LLM
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
por: Liu, Qihao, et al.
Publicado: (2025)
por: Liu, Qihao, et al.
Publicado: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
por: Zhang, Ziyin, et al.
Publicado: (2025)
por: Zhang, Ziyin, et al.
Publicado: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
por: Zhang, Xichen, et al.
Publicado: (2025)
por: Zhang, Xichen, et al.
Publicado: (2025)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
por: Wang, Huaijie, et al.
Publicado: (2024)
por: Wang, Huaijie, et al.
Publicado: (2024)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
por: Liu, Haolin, et al.
Publicado: (2026)
por: Liu, Haolin, et al.
Publicado: (2026)
Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
por: Ganguly, Sourav, et al.
Publicado: (2025)
por: Ganguly, Sourav, et al.
Publicado: (2025)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
por: Parashar, Shubham, et al.
Publicado: (2025)
por: Parashar, Shubham, et al.
Publicado: (2025)
Distributionally Robust Reinforcement Learning with Human Feedback
por: Mandal, Debmalya, et al.
Publicado: (2025)
por: Mandal, Debmalya, et al.
Publicado: (2025)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
por: Hao, Bingguang, et al.
Publicado: (2025)
por: Hao, Bingguang, et al.
Publicado: (2025)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
por: Zhong, Tianle, et al.
Publicado: (2026)
por: Zhong, Tianle, et al.
Publicado: (2026)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
por: Lee, Yu-Ang, et al.
Publicado: (2026)
por: Lee, Yu-Ang, et al.
Publicado: (2026)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
por: Zhang, Yuheng, et al.
Publicado: (2024)
por: Zhang, Yuheng, et al.
Publicado: (2024)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
por: Park, Jungsoo, et al.
Publicado: (2026)
por: Park, Jungsoo, et al.
Publicado: (2026)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
por: Wang, Shenzhi, et al.
Publicado: (2025)
por: Wang, Shenzhi, et al.
Publicado: (2025)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
por: Yu, Yongcan, et al.
Publicado: (2026)
por: Yu, Yongcan, et al.
Publicado: (2026)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
por: Luo, Haozheng, et al.
Publicado: (2026)
por: Luo, Haozheng, et al.
Publicado: (2026)
ReDit: Reward Dithering for Improved LLM Policy Optimization
por: Wei, Chenxing, et al.
Publicado: (2025)
por: Wei, Chenxing, et al.
Publicado: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
por: Jiang, Xitai, et al.
Publicado: (2026)
por: Jiang, Xitai, et al.
Publicado: (2026)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective
por: Cheng, Zhoujun, et al.
Publicado: (2025)
por: Cheng, Zhoujun, et al.
Publicado: (2025)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
por: Guo, Yiran, et al.
Publicado: (2026)
por: Guo, Yiran, et al.
Publicado: (2026)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
por: Xu, Hongling, et al.
Publicado: (2025)
por: Xu, Hongling, et al.
Publicado: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
Reinforce LLM Reasoning through Multi-Agent Reflection
por: Yuan, Yurun, et al.
Publicado: (2025)
por: Yuan, Yurun, et al.
Publicado: (2025)
Ejemplares similares
-
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
por: Liang, Zhenwen, et al.
Publicado: (2025) -
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025) -
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025) -
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
por: Shi, Yucheng, et al.
Publicado: (2026) -
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)