Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Haoxuan, Liang, Tianming, Zheng, Wei-Shi, Hu, Jian-Fang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
Voltage Mode Winner-Take-All Circuit for Neuromorphic Systems
di: Zyarah, Abdullah M., et al.
Pubblicazione: (2025)
di: Zyarah, Abdullah M., et al.
Pubblicazione: (2025)
A Winner-Takes-All Mechanism for Event Generation
di: Huo, Yongkang, et al.
Pubblicazione: (2025)
di: Huo, Yongkang, et al.
Pubblicazione: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
k-Winners-Take-All Ensemble Neural Network
di: Agarap, Abien Fred, et al.
Pubblicazione: (2024)
di: Agarap, Abien Fred, et al.
Pubblicazione: (2024)
Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
DGPO: Discovering Multiple Strategies with Diversity-Guided Policy Optimization
di: Chen, Wentse, et al.
Pubblicazione: (2022)
di: Chen, Wentse, et al.
Pubblicazione: (2022)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
di: Li, Xuan, et al.
Pubblicazione: (2026)
di: Li, Xuan, et al.
Pubblicazione: (2026)
ReDit: Reward Dithering for Improved LLM Policy Optimization
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
di: Li, Changming, et al.
Pubblicazione: (2026)
di: Li, Changming, et al.
Pubblicazione: (2026)
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026)
di: Yuan, Rui, et al.
Pubblicazione: (2026)
SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning
di: Li, Chenyi, et al.
Pubblicazione: (2026)
di: Li, Chenyi, et al.
Pubblicazione: (2026)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
di: Li, Jiawei, et al.
Pubblicazione: (2024)
di: Li, Jiawei, et al.
Pubblicazione: (2024)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
HELENE: Hessian Layer-wise Clipping and Gradient Annealing for Accelerating Fine-tuning LLM with Zeroth-order Optimization
di: Zhao, Huaqin, et al.
Pubblicazione: (2024)
di: Zhao, Huaqin, et al.
Pubblicazione: (2024)
Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
di: Jiang, Jie, et al.
Pubblicazione: (2026)
di: Jiang, Jie, et al.
Pubblicazione: (2026)
Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking
di: Xu, Yang, et al.
Pubblicazione: (2026)
di: Xu, Yang, et al.
Pubblicazione: (2026)
Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
di: Bahlous-Boldi, Ryan, et al.
Pubblicazione: (2026)
Take a Step and Reconsider: Sequence Decoding for Self-Improved Neural Combinatorial Optimization
di: Pirnay, Jonathan, et al.
Pubblicazione: (2024)
di: Pirnay, Jonathan, et al.
Pubblicazione: (2024)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
di: Wang, Boxiao, et al.
Pubblicazione: (2026)
di: Wang, Boxiao, et al.
Pubblicazione: (2026)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
di: Lu, Wenquan, et al.
Pubblicazione: (2026)
di: Lu, Wenquan, et al.
Pubblicazione: (2026)
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
di: Wang, Dayu, et al.
Pubblicazione: (2026)
di: Wang, Dayu, et al.
Pubblicazione: (2026)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
di: Luo, Yu, et al.
Pubblicazione: (2026)
di: Luo, Yu, et al.
Pubblicazione: (2026)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
di: Lu, Jian
Pubblicazione: (2025)
di: Lu, Jian
Pubblicazione: (2025)
Is Diversity All You Need for Scalable Robotic Manipulation?
di: Shi, Modi, et al.
Pubblicazione: (2025)
di: Shi, Modi, et al.
Pubblicazione: (2025)
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Calibration-Aware Policy Optimization for Reasoning LLMs
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
Policy Guided Tree Search for Enhanced LLM Reasoning
di: Li, Yang
Pubblicazione: (2025)
di: Li, Yang
Pubblicazione: (2025)
Structural Reasoning Improves Molecular Understanding of LLM
di: Jang, Yunhui, et al.
Pubblicazione: (2024)
di: Jang, Yunhui, et al.
Pubblicazione: (2024)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
Aligning LLM agents with human learning and adjustment behavior: a dual agent approach
di: Liu, Tianming, et al.
Pubblicazione: (2025)
di: Liu, Tianming, et al.
Pubblicazione: (2025)
RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoning
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025) -
Voltage Mode Winner-Take-All Circuit for Neuromorphic Systems
di: Zyarah, Abdullah M., et al.
Pubblicazione: (2025) -
A Winner-Takes-All Mechanism for Event Generation
di: Huo, Yongkang, et al.
Pubblicazione: (2025) -
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025) -
k-Winners-Take-All Ensemble Neural Network
di: Agarap, Abien Fred, et al.
Pubblicazione: (2024)