Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yilong, Banerjee, Suman, Che, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
par: Walder, Christian, et autres
Publié: (2025)
par: Walder, Christian, et autres
Publié: (2025)
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning
par: Zhang, Di, et autres
Publié: (2024)
par: Zhang, Di, et autres
Publié: (2024)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
par: Lyu, Shangke, et autres
Publié: (2025)
par: Lyu, Shangke, et autres
Publié: (2025)
Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
par: Asadulaev, Arip, et autres
Publié: (2025)
par: Asadulaev, Arip, et autres
Publié: (2025)
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
par: Guan, Xin, et autres
Publié: (2026)
par: Guan, Xin, et autres
Publié: (2026)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
par: Wu, Xingyu, et autres
Publié: (2025)
par: Wu, Xingyu, et autres
Publié: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
par: Ye, Wengao, et autres
Publié: (2025)
par: Ye, Wengao, et autres
Publié: (2025)
Towards Autonomous Agents: Adaptive-planning, Reasoning, and Acting in Language Models
par: Dutta, Abhishek, et autres
Publié: (2024)
par: Dutta, Abhishek, et autres
Publié: (2024)
Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes
par: Christ, Bryan R., et autres
Publié: (2024)
par: Christ, Bryan R., et autres
Publié: (2024)
CodeGraph: Enhancing Graph Reasoning of LLMs with Code
par: Cai, Qiaolong, et autres
Publié: (2024)
par: Cai, Qiaolong, et autres
Publié: (2024)
Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices
par: Li, Yilong, et autres
Publié: (2025)
par: Li, Yilong, et autres
Publié: (2025)
CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction
par: Li, Junlong, et autres
Publié: (2025)
par: Li, Junlong, et autres
Publié: (2025)
Unveiling Reasoning Thresholds in Language Models: Scaling, Fine-Tuning, and Interpretability through Attention Maps
par: Hsiao, Yen-Che, et autres
Publié: (2025)
par: Hsiao, Yen-Che, et autres
Publié: (2025)
Fast Think-on-Graph: Wider, Deeper and Faster Reasoning of Large Language Model on Knowledge Graph
par: Liang, Xujian, et autres
Publié: (2025)
par: Liang, Xujian, et autres
Publié: (2025)
Causal Discovery and Counterfactual Reasoning to Optimize Persuasive Dialogue Policies
par: Zeng, Donghuo, et autres
Publié: (2025)
par: Zeng, Donghuo, et autres
Publié: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Calibrating Reasoning in Language Models with Internal Consistency
par: Xie, Zhihui, et autres
Publié: (2024)
par: Xie, Zhihui, et autres
Publié: (2024)
Code over Words: Overcoming Semantic Inertia via Code-Grounded Reasoning
par: Xu, Manjie, et autres
Publié: (2026)
par: Xu, Manjie, et autres
Publié: (2026)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
par: Lee, Zhicheng, et autres
Publié: (2025)
par: Lee, Zhicheng, et autres
Publié: (2025)
Eliciting Better Multilingual Structured Reasoning from LLMs through Code
par: Li, Bryan, et autres
Publié: (2024)
par: Li, Bryan, et autres
Publié: (2024)
Code Execution as Grounded Supervision for LLM Reasoning
par: Jung, Dongwon, et autres
Publié: (2025)
par: Jung, Dongwon, et autres
Publié: (2025)
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
EffiPair: Improving the Efficiency of LLM-generated Code with Relative Contrastive Feedback
par: Hajizadeh, Samira, et autres
Publié: (2026)
par: Hajizadeh, Samira, et autres
Publié: (2026)
Improving Language Model Reasoning with Self-motivated Learning
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
par: Chen, Qiguang, et autres
Publié: (2025)
par: Chen, Qiguang, et autres
Publié: (2025)
Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning
par: Wang, Jingjing, et autres
Publié: (2026)
par: Wang, Jingjing, et autres
Publié: (2026)
What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code
par: Zhao, Yuze, et autres
Publié: (2026)
par: Zhao, Yuze, et autres
Publié: (2026)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
Step-level Value Preference Optimization for Mathematical Reasoning
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
EVOR: Evolving Retrieval for Code Generation
par: Su, Hongjin, et autres
Publié: (2024)
par: Su, Hongjin, et autres
Publié: (2024)
LLMs are Superior Feedback Providers: Bootstrapping Reasoning for Lie Detection with Self-Generated Feedback
par: Banerjee, Tanushree, et autres
Publié: (2024)
par: Banerjee, Tanushree, et autres
Publié: (2024)
One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning
par: Goru, Ritesh, et autres
Publié: (2025)
par: Goru, Ritesh, et autres
Publié: (2025)
Iterative Reasoning Preference Optimization
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
Documents similaires
-
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
par: Walder, Christian, et autres
Publié: (2025) -
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning
par: Zhang, Di, et autres
Publié: (2024) -
Hierarchical Budget Policy Optimization for Adaptive Reasoning
par: Lyu, Shangke, et autres
Publié: (2025) -
Latent Reasoning in TRMs is Secretly a Policy Improvement Operator
par: Asadulaev, Arip, et autres
Publié: (2025) -
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
par: Guan, Xin, et autres
Publié: (2026)