Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Longwen, Liu, Yirui, Wu, Xuan'er, Hu, Xiaohui, Fan, Yuankai, Yu, Kaidong, Weng, Qizhen, Xi, Wei, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Computation-Bandwidth-Memory Trade-offs: A Unified Paradigm for AI Infrastructure
par: Fan, Yuankai, et autres
Publié: (2025)
par: Fan, Yuankai, et autres
Publié: (2025)
TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation
par: Liang, Yuanzhi, et autres
Publié: (2026)
par: Liang, Yuanzhi, et autres
Publié: (2026)
Prompt-Level Reward Specifications for Open-Ended Post-Training
par: Weng, Zijun, et autres
Publié: (2026)
par: Weng, Zijun, et autres
Publié: (2026)
PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression
par: Qi, Ruoling, et autres
Publié: (2026)
par: Qi, Ruoling, et autres
Publié: (2026)
Improve LLM-as-a-Judge Ability as a General Ability
par: Yu, Jiachen, et autres
Publié: (2025)
par: Yu, Jiachen, et autres
Publié: (2025)
Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
par: He, Yinghui, et autres
Publié: (2026)
par: He, Yinghui, et autres
Publié: (2026)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
par: Jolfaei, Erfan Aghadavoodi, et autres
Publié: (2026)
par: Jolfaei, Erfan Aghadavoodi, et autres
Publié: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
par: Mroueh, Youssef
Publié: (2025)
par: Mroueh, Youssef
Publié: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
par: Fan, Lishui, et autres
Publié: (2025)
par: Fan, Lishui, et autres
Publié: (2025)
SecureCodeRL: Security-Aware Reinforcement Learning for Code Generation with Partial-Credit Rewards
par: Sijwali, Suryansh Singh, et autres
Publié: (2026)
par: Sijwali, Suryansh Singh, et autres
Publié: (2026)
Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering
par: Fan, Shicheng, et autres
Publié: (2026)
par: Fan, Shicheng, et autres
Publié: (2026)
DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generation
par: Zhu, Speed, et autres
Publié: (2025)
par: Zhu, Speed, et autres
Publié: (2025)
Video Models Can Reason with Verifiable Rewards
par: Zhu, Tinghui, et autres
Publié: (2026)
par: Zhu, Tinghui, et autres
Publié: (2026)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
Multi-Turn Code Generation Through Single-Step Rewards
par: Jain, Arnav Kumar, et autres
Publié: (2025)
par: Jain, Arnav Kumar, et autres
Publié: (2025)
On Reward Transferability in Adversarial Inverse Reinforcement Learning: Insights from Random Matrix Theory
par: Zhang, Yangchun, et autres
Publié: (2024)
par: Zhang, Yangchun, et autres
Publié: (2024)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
par: Huang, Jiawei, et autres
Publié: (2026)
par: Huang, Jiawei, et autres
Publié: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
par: Zhang, Feng, et autres
Publié: (2026)
par: Zhang, Feng, et autres
Publié: (2026)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
Estimating the Joint Distribution of Two Binary Variables with Marginal Statistics
par: Shang, Longwen, et autres
Publié: (2025)
par: Shang, Longwen, et autres
Publié: (2025)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
par: Cai, Xin-Qiang, et autres
Publié: (2025)
par: Cai, Xin-Qiang, et autres
Publié: (2025)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
par: Hu, Haoyu, et autres
Publié: (2026)
par: Hu, Haoyu, et autres
Publié: (2026)
Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation
par: Zou, Qingyun, et autres
Publié: (2026)
par: Zou, Qingyun, et autres
Publié: (2026)
Awakening Dormant Experts:Counterfactual Routing to Mitigate MoE Hallucinations
par: Hu, Wentao, et autres
Publié: (2026)
par: Hu, Wentao, et autres
Publié: (2026)
DLA-Count: Dynamic Label Assignment Network for Dense Cell Distribution Counting
par: Yan, Yuqing, et autres
Publié: (2025)
par: Yan, Yuqing, et autres
Publié: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
par: Liu, Xiaoyuan, et autres
Publié: (2025)
par: Liu, Xiaoyuan, et autres
Publié: (2025)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
par: Lara, Luis, et autres
Publié: (2026)
par: Lara, Luis, et autres
Publié: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Beyond Imitation: Recovering Dense Rewards from Demonstrations
par: Li, Jiangnan, et autres
Publié: (2025)
par: Li, Jiangnan, et autres
Publié: (2025)
Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies
par: Khanzada, Feeza Khan, et autres
Publié: (2025)
par: Khanzada, Feeza Khan, et autres
Publié: (2025)
Reinforced Embodied Planning with Verifiable Reward for Real-World Robotic Manipulation
par: Bo, Zitong, et autres
Publié: (2025)
par: Bo, Zitong, et autres
Publié: (2025)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
par: Liu, Yule, et autres
Publié: (2025)
par: Liu, Yule, et autres
Publié: (2025)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
par: Heckel, Reinhard, et autres
Publié: (2026)
par: Heckel, Reinhard, et autres
Publié: (2026)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)
par: Lu, Xiaodong, et autres
Publié: (2026)
Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards
par: Zhu, Yuxuan, et autres
Publié: (2026)
par: Zhu, Yuxuan, et autres
Publié: (2026)
Rethinking Adversarial Inverse Reinforcement Learning: Policy Imitation, Transferable Reward Recovery and Algebraic Equilibrium Proof
par: Zhang, Yangchun, et autres
Publié: (2024)
par: Zhang, Yangchun, et autres
Publié: (2024)
Documents similaires
-
Computation-Bandwidth-Memory Trade-offs: A Unified Paradigm for AI Infrastructure
par: Fan, Yuankai, et autres
Publié: (2025) -
TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation
par: Liang, Yuanzhi, et autres
Publié: (2026) -
Prompt-Level Reward Specifications for Open-Ended Post-Training
par: Weng, Zijun, et autres
Publié: (2026) -
PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
par: Zhang, Yang, et autres
Publié: (2026) -
Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression
par: Qi, Ruoling, et autres
Publié: (2026)