DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Speed, Cai, Jianwei, Chen, Guang, Wu, Lulu, Yang, Saiyong, Zhou, Wiggin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards
por: Zhu, Yuxuan, et al.
Publicado: (2026)
por: Zhu, Yuxuan, et al.
Publicado: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
por: Tang, Xinyu, et al.
Publicado: (2025)
por: Tang, Xinyu, et al.
Publicado: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
por: Wang, Longwen, et al.
Publicado: (2026)
por: Wang, Longwen, et al.
Publicado: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
por: Cai, Xin-Qiang, et al.
Publicado: (2025)
por: Cai, Xin-Qiang, et al.
Publicado: (2025)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
por: Zeng, Guanning, et al.
Publicado: (2025)
por: Zeng, Guanning, et al.
Publicado: (2025)
Some Best Practices in Operator Learning
por: Enyeart, Dustin, et al.
Publicado: (2024)
por: Enyeart, Dustin, et al.
Publicado: (2024)
CLEVER: A Curated Benchmark for Formally Verified Code Generation
por: Thakur, Amitayush, et al.
Publicado: (2025)
por: Thakur, Amitayush, et al.
Publicado: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
por: Lu, Xiaodong, et al.
Publicado: (2026)
por: Lu, Xiaodong, et al.
Publicado: (2026)
Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data
por: Tang, Yunhao, et al.
Publicado: (2025)
por: Tang, Yunhao, et al.
Publicado: (2025)
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
por: Wu, Yongliang, et al.
Publicado: (2025)
por: Wu, Yongliang, et al.
Publicado: (2025)
Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards
por: Heckel, Reinhard, et al.
Publicado: (2026)
por: Heckel, Reinhard, et al.
Publicado: (2026)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
por: Zhang, Xin, et al.
Publicado: (2026)
por: Zhang, Xin, et al.
Publicado: (2026)
Code as Reward: Empowering Reinforcement Learning with VLMs
por: Venuto, David, et al.
Publicado: (2024)
por: Venuto, David, et al.
Publicado: (2024)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
por: Huang, Guanhua, et al.
Publicado: (2025)
por: Huang, Guanhua, et al.
Publicado: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
por: Gunjal, Anisha, et al.
Publicado: (2025)
por: Gunjal, Anisha, et al.
Publicado: (2025)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
por: Zhang, Kaiyi, et al.
Publicado: (2026)
por: Zhang, Kaiyi, et al.
Publicado: (2026)
Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs
por: Alam, Md Tanvirul, et al.
Publicado: (2026)
por: Alam, Md Tanvirul, et al.
Publicado: (2026)
VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation
por: Xie, Zichen, et al.
Publicado: (2026)
por: Xie, Zichen, et al.
Publicado: (2026)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
por: Jolfaei, Erfan Aghadavoodi, et al.
Publicado: (2026)
por: Jolfaei, Erfan Aghadavoodi, et al.
Publicado: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
por: Nguyen, Hieu Trung, et al.
Publicado: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
por: Stojanovski, Zafir, et al.
Publicado: (2025)
por: Stojanovski, Zafir, et al.
Publicado: (2025)
DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning
por: Liu, Xirui, et al.
Publicado: (2026)
por: Liu, Xirui, et al.
Publicado: (2026)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
por: Fan, Lishui, et al.
Publicado: (2025)
por: Fan, Lishui, et al.
Publicado: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
por: Yoon, Deokgyu, et al.
Publicado: (2026)
por: Yoon, Deokgyu, et al.
Publicado: (2026)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
por: Hu, Haoyu, et al.
Publicado: (2026)
por: Hu, Haoyu, et al.
Publicado: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
por: Mroueh, Youssef
Publicado: (2025)
por: Mroueh, Youssef
Publicado: (2025)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
por: Li, Xin-Ye, et al.
Publicado: (2026)
por: Li, Xin-Ye, et al.
Publicado: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026)
por: Ma, Zhengzhao, et al.
Publicado: (2026)
The Distributional Reward Critic Framework for Reinforcement Learning Under Perturbed Rewards
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Reinforcement Learning from Bagged Reward
por: Tang, Yuting, et al.
Publicado: (2024)
por: Tang, Yuting, et al.
Publicado: (2024)
Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning
por: Zhou, Qin, et al.
Publicado: (2026)
por: Zhou, Qin, et al.
Publicado: (2026)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2025)
por: Sinha, Sanchit, et al.
Publicado: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
por: Wang, Zhen, et al.
Publicado: (2025)
por: Wang, Zhen, et al.
Publicado: (2025)
Ejemplares similares
-
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025) -
Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards
por: Zhu, Yuxuan, et al.
Publicado: (2026) -
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026) -
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
por: Tang, Xinyu, et al.
Publicado: (2025) -
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
por: Wang, Longwen, et al.
Publicado: (2026)