A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
Fuente:
arXiv
Guardado en:
| Autores principales: | Sancaktar, Cansu, Zhang, David, Synnaeve, Gabriel, Cohen, Taco |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
por: Zheng, Kunhao, et al.
Publicado: (2026)
por: Zheng, Kunhao, et al.
Publicado: (2026)
Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies
por: Chen, Jiaqi, et al.
Publicado: (2025)
por: Chen, Jiaqi, et al.
Publicado: (2025)
Hybrid Training for Vision-Language-Action Models
por: Mazzaglia, Pietro, et al.
Publicado: (2025)
por: Mazzaglia, Pietro, et al.
Publicado: (2025)
Euclidean, Projective, Conformal: Choosing a Geometric Algebra for Equivariant Transformers
por: de Haan, Pim, et al.
Publicado: (2023)
por: de Haan, Pim, et al.
Publicado: (2023)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training
por: Lin, Jinhong, et al.
Publicado: (2026)
por: Lin, Jinhong, et al.
Publicado: (2026)
CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution
por: Gu, Alex, et al.
Publicado: (2024)
por: Gu, Alex, et al.
Publicado: (2024)
Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
por: Goldie, Anna, et al.
Publicado: (2025)
por: Goldie, Anna, et al.
Publicado: (2025)
Mixtures of Experts Unlock Parameter Scaling for Deep RL
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
por: Obando-Ceron, Johan, et al.
Publicado: (2024)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
por: Wei, Yuxiang, et al.
Publicado: (2025)
por: Wei, Yuxiang, et al.
Publicado: (2025)
Synthetic Data RL: Task Definition Is All You Need
por: Guo, Yiduo, et al.
Publicado: (2025)
por: Guo, Yiduo, et al.
Publicado: (2025)
Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
por: Du, Weihua, et al.
Publicado: (2025)
por: Du, Weihua, et al.
Publicado: (2025)
Thermodynamics of Reinforcement Learning Curricula
por: Adamczyk, Jacob, et al.
Publicado: (2026)
por: Adamczyk, Jacob, et al.
Publicado: (2026)
Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data
por: Ran-Milo, Yuval, et al.
Publicado: (2026)
por: Ran-Milo, Yuval, et al.
Publicado: (2026)
Towards a Neural Debugger for Python
por: Beck, Maximilian, et al.
Publicado: (2026)
por: Beck, Maximilian, et al.
Publicado: (2026)
CoScale-RL: Efficient Post-Training by Co-Scaling Data and Computation
por: Chen, Yutong, et al.
Publicado: (2026)
por: Chen, Yutong, et al.
Publicado: (2026)
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
por: Gehring, Jonas, et al.
Publicado: (2024)
por: Gehring, Jonas, et al.
Publicado: (2024)
Information-driven Affordance Discovery for Efficient Robotic Manipulation
por: Mazzaglia, Pietro, et al.
Publicado: (2024)
por: Mazzaglia, Pietro, et al.
Publicado: (2024)
Generating High-quality Privacy-preserving Synthetic Data
por: Yavo, David, et al.
Publicado: (2026)
por: Yavo, David, et al.
Publicado: (2026)
Deep RL With Information Constrained Policies: Generalization in Continuous Control
por: Malloy, Tailia, et al.
Publicado: (2020)
por: Malloy, Tailia, et al.
Publicado: (2020)
Synthetic Data in Education: Empirical Insights from Traditional Resampling and Deep Generative Models
por: Chinodakufa, Tapiwa Amion, et al.
Publicado: (2026)
por: Chinodakufa, Tapiwa Amion, et al.
Publicado: (2026)
Improving the Scaling Laws of Synthetic Data with Deliberate Practice
por: Askari-Hemmat, Reyhane, et al.
Publicado: (2025)
por: Askari-Hemmat, Reyhane, et al.
Publicado: (2025)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
por: Shi, Jiahe, et al.
Publicado: (2025)
por: Shi, Jiahe, et al.
Publicado: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
por: Zhang, Qiang, et al.
Publicado: (2026)
por: Zhang, Qiang, et al.
Publicado: (2026)
Lecture Notes on Linear Neural Networks: A Tale of Optimization and Generalization in Deep Learning
por: Cohen, Nadav, et al.
Publicado: (2024)
por: Cohen, Nadav, et al.
Publicado: (2024)
Scaling Test-Time Compute for Agentic Coding
por: Kim, Joongwon, et al.
Publicado: (2026)
por: Kim, Joongwon, et al.
Publicado: (2026)
Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures
por: Wang, Haohui, et al.
Publicado: (2025)
por: Wang, Haohui, et al.
Publicado: (2025)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
por: Dai, Weinan, et al.
Publicado: (2026)
por: Dai, Weinan, et al.
Publicado: (2026)
S*: Test Time Scaling for Code Generation
por: Li, Dacheng, et al.
Publicado: (2025)
por: Li, Dacheng, et al.
Publicado: (2025)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
por: Ilin, Aleksei, et al.
Publicado: (2025)
por: Ilin, Aleksei, et al.
Publicado: (2025)
Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era
por: Li, Dawei, et al.
Publicado: (2025)
por: Li, Dawei, et al.
Publicado: (2025)
GRAM: Generalization in Deep RL with a Robust Adaptation Module
por: Queeney, James, et al.
Publicado: (2024)
por: Queeney, James, et al.
Publicado: (2024)
Synthetic Data Generation for Augmenting Small Samples
por: Liu, Dan, et al.
Publicado: (2025)
por: Liu, Dan, et al.
Publicado: (2025)
Generating Synthetic Net Load Data with Physics-informed Diffusion Model
por: Zhang, Shaorong, et al.
Publicado: (2024)
por: Zhang, Shaorong, et al.
Publicado: (2024)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
por: Liu, Shaoteng, et al.
Publicado: (2024)
por: Liu, Shaoteng, et al.
Publicado: (2024)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
por: Feng, Yichen, et al.
Publicado: (2025)
por: Feng, Yichen, et al.
Publicado: (2025)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
por: Hübotter, Jonas, et al.
Publicado: (2025)
por: Hübotter, Jonas, et al.
Publicado: (2025)
GASP: Guided Asymmetric Self-Play For Coding LLMs
por: Jana, Swadesh, et al.
Publicado: (2026)
por: Jana, Swadesh, et al.
Publicado: (2026)
Synthetic Series-Symbol Data Generation for Time Series Foundation Models
por: Wang, Wenxuan, et al.
Publicado: (2025)
por: Wang, Wenxuan, et al.
Publicado: (2025)
Ejemplares similares
-
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025) -
Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
por: Zheng, Kunhao, et al.
Publicado: (2026) -
Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies
por: Chen, Jiaqi, et al.
Publicado: (2025) -
Hybrid Training for Vision-Language-Action Models
por: Mazzaglia, Pietro, et al.
Publicado: (2025) -
Euclidean, Projective, Conformal: Choosing a Geometric Algebra for Equivariant Transformers
por: de Haan, Pim, et al.
Publicado: (2023)