Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Ruan, Chi, Jiang, Dongfu, Wang, Yubo, Chen, Wenhu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2026)
by: Ruan, Chi, et al.
Published: (2026)
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
ACECODER: Acing Coder RL via Automated Test-Case Synthesis
by: Zeng, Huaye, et al.
Published: (2025)
by: Zeng, Huaye, et al.
Published: (2025)
RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation
by: Zhou, Changzhi, et al.
Published: (2025)
by: Zhou, Changzhi, et al.
Published: (2025)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
State-of-the-art Small Language Coder Model: Mify-Coder
by: Parmar, Abhinav, et al.
Published: (2025)
by: Parmar, Abhinav, et al.
Published: (2025)
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
by: Wang, Yinjie, et al.
Published: (2025)
by: Wang, Yinjie, et al.
Published: (2025)
The Critique of Critique
by: Sun, Shichao, et al.
Published: (2024)
by: Sun, Shichao, et al.
Published: (2024)
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation
by: Ni, Yuansheng, et al.
Published: (2025)
by: Ni, Yuansheng, et al.
Published: (2025)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
by: Li, Yansi, et al.
Published: (2025)
by: Li, Yansi, et al.
Published: (2025)
KAT-Coder Technical Report
by: Zhan, Zizheng, et al.
Published: (2025)
by: Zhan, Zizheng, et al.
Published: (2025)
$\mathcal{B}$-Coder: Value-Based Deep Reinforcement Learning for Program Synthesis
by: Yu, Zishun, et al.
Published: (2023)
by: Yu, Zishun, et al.
Published: (2023)
JumpCoder: Go Beyond Autoregressive Coder via Online Modification
by: Chen, Mouxiang, et al.
Published: (2024)
by: Chen, Mouxiang, et al.
Published: (2024)
Teaching Language Models to Critique via Reinforcement Learning
by: Xie, Zhihui, et al.
Published: (2025)
by: Xie, Zhihui, et al.
Published: (2025)
VisCoder2: Building Multi-Language Visualization Coding Agents
by: Ni, Yuansheng, et al.
Published: (2025)
by: Ni, Yuansheng, et al.
Published: (2025)
Qwen3-Coder-Next Technical Report
by: Cao, Ruisheng, et al.
Published: (2026)
by: Cao, Ruisheng, et al.
Published: (2026)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
by: Dou, Shihan, et al.
Published: (2024)
by: Dou, Shihan, et al.
Published: (2024)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
by: Cao, Meng, et al.
Published: (2024)
by: Cao, Meng, et al.
Published: (2024)
TreeCoders: Trees of Transformers
by: D'Istria, Pierre Colonna, et al.
Published: (2024)
by: D'Istria, Pierre Colonna, et al.
Published: (2024)
Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning
by: Zhu, Chenghao, et al.
Published: (2025)
by: Zhu, Chenghao, et al.
Published: (2025)
Dream-Coder 7B: An Open Diffusion Language Model for Code
by: Xie, Zhihui, et al.
Published: (2025)
by: Xie, Zhihui, et al.
Published: (2025)
KAT-Coder-V2 Technical Report
by: Li, Fengxiang, et al.
Published: (2026)
by: Li, Fengxiang, et al.
Published: (2026)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
by: Ke, Pei, et al.
Published: (2023)
by: Ke, Pei, et al.
Published: (2023)
Qwen2.5-Coder Technical Report
by: Hui, Binyuan, et al.
Published: (2024)
by: Hui, Binyuan, et al.
Published: (2024)
WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models
by: Feng, Huawen, et al.
Published: (2024)
by: Feng, Huawen, et al.
Published: (2024)
SuperCoder: Assembly Program Superoptimization with Large Language Models
by: Wei, Anjiang, et al.
Published: (2025)
by: Wei, Anjiang, et al.
Published: (2025)
Improving Reward Models with Synthetic Critiques
by: Ye, Zihuiwen, et al.
Published: (2024)
by: Ye, Zihuiwen, et al.
Published: (2024)
Seed-Coder: Let the Code Model Curate Data for Itself
by: Seed, ByteDance, et al.
Published: (2025)
by: Seed, ByteDance, et al.
Published: (2025)
OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
by: Huang, Siming, et al.
Published: (2024)
by: Huang, Siming, et al.
Published: (2024)
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
by: Luo, Ziyang, et al.
Published: (2023)
by: Luo, Ziyang, et al.
Published: (2023)
EpiCoder: Encompassing Diversity and Complexity in Code Generation
by: Wang, Yaoxiang, et al.
Published: (2025)
by: Wang, Yaoxiang, et al.
Published: (2025)
ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code Generation
by: Ren, Houxing, et al.
Published: (2024)
by: Ren, Houxing, et al.
Published: (2024)
Training Language Model to Critique for Better Refinement
by: Yu, Tianshu, et al.
Published: (2025)
by: Yu, Tianshu, et al.
Published: (2025)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
by: Jiang, Juyong, et al.
Published: (2026)
by: Jiang, Juyong, et al.
Published: (2026)
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
by: Gong, Shansan, et al.
Published: (2025)
by: Gong, Shansan, et al.
Published: (2025)
Critiques of World Models
by: Xing, Eric, et al.
Published: (2025)
by: Xing, Eric, et al.
Published: (2025)
Training Language Models to Critique With Multi-agent Feedback
by: Lan, Tian, et al.
Published: (2024)
by: Lan, Tian, et al.
Published: (2024)
Beyond Query-Level Comparison: Fine-Grained Reinforcement Learning for Text-to-SQL with Automated Interpretable Critiques
by: Wang, Guifeng, et al.
Published: (2025)
by: Wang, Guifeng, et al.
Published: (2025)
UniCoder: Scaling Code Large Language Model via Universal Code
by: Sun, Tao, et al.
Published: (2024)
by: Sun, Tao, et al.
Published: (2024)
Similar Items
-
EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2026) -
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
by: Wang, Yubo, et al.
Published: (2025) -
ACECODER: Acing Coder RL via Automated Test-Case Synthesis
by: Zeng, Huaye, et al.
Published: (2025) -
RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation
by: Zhou, Changzhi, et al.
Published: (2025) -
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
by: Wang, Yubo, et al.
Published: (2025)