StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Dou, Shihan, Liu, Yan, Jia, Haoxiang, Xiong, Limao, Zhou, Enyu, Shen, Wei, Shan, Junjie, Huang, Caishuang, Wang, Xiao, Fan, Xiaoran, Xi, Zhiheng, Zhou, Yuhao, Ji, Tao, Zheng, Rui, Zhang, Qi, Huang, Xuanjing, Gui, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)
di: Zheng, Rui, et al.
Pubblicazione: (2024)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
di: Dou, Shihan, et al.
Pubblicazione: (2023)
di: Dou, Shihan, et al.
Pubblicazione: (2023)
Steering LLMs via Scalable Interactive Oversight
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
di: Lin, Jiahang, et al.
Pubblicazione: (2026)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
CC2Vec: Combining Typed Tokens with Contrastive Learning for Effective Code Clone Detection
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Secrets of RLHF in Large Language Models Part II: Reward Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2024)
di: Wang, Binghai, et al.
Pubblicazione: (2024)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
di: Huang, Caishuang, et al.
Pubblicazione: (2026)
di: Huang, Caishuang, et al.
Pubblicazione: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
di: Bao, Rong, et al.
Pubblicazione: (2024)
di: Bao, Rong, et al.
Pubblicazione: (2024)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)
di: Liu, Boyang, et al.
Pubblicazione: (2025)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
di: Xu, Nuo, et al.
Pubblicazione: (2024)
di: Xu, Nuo, et al.
Pubblicazione: (2024)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing
di: Li, Shuo, et al.
Pubblicazione: (2026)
di: Li, Shuo, et al.
Pubblicazione: (2026)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024) -
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024) -
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024) -
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
di: Ye, Junjie, et al.
Pubblicazione: (2024) -
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)