Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jia, Su, Yuxin, Peng, Ting, Huang, Hailiang, Deng, Yuetang, Lyu, Michael R. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026)
par: Yari, Amir Hossein, et autres
Publié: (2026)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
par: Ekbote, Chanakya, et autres
Publié: (2025)
par: Ekbote, Chanakya, et autres
Publié: (2025)
iGRPO: Self-Feedback-Driven LLM Reasoning
par: Hatamizadeh, Ali, et autres
Publié: (2026)
par: Hatamizadeh, Ali, et autres
Publié: (2026)
Improving LLM-Generated Code Quality with GRPO
par: Robeyns, Maxime, et autres
Publié: (2025)
par: Robeyns, Maxime, et autres
Publié: (2025)
SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization
par: Su, Xiaole, et autres
Publié: (2026)
par: Su, Xiaole, et autres
Publié: (2026)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
par: Wang, Chaozheng, et autres
Publié: (2024)
par: Wang, Chaozheng, et autres
Publié: (2024)
DeepCode: Open Agentic Coding
par: Li, Zongwei, et autres
Publié: (2025)
par: Li, Zongwei, et autres
Publié: (2025)
Agentic Reinforcement Learning for Real-World Code Repair
par: Zhu, Siyu, et autres
Publié: (2025)
par: Zhu, Siyu, et autres
Publié: (2025)
RAG or Fine-tuning? A Comparative Study on LCMs-based Code Completion in Industry
par: Wang, Chaozheng, et autres
Publié: (2025)
par: Wang, Chaozheng, et autres
Publié: (2025)
A Deep Dive into Retrieval-Augmented Generation for Code Completion: Experience on WeChat
par: Yang, Zezhou, et autres
Publié: (2025)
par: Yang, Zezhou, et autres
Publié: (2025)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
par: Zhang, Xiaoying, et autres
Publié: (2025)
par: Zhang, Xiaoying, et autres
Publié: (2025)
Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing
par: Wang, Chaozheng, et autres
Publié: (2026)
par: Wang, Chaozheng, et autres
Publié: (2026)
Enhancing LLM-Based Coding Tools through Native Integration of IDE-Derived Static Context
par: Li, Yichen, et autres
Publié: (2024)
par: Li, Yichen, et autres
Publié: (2024)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
par: Liu, Zhilin, et autres
Publié: (2026)
par: Liu, Zhilin, et autres
Publié: (2026)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
par: Chen, Minghan, et autres
Publié: (2025)
par: Chen, Minghan, et autres
Publié: (2025)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
par: Pennino, Federico, et autres
Publié: (2025)
par: Pennino, Federico, et autres
Publié: (2025)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
par: Li, Junzhe, et autres
Publié: (2025)
par: Li, Junzhe, et autres
Publié: (2025)
Agentic Systems as Boosting Weak Reasoning Models
par: Sunkaraneni, Varun, et autres
Publié: (2026)
par: Sunkaraneni, Varun, et autres
Publié: (2026)
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
par: DeepReinforce Team, et autres
Publié: (2026)
par: DeepReinforce Team, et autres
Publié: (2026)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
par: Wu, Qingyuan, et autres
Publié: (2026)
par: Wu, Qingyuan, et autres
Publié: (2026)
MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
par: Liu, Simiao, et autres
Publié: (2026)
par: Liu, Simiao, et autres
Publié: (2026)
RAIDX: A Retrieval-Augmented Generation and GRPO Reinforcement Learning Framework for Explainable Deepfake Detection
par: Li, Tianxiao, et autres
Publié: (2025)
par: Li, Tianxiao, et autres
Publié: (2025)
GRPO is Secretly a Process Reward Model
par: Sullivan, Michael, et autres
Publié: (2025)
par: Sullivan, Michael, et autres
Publié: (2025)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
par: Lam, Man Ho, et autres
Publié: (2025)
par: Lam, Man Ho, et autres
Publié: (2025)
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
par: Jia, Weitao, et autres
Publié: (2025)
par: Jia, Weitao, et autres
Publié: (2025)
The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
par: Yang, Robert
Publié: (2025)
par: Yang, Robert
Publié: (2025)
Dialogue Model Optimization via Agent Game and Adaptive Tree-based GRPO
par: Peng, Kun, et autres
Publié: (2026)
par: Peng, Kun, et autres
Publié: (2026)
90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development
par: Yang, Runxin, et autres
Publié: (2025)
par: Yang, Runxin, et autres
Publié: (2025)
Learning to Reason from Feedback at Test-Time
par: Li, Yanyang, et autres
Publié: (2025)
par: Li, Yanyang, et autres
Publié: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
par: Wei, Kangda, et autres
Publié: (2026)
par: Wei, Kangda, et autres
Publié: (2026)
Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes
par: Bereket, Michael, et autres
Publié: (2025)
par: Bereket, Michael, et autres
Publié: (2025)
Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective
par: Chen, Meifang, et autres
Publié: (2026)
par: Chen, Meifang, et autres
Publié: (2026)
TRKT: Weakly Supervised Dynamic Scene Graph Generation with Temporal-enhanced Relation-aware Knowledge Transferring
par: Xu, Zhu, et autres
Publié: (2025)
par: Xu, Zhu, et autres
Publié: (2025)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
par: Zhu, Pengyu, et autres
Publié: (2026)
par: Zhu, Pengyu, et autres
Publié: (2026)
DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows
par: Yan, Yandong, et autres
Publié: (2026)
par: Yan, Yandong, et autres
Publié: (2026)
Documents similaires
-
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
par: Li, Jia, et autres
Publié: (2026) -
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
par: Li, Jia, et autres
Publié: (2026) -
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026) -
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
par: Ekbote, Chanakya, et autres
Publié: (2025) -
iGRPO: Self-Feedback-Driven LLM Reasoning
par: Hatamizadeh, Ali, et autres
Publié: (2026)