Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jia, Su, Yuxin, Peng, Ting, Huang, Hailiang, Deng, Yuetang, Lyu, Michael R. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
por: Yari, Amir Hossein, et al.
Publicado: (2026)
por: Yari, Amir Hossein, et al.
Publicado: (2026)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
por: Ekbote, Chanakya, et al.
Publicado: (2025)
por: Ekbote, Chanakya, et al.
Publicado: (2025)
iGRPO: Self-Feedback-Driven LLM Reasoning
por: Hatamizadeh, Ali, et al.
Publicado: (2026)
por: Hatamizadeh, Ali, et al.
Publicado: (2026)
Improving LLM-Generated Code Quality with GRPO
por: Robeyns, Maxime, et al.
Publicado: (2025)
por: Robeyns, Maxime, et al.
Publicado: (2025)
SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization
por: Su, Xiaole, et al.
Publicado: (2026)
por: Su, Xiaole, et al.
Publicado: (2026)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
por: Wang, Chaozheng, et al.
Publicado: (2024)
por: Wang, Chaozheng, et al.
Publicado: (2024)
DeepCode: Open Agentic Coding
por: Li, Zongwei, et al.
Publicado: (2025)
por: Li, Zongwei, et al.
Publicado: (2025)
Agentic Reinforcement Learning for Real-World Code Repair
por: Zhu, Siyu, et al.
Publicado: (2025)
por: Zhu, Siyu, et al.
Publicado: (2025)
RAG or Fine-tuning? A Comparative Study on LCMs-based Code Completion in Industry
por: Wang, Chaozheng, et al.
Publicado: (2025)
por: Wang, Chaozheng, et al.
Publicado: (2025)
A Deep Dive into Retrieval-Augmented Generation for Code Completion: Experience on WeChat
por: Yang, Zezhou, et al.
Publicado: (2025)
por: Yang, Zezhou, et al.
Publicado: (2025)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
por: Peng, Yun, et al.
Publicado: (2024)
por: Peng, Yun, et al.
Publicado: (2024)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
por: Zhang, Xiaoying, et al.
Publicado: (2025)
por: Zhang, Xiaoying, et al.
Publicado: (2025)
Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing
por: Wang, Chaozheng, et al.
Publicado: (2026)
por: Wang, Chaozheng, et al.
Publicado: (2026)
Enhancing LLM-Based Coding Tools through Native Integration of IDE-Derived Static Context
por: Li, Yichen, et al.
Publicado: (2024)
por: Li, Yichen, et al.
Publicado: (2024)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
por: Liu, Zhilin, et al.
Publicado: (2026)
por: Liu, Zhilin, et al.
Publicado: (2026)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
por: Chen, Minghan, et al.
Publicado: (2025)
por: Chen, Minghan, et al.
Publicado: (2025)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
por: Pennino, Federico, et al.
Publicado: (2025)
por: Pennino, Federico, et al.
Publicado: (2025)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
por: Liu, Henglin, et al.
Publicado: (2025)
por: Liu, Henglin, et al.
Publicado: (2025)
MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
por: Li, Junzhe, et al.
Publicado: (2025)
por: Li, Junzhe, et al.
Publicado: (2025)
Agentic Systems as Boosting Weak Reasoning Models
por: Sunkaraneni, Varun, et al.
Publicado: (2026)
por: Sunkaraneni, Varun, et al.
Publicado: (2026)
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
por: DeepReinforce Team, et al.
Publicado: (2026)
por: DeepReinforce Team, et al.
Publicado: (2026)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
por: Wu, Qingyuan, et al.
Publicado: (2026)
por: Wu, Qingyuan, et al.
Publicado: (2026)
MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
por: Liu, Simiao, et al.
Publicado: (2026)
por: Liu, Simiao, et al.
Publicado: (2026)
RAIDX: A Retrieval-Augmented Generation and GRPO Reinforcement Learning Framework for Explainable Deepfake Detection
por: Li, Tianxiao, et al.
Publicado: (2025)
por: Li, Tianxiao, et al.
Publicado: (2025)
GRPO is Secretly a Process Reward Model
por: Sullivan, Michael, et al.
Publicado: (2025)
por: Sullivan, Michael, et al.
Publicado: (2025)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
por: Lam, Man Ho, et al.
Publicado: (2025)
por: Lam, Man Ho, et al.
Publicado: (2025)
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
por: Jia, Weitao, et al.
Publicado: (2025)
por: Jia, Weitao, et al.
Publicado: (2025)
The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
por: Yang, Robert
Publicado: (2025)
por: Yang, Robert
Publicado: (2025)
Dialogue Model Optimization via Agent Game and Adaptive Tree-based GRPO
por: Peng, Kun, et al.
Publicado: (2026)
por: Peng, Kun, et al.
Publicado: (2026)
90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development
por: Yang, Runxin, et al.
Publicado: (2025)
por: Yang, Runxin, et al.
Publicado: (2025)
Learning to Reason from Feedback at Test-Time
por: Li, Yanyang, et al.
Publicado: (2025)
por: Li, Yanyang, et al.
Publicado: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
por: Wei, Kangda, et al.
Publicado: (2026)
por: Wei, Kangda, et al.
Publicado: (2026)
Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes
por: Bereket, Michael, et al.
Publicado: (2025)
por: Bereket, Michael, et al.
Publicado: (2025)
Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective
por: Chen, Meifang, et al.
Publicado: (2026)
por: Chen, Meifang, et al.
Publicado: (2026)
TRKT: Weakly Supervised Dynamic Scene Graph Generation with Temporal-enhanced Relation-aware Knowledge Transferring
por: Xu, Zhu, et al.
Publicado: (2025)
por: Xu, Zhu, et al.
Publicado: (2025)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
por: Zhu, Pengyu, et al.
Publicado: (2026)
por: Zhu, Pengyu, et al.
Publicado: (2026)
DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows
por: Yan, Yandong, et al.
Publicado: (2026)
por: Yan, Yandong, et al.
Publicado: (2026)
Ejemplares similares
-
From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level
por: Li, Jia, et al.
Publicado: (2026) -
ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair
por: Li, Jia, et al.
Publicado: (2026) -
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
por: Yari, Amir Hossein, et al.
Publicado: (2026) -
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
por: Ekbote, Chanakya, et al.
Publicado: (2025) -
iGRPO: Self-Feedback-Driven LLM Reasoning
por: Hatamizadeh, Ali, et al.
Publicado: (2026)