Execution-Grounded Credit Assignment for GRPO in Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Abhijit, Kumar, Natalya, Gupta, Shikhar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
par: Ekbote, Chanakya, et autres
Publié: (2025)
par: Ekbote, Chanakya, et autres
Publié: (2025)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
par: Savani, Yash, et autres
Publié: (2026)
par: Savani, Yash, et autres
Publié: (2026)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
par: Kumar, Abhijit, et autres
Publié: (2026)
par: Kumar, Abhijit, et autres
Publié: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
par: Khandoga, Mykola, et autres
Publié: (2026)
par: Khandoga, Mykola, et autres
Publié: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
par: Low, Siow Meng, et autres
Publié: (2025)
par: Low, Siow Meng, et autres
Publié: (2025)
Focus Where It Matters: Graph Selective State Focused Attention Networks
par: Vashistha, Shikhar, et autres
Publié: (2024)
par: Vashistha, Shikhar, et autres
Publié: (2024)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
par: Li, Ziheng, et autres
Publié: (2026)
par: Li, Ziheng, et autres
Publié: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
par: Yang, Matthew Y. R., et autres
Publié: (2026)
par: Yang, Matthew Y. R., et autres
Publié: (2026)
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents
par: Pang, Cong, et autres
Publié: (2026)
par: Pang, Cong, et autres
Publié: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
par: Auzina, Ilze Amanda, et autres
Publié: (2026)
par: Auzina, Ilze Amanda, et autres
Publié: (2026)
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
Deep Reinforcement Learning for Interference Suppression in RIS-Aided Space-Air-Ground Integrated Networks
par: Mamillapalli, Pujitha, et autres
Publié: (2026)
par: Mamillapalli, Pujitha, et autres
Publié: (2026)
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
par: Uzun, Mustafa, et autres
Publié: (2026)
par: Uzun, Mustafa, et autres
Publié: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
par: Tan, Hui-Ze, et autres
Publié: (2026)
par: Tan, Hui-Ze, et autres
Publié: (2026)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
par: Chen, Yanjun, et autres
Publié: (2026)
par: Chen, Yanjun, et autres
Publié: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
par: Xie, Guofu, et autres
Publié: (2025)
par: Xie, Guofu, et autres
Publié: (2025)
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
par: Chen, Wen-Tse, et autres
Publié: (2026)
par: Chen, Wen-Tse, et autres
Publié: (2026)
In-Context Credit Assignment via the Core
par: Harris, Keegan, et autres
Publié: (2026)
par: Harris, Keegan, et autres
Publié: (2026)
Cardinality-Preserving Attention Channels for Graph Transformers in Molecular Property Prediction
par: Gupta, Abhijit
Publié: (2026)
par: Gupta, Abhijit
Publié: (2026)
Forward Target Propagation: A Forward-Only Approach to Global Error Credit Assignment via Local Losses
par: As-Saquib, Nazmus Saadat, et autres
Publié: (2025)
par: As-Saquib, Nazmus Saadat, et autres
Publié: (2025)
RTMC: Step-Level Credit Assignment via Rollout Trees
par: Wang, Tao, et autres
Publié: (2026)
par: Wang, Tao, et autres
Publié: (2026)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
par: Mou, Chaoli, et autres
Publié: (2026)
par: Mou, Chaoli, et autres
Publié: (2026)
VinePPO: Refining Credit Assignment in RL Training of LLMs
par: Kazemnejad, Amirhossein, et autres
Publié: (2024)
par: Kazemnejad, Amirhossein, et autres
Publié: (2024)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
par: Ramesh, Aditya A., et autres
Publié: (2024)
par: Ramesh, Aditya A., et autres
Publié: (2024)
A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
par: Pignatelli, Eduardo, et autres
Publié: (2023)
par: Pignatelli, Eduardo, et autres
Publié: (2023)
CardiGraphormer: Unveiling the Power of Self-Supervised Learning in Revolutionizing Drug Discovery
par: Gupta, Abhijit
Publié: (2023)
par: Gupta, Abhijit
Publié: (2023)
Surprisal-Guided Selection: Compute-Optimal Test-Time Strategies for Execution-Grounded Code Generation
par: Barnes, Jarrod
Publié: (2026)
par: Barnes, Jarrod
Publié: (2026)
Credit Assignment via Neural Manifold Noise Correlation
par: Kang, Byungwoo, et autres
Publié: (2026)
par: Kang, Byungwoo, et autres
Publié: (2026)
COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams
par: Deshmukh, Shripad, et autres
Publié: (2026)
par: Deshmukh, Shripad, et autres
Publié: (2026)
Execution Guided Line-by-Line Code Generation
par: Lavon, Boaz, et autres
Publié: (2025)
par: Lavon, Boaz, et autres
Publié: (2025)
Credit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement Learning
par: Han, Shuai, et autres
Publié: (2025)
par: Han, Shuai, et autres
Publié: (2025)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
par: Lafuente-Mercado, Rodney
Publié: (2026)
par: Lafuente-Mercado, Rodney
Publié: (2026)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
par: Jin, Hongbo, et autres
Publié: (2026)
par: Jin, Hongbo, et autres
Publié: (2026)
MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment
par: Wang, Ziyan, et autres
Publié: (2023)
par: Wang, Ziyan, et autres
Publié: (2023)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
par: Gao, Xiancheng, et autres
Publié: (2025)
par: Gao, Xiancheng, et autres
Publié: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
par: Qu, Yun, et autres
Publié: (2024)
par: Qu, Yun, et autres
Publié: (2024)
ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?
par: Nangia, Ayush, et autres
Publié: (2026)
par: Nangia, Ayush, et autres
Publié: (2026)
Advances in GRPO for Generation Models: A Survey
par: Liu, Zexiang, et autres
Publié: (2026)
par: Liu, Zexiang, et autres
Publié: (2026)
Documents similaires
-
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
par: Ekbote, Chanakya, et autres
Publié: (2025) -
Stepwise Credit Assignment for GRPO on Flow-Matching Models
par: Savani, Yash, et autres
Publié: (2026) -
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
par: Kumar, Abhijit, et autres
Publié: (2026) -
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025) -
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
par: Khandoga, Mykola, et autres
Publié: (2026)