MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Ekbote, Chanakya, Lingam, Vijay, Sanghavi, Sujay, Huan, Jun, Omidvar-Tehrani, Behrooz, Deoras, Anoop, Soatto, Stefano |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation
by: Guinet, Gauthier, et al.
Published: (2024)
by: Guinet, Gauthier, et al.
Published: (2024)
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
by: Lingam, Vijay, et al.
Published: (2026)
by: Lingam, Vijay, et al.
Published: (2026)
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
by: Dai, Wei, et al.
Published: (2025)
by: Dai, Wei, et al.
Published: (2025)
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
by: Liu, Linbo, et al.
Published: (2025)
by: Liu, Linbo, et al.
Published: (2025)
SCATR: Simple Calibrated Test-Time Ranking
by: Shyamal, Divya, et al.
Published: (2026)
by: Shyamal, Divya, et al.
Published: (2026)
Execution-Grounded Credit Assignment for GRPO in Code Generation
by: Kumar, Abhijit, et al.
Published: (2026)
by: Kumar, Abhijit, et al.
Published: (2026)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
by: He, Zhida, et al.
Published: (2026)
by: He, Zhida, et al.
Published: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
by: Savani, Yash, et al.
Published: (2026)
by: Savani, Yash, et al.
Published: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
by: Parthasarathi, Prasanna, et al.
Published: (2025)
by: Parthasarathi, Prasanna, et al.
Published: (2025)
Fewer Truncations Improve Language Modeling
by: Ding, Hantian, et al.
Published: (2024)
by: Ding, Hantian, et al.
Published: (2024)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
by: Monsefi, Amin Karimi, et al.
Published: (2026)
by: Monsefi, Amin Karimi, et al.
Published: (2026)
Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance
by: Che, Jiarui, et al.
Published: (2026)
by: Che, Jiarui, et al.
Published: (2026)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
by: Kim, Myeongsoo, et al.
Published: (2025)
by: Kim, Myeongsoo, et al.
Published: (2025)
Understanding the Emergence of Multimodal Representation Alignment
by: Tjandrasuwita, Megan, et al.
Published: (2025)
by: Tjandrasuwita, Megan, et al.
Published: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
by: Ding, Yifeng, et al.
Published: (2025)
by: Ding, Yifeng, et al.
Published: (2025)
Context-Free Synthetic Data Mitigates Forgetting
by: Bansal, Parikshit, et al.
Published: (2025)
by: Bansal, Parikshit, et al.
Published: (2025)
Enabling Approximate Joint Sampling in Diffusion LMs
by: Bansal, Parikshit, et al.
Published: (2025)
by: Bansal, Parikshit, et al.
Published: (2025)
TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback
by: Jana, Prithwish, et al.
Published: (2026)
by: Jana, Prithwish, et al.
Published: (2026)
Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
by: Davidson, Sam, et al.
Published: (2025)
by: Davidson, Sam, et al.
Published: (2025)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
by: Fang, Yangyi, et al.
Published: (2026)
by: Fang, Yangyi, et al.
Published: (2026)
Learning Mixtures of Experts with EM: A Mirror Descent Perspective
by: Fruytier, Quentin, et al.
Published: (2024)
by: Fruytier, Quentin, et al.
Published: (2024)
Geometric Median (GM) Matching for Robust Data Pruning
by: Acharya, Anish, et al.
Published: (2024)
by: Acharya, Anish, et al.
Published: (2024)
Understanding Self-Supervised Learning via Gaussian Mixture Models
by: Bansal, Parikshit, et al.
Published: (2024)
by: Bansal, Parikshit, et al.
Published: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
by: Kumar, Avinash, et al.
Published: (2025)
by: Kumar, Avinash, et al.
Published: (2025)
Test-Time Speculation
by: Kumar, Avinash, et al.
Published: (2026)
by: Kumar, Avinash, et al.
Published: (2026)
SVFT: Parameter-Efficient Fine-Tuning with Singular Vectors
by: Lingam, Vijay, et al.
Published: (2024)
by: Lingam, Vijay, et al.
Published: (2024)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
by: Tejaswi, Atula, et al.
Published: (2026)
by: Tejaswi, Atula, et al.
Published: (2026)
ContextWeaver: Selective and Dependency-Structured Memory Construction for LLM Agents
by: Wu, Yating, et al.
Published: (2026)
by: Wu, Yating, et al.
Published: (2026)
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
by: Chen, Wen-Tse, et al.
Published: (2026)
by: Chen, Wen-Tse, et al.
Published: (2026)
Lightweight reranking for language model generations
by: Jain, Siddhartha, et al.
Published: (2023)
by: Jain, Siddhartha, et al.
Published: (2023)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
by: Lee, Jaewoo, et al.
Published: (2025)
by: Lee, Jaewoo, et al.
Published: (2025)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
by: Hu, Senkang, et al.
Published: (2026)
by: Hu, Senkang, et al.
Published: (2026)
Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
Local to Global: Learning Dynamics and Effect of Initialization for Transformers
by: Makkuva, Ashok Vardhan, et al.
Published: (2024)
by: Makkuva, Ashok Vardhan, et al.
Published: (2024)
Towards Quantifying the Preconditioning Effect of Adam
by: Das, Rudrajit, et al.
Published: (2024)
by: Das, Rudrajit, et al.
Published: (2024)
RARe: Retrieval Augmented Retrieval with In-Context Examples
by: Tejaswi, Atula, et al.
Published: (2024)
by: Tejaswi, Atula, et al.
Published: (2024)
Blocking Bandits
by: Basu, Soumya, et al.
Published: (2019)
by: Basu, Soumya, et al.
Published: (2019)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
by: Low, Siow Meng, et al.
Published: (2025)
by: Low, Siow Meng, et al.
Published: (2025)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
by: Liang, Yongheng, et al.
Published: (2024)
by: Liang, Yongheng, et al.
Published: (2024)
Lossless Token Sequence Compression via Meta-Tokens
by: Harvill, John, et al.
Published: (2025)
by: Harvill, John, et al.
Published: (2025)
Similar Items
-
Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam Generation
by: Guinet, Gauthier, et al.
Published: (2024) -
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
by: Lingam, Vijay, et al.
Published: (2026) -
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
by: Dai, Wei, et al.
Published: (2025) -
MigrationBench: Repository-Level Code Migration Benchmark from Java 8
by: Liu, Linbo, et al.
Published: (2025) -
SCATR: Simple Calibrated Test-Time Ranking
by: Shyamal, Divya, et al.
Published: (2026)