GRPO-$λ$: Credit Assignment improves LLM Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Parthasarathi, Prasanna, Reymond, Mathieu, Chen, Boxing, Cui, Yufei, Chandar, Sarath |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
Towards Practical Tool Usage for Continually Learning LLMs
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
von: Huang, Jerry, et al.
Veröffentlicht: (2024)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
Squeezing More from the Stream : Learning Representation Online for Streaming Reinforcement Learning
von: Nilaksh, et al.
Veröffentlicht: (2026)
von: Nilaksh, et al.
Veröffentlicht: (2026)
Do Large Language Models Know How Much They Know?
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
Thinking Long, but Short: Stable Sequential Test-Time Scaling for Large Reasoning Models
von: Metel, Michael R., et al.
Veröffentlicht: (2026)
von: Metel, Michael R., et al.
Veröffentlicht: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
von: Savani, Yash, et al.
Veröffentlicht: (2026)
von: Savani, Yash, et al.
Veröffentlicht: (2026)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
von: Ekbote, Chanakya, et al.
Veröffentlicht: (2025)
von: Ekbote, Chanakya, et al.
Veröffentlicht: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
von: Li, Yu, et al.
Veröffentlicht: (2026)
von: Li, Yu, et al.
Veröffentlicht: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
von: Monsefi, Amin Karimi, et al.
Veröffentlicht: (2026)
von: Monsefi, Amin Karimi, et al.
Veröffentlicht: (2026)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
von: Chen, Yanjun, et al.
Veröffentlicht: (2026)
von: Chen, Yanjun, et al.
Veröffentlicht: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
von: Tan, Hui-Ze, et al.
Veröffentlicht: (2026)
von: Tan, Hui-Ze, et al.
Veröffentlicht: (2026)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
von: Yang, Matthew Y. R., et al.
Veröffentlicht: (2026)
von: Yang, Matthew Y. R., et al.
Veröffentlicht: (2026)
Are self-explanations from Large Language Models faithful?
von: Madsen, Andreas, et al.
Veröffentlicht: (2024)
von: Madsen, Andreas, et al.
Veröffentlicht: (2024)
Neural Coherence : Find higher performance to out-of-distribution tasks from few samples
von: Guiroy, Simon, et al.
Veröffentlicht: (2025)
von: Guiroy, Simon, et al.
Veröffentlicht: (2025)
Intelligent Switching for Reset-Free RL
von: Patil, Darshan, et al.
Veröffentlicht: (2024)
von: Patil, Darshan, et al.
Veröffentlicht: (2024)
Lookbehind-SAM: k steps back, 1 step forward
von: Mordido, Gonçalo, et al.
Veröffentlicht: (2023)
von: Mordido, Gonçalo, et al.
Veröffentlicht: (2023)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
von: Qu, Yun, et al.
Veröffentlicht: (2024)
von: Qu, Yun, et al.
Veröffentlicht: (2024)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
von: Jiang, Xitai, et al.
Veröffentlicht: (2026)
von: Jiang, Xitai, et al.
Veröffentlicht: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
von: Ding, Fei, et al.
Veröffentlicht: (2026)
von: Ding, Fei, et al.
Veröffentlicht: (2026)
CoPeP: Benchmarking Continual Pretraining for Protein Language Models
von: Patil, Darshan, et al.
Veröffentlicht: (2026)
von: Patil, Darshan, et al.
Veröffentlicht: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
von: Auzina, Ilze Amanda, et al.
Veröffentlicht: (2026)
von: Auzina, Ilze Amanda, et al.
Veröffentlicht: (2026)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
von: Mou, Chaoli, et al.
Veröffentlicht: (2026)
von: Mou, Chaoli, et al.
Veröffentlicht: (2026)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
von: Cheng, Jie, et al.
Veröffentlicht: (2025)
von: Cheng, Jie, et al.
Veröffentlicht: (2025)
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
von: Aghajohari, Milad, et al.
Veröffentlicht: (2025)
von: Aghajohari, Milad, et al.
Veröffentlicht: (2025)
Steering Large Language Model Activations in Sparse Spaces
von: Bayat, Reza, et al.
Veröffentlicht: (2025)
von: Bayat, Reza, et al.
Veröffentlicht: (2025)
Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids
von: Nekoei, Hadi, et al.
Veröffentlicht: (2025)
von: Nekoei, Hadi, et al.
Veröffentlicht: (2025)
Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
von: Lian, Yongsheng
Veröffentlicht: (2025)
von: Lian, Yongsheng
Veröffentlicht: (2025)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
von: Khandoga, Mykola, et al.
Veröffentlicht: (2026)
von: Khandoga, Mykola, et al.
Veröffentlicht: (2026)
Mamba Modulation: On the Length Generalization of Mamba
von: Lu, Peng, et al.
Veröffentlicht: (2025)
von: Lu, Peng, et al.
Veröffentlicht: (2025)
Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
von: Ahmadi, Saba, et al.
Veröffentlicht: (2026)
von: Ahmadi, Saba, et al.
Veröffentlicht: (2026)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
von: Ramesh, Aditya A., et al.
Veröffentlicht: (2024)
von: Ramesh, Aditya A., et al.
Veröffentlicht: (2024)
RTMC: Step-Level Credit Assignment via Rollout Trees
von: Wang, Tao, et al.
Veröffentlicht: (2026)
von: Wang, Tao, et al.
Veröffentlicht: (2026)
A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
von: Pignatelli, Eduardo, et al.
Veröffentlicht: (2023)
von: Pignatelli, Eduardo, et al.
Veröffentlicht: (2023)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2026)
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2026)
Why Don't Prompt-Based Fairness Metrics Correlate?
von: Zayed, Abdelrahman, et al.
Veröffentlicht: (2024)
von: Zayed, Abdelrahman, et al.
Veröffentlicht: (2024)
Should We Attend More or Less? Modulating Attention for Fairness
von: Zayed, Abdelrahman, et al.
Veröffentlicht: (2023)
von: Zayed, Abdelrahman, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
von: Huang, Jerry, et al.
Veröffentlicht: (2024) -
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
von: Huang, Jerry, et al.
Veröffentlicht: (2024) -
Towards Practical Tool Usage for Continually Learning LLMs
von: Huang, Jerry, et al.
Veröffentlicht: (2024) -
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025) -
Squeezing More from the Stream : Learning Representation Online for Streaming Reinforcement Learning
von: Nilaksh, et al.
Veröffentlicht: (2026)