From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Zhang, Chenchen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
von: Jiang, Xitai, et al.
Veröffentlicht: (2026)
von: Jiang, Xitai, et al.
Veröffentlicht: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
von: Monsefi, Amin Karimi, et al.
Veröffentlicht: (2026)
von: Monsefi, Amin Karimi, et al.
Veröffentlicht: (2026)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization
von: He, Zhitao, et al.
Veröffentlicht: (2025)
von: He, Zhitao, et al.
Veröffentlicht: (2025)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
von: Chen, Kun, et al.
Veröffentlicht: (2026)
von: Chen, Kun, et al.
Veröffentlicht: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
von: Ding, Fei, et al.
Veröffentlicht: (2026)
von: Ding, Fei, et al.
Veröffentlicht: (2026)
Agentic Reasoning for Large Language Models
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces
von: Zhang, Chenchen
Veröffentlicht: (2026)
von: Zhang, Chenchen
Veröffentlicht: (2026)
Demystifying Reinforcement Learning in Agentic Reasoning
von: Yu, Zhaochen, et al.
Veröffentlicht: (2025)
von: Yu, Zhaochen, et al.
Veröffentlicht: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
von: Xie, Guofu, et al.
Veröffentlicht: (2025)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
von: Li, Ziheng, et al.
Veröffentlicht: (2026)
von: Li, Ziheng, et al.
Veröffentlicht: (2026)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
von: Xie, Roy, et al.
Veröffentlicht: (2025)
von: Xie, Roy, et al.
Veröffentlicht: (2025)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
von: Yang, Matthew Y. R., et al.
Veröffentlicht: (2026)
von: Yang, Matthew Y. R., et al.
Veröffentlicht: (2026)
Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models
von: Yuan, Chenchen, et al.
Veröffentlicht: (2025)
von: Yuan, Chenchen, et al.
Veröffentlicht: (2025)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
von: Khandoga, Mykola, et al.
Veröffentlicht: (2026)
von: Khandoga, Mykola, et al.
Veröffentlicht: (2026)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
von: Tran, Hieu, et al.
Veröffentlicht: (2025)
von: Tran, Hieu, et al.
Veröffentlicht: (2025)
From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
von: zhang, Ranxu, et al.
Veröffentlicht: (2026)
von: zhang, Ranxu, et al.
Veröffentlicht: (2026)
Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models
von: Liu, Runxuan, et al.
Veröffentlicht: (2026)
von: Liu, Runxuan, et al.
Veröffentlicht: (2026)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
Agentic Tool Use in Large Language Models
von: Hu, Jinchao, et al.
Veröffentlicht: (2026)
von: Hu, Jinchao, et al.
Veröffentlicht: (2026)
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
von: Chen, Xinzhu, et al.
Veröffentlicht: (2026)
von: Chen, Xinzhu, et al.
Veröffentlicht: (2026)
Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissance Reports
von: Kuai, Chenchen, et al.
Veröffentlicht: (2025)
von: Kuai, Chenchen, et al.
Veröffentlicht: (2025)
Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning
von: Liu, Zhaowei, et al.
Veröffentlicht: (2025)
von: Liu, Zhaowei, et al.
Veröffentlicht: (2025)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yaocheng, et al.
Veröffentlicht: (2025)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
von: Yao, Jiashu, et al.
Veröffentlicht: (2025)
von: Yao, Jiashu, et al.
Veröffentlicht: (2025)
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
von: Liang, Haijian, et al.
Veröffentlicht: (2026)
von: Liang, Haijian, et al.
Veröffentlicht: (2026)
Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
von: Cai, Hua, et al.
Veröffentlicht: (2025)
von: Cai, Hua, et al.
Veröffentlicht: (2025)
VinePPO: Refining Credit Assignment in RL Training of LLMs
von: Kazemnejad, Amirhossein, et al.
Veröffentlicht: (2024)
von: Kazemnejad, Amirhossein, et al.
Veröffentlicht: (2024)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
von: Mo, Fengran, et al.
Veröffentlicht: (2026)
von: Mo, Fengran, et al.
Veröffentlicht: (2026)
Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
von: Lumer, Elias, et al.
Veröffentlicht: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
von: Lu, Meng, et al.
Veröffentlicht: (2025)
von: Lu, Meng, et al.
Veröffentlicht: (2025)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
von: Zhang, Naifan, et al.
Veröffentlicht: (2026)
von: Zhang, Naifan, et al.
Veröffentlicht: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL
von: Dai, Yaxun, et al.
Veröffentlicht: (2026)
von: Dai, Yaxun, et al.
Veröffentlicht: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
von: Wang, Yiping, et al.
Veröffentlicht: (2025)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
von: Jia, Jinghan, et al.
Veröffentlicht: (2025)
von: Jia, Jinghan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
von: Jiang, Xitai, et al.
Veröffentlicht: (2026) -
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
von: Monsefi, Amin Karimi, et al.
Veröffentlicht: (2026) -
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026) -
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization
von: He, Zhitao, et al.
Veröffentlicht: (2025) -
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
von: Chen, Kun, et al.
Veröffentlicht: (2026)