RTMC: Step-Level Credit Assignment via Rollout Trees
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Tao, Zheng, Suhang, Xu, Xiaoxiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
di: Ding, Zihan, et al.
Pubblicazione: (2024)
di: Ding, Zihan, et al.
Pubblicazione: (2024)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
di: Auzina, Ilze Amanda, et al.
Pubblicazione: (2026)
di: Auzina, Ilze Amanda, et al.
Pubblicazione: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
Credit Assignment via Neural Manifold Noise Correlation
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
In-Context Credit Assignment via the Core
di: Harris, Keegan, et al.
Pubblicazione: (2026)
di: Harris, Keegan, et al.
Pubblicazione: (2026)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
Pinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement Learning
di: Yin, Junxi, et al.
Pubblicazione: (2025)
di: Yin, Junxi, et al.
Pubblicazione: (2025)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
di: Ramesh, Aditya A., et al.
Pubblicazione: (2024)
di: Ramesh, Aditya A., et al.
Pubblicazione: (2024)
A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2023)
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2023)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
di: Lafuente-Mercado, Rodney
Pubblicazione: (2026)
di: Lafuente-Mercado, Rodney
Pubblicazione: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026)
di: He, Zhida, et al.
Pubblicazione: (2026)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
di: Cheng, Jie, et al.
Pubblicazione: (2025)
di: Cheng, Jie, et al.
Pubblicazione: (2025)
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
di: Uzun, Mustafa, et al.
Pubblicazione: (2026)
di: Uzun, Mustafa, et al.
Pubblicazione: (2026)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams
di: Deshmukh, Shripad, et al.
Pubblicazione: (2026)
di: Deshmukh, Shripad, et al.
Pubblicazione: (2026)
Forward Target Propagation: A Forward-Only Approach to Global Error Credit Assignment via Local Losses
di: As-Saquib, Nazmus Saadat, et al.
Pubblicazione: (2025)
di: As-Saquib, Nazmus Saadat, et al.
Pubblicazione: (2025)
HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents
di: Peng, Jiangweizhi, et al.
Pubblicazione: (2026)
di: Peng, Jiangweizhi, et al.
Pubblicazione: (2026)
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
di: Wang, Haoran, et al.
Pubblicazione: (2023)
di: Wang, Haoran, et al.
Pubblicazione: (2023)
DiffusionRollout: Uncertainty-Aware Rollout Planning in Long-Horizon PDE Solving
di: Yoo, Seungwoo, et al.
Pubblicazione: (2026)
di: Yoo, Seungwoo, et al.
Pubblicazione: (2026)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents
di: Pang, Cong, et al.
Pubblicazione: (2026)
di: Pang, Cong, et al.
Pubblicazione: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
di: Savani, Yash, et al.
Pubblicazione: (2026)
di: Savani, Yash, et al.
Pubblicazione: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts
di: Yu, Hang, et al.
Pubblicazione: (2025)
di: Yu, Hang, et al.
Pubblicazione: (2025)
Bridging Source and Target Domains via Link Prediction for Unsupervised Domain Adaptation on Graphs
di: Wang, Yilong, et al.
Pubblicazione: (2025)
di: Wang, Yilong, et al.
Pubblicazione: (2025)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
Challenges in Credit Assignment for Multi-Agent Reinforcement Learning in Open Agent Systems
di: Abadi, Alireza Saleh, et al.
Pubblicazione: (2025)
di: Abadi, Alireza Saleh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
di: Ding, Zihan, et al.
Pubblicazione: (2024) -
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026) -
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
di: Chen, Yanjun, et al.
Pubblicazione: (2026) -
Intrinsic Credit Assignment for Long Horizon Interaction
di: Auzina, Ilze Amanda, et al.
Pubblicazione: (2026) -
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)