Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Khandoga, Mykola, Yuan, Rui, Sankarapu, Vinay Kumar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026)
di: Yuan, Rui, et al.
Pubblicazione: (2026)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
Data Presentation Over Architecture: Resampling Strategies for Credit Risk Prediction with Tabular Foundation Models
di: Tanna, Aditya, et al.
Pubblicazione: (2026)
di: Tanna, Aditya, et al.
Pubblicazione: (2026)
DLBacktrace: A Model Agnostic Explainability for any Deep Learning Models
di: Sankarapu, Vinay Kumar, et al.
Pubblicazione: (2024)
di: Sankarapu, Vinay Kumar, et al.
Pubblicazione: (2024)
AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models
di: Lyngkhoi, R E Zera Marveen, et al.
Pubblicazione: (2026)
di: Lyngkhoi, R E Zera Marveen, et al.
Pubblicazione: (2026)
From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation
di: Kiulian, Artur, et al.
Pubblicazione: (2024)
di: Kiulian, Artur, et al.
Pubblicazione: (2024)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
In-Context Credit Assignment via the Core
di: Harris, Keegan, et al.
Pubblicazione: (2026)
di: Harris, Keegan, et al.
Pubblicazione: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
di: Savani, Yash, et al.
Pubblicazione: (2026)
di: Savani, Yash, et al.
Pubblicazione: (2026)
CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection
di: Song, Yiliang, et al.
Pubblicazione: (2026)
di: Song, Yiliang, et al.
Pubblicazione: (2026)
Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands
di: Seth, Pratinav, et al.
Pubblicazione: (2026)
di: Seth, Pratinav, et al.
Pubblicazione: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
di: Auzina, Ilze Amanda, et al.
Pubblicazione: (2026)
di: Auzina, Ilze Amanda, et al.
Pubblicazione: (2026)
Causally-Enhanced Reinforcement Policy Optimization
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
Bridging the Gap in XAI-Why Reliable Metrics Matter for Explainability and Compliance
di: Seth, Pratinav, et al.
Pubblicazione: (2025)
di: Seth, Pratinav, et al.
Pubblicazione: (2025)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models
di: Feng, Duanyu, et al.
Pubblicazione: (2023)
di: Feng, Duanyu, et al.
Pubblicazione: (2023)
Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core
di: Ji, Mengda, et al.
Pubblicazione: (2025)
di: Ji, Mengda, et al.
Pubblicazione: (2025)
RTMC: Step-Level Credit Assignment via Rollout Trees
di: Wang, Tao, et al.
Pubblicazione: (2026)
di: Wang, Tao, et al.
Pubblicazione: (2026)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
di: Ramesh, Aditya A., et al.
Pubblicazione: (2024)
di: Ramesh, Aditya A., et al.
Pubblicazione: (2024)
A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2023)
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2023)
VinePPO: Refining Credit Assignment in RL Training of LLMs
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
di: Lee, Jeongjae, et al.
Pubblicazione: (2025)
di: Lee, Jeongjae, et al.
Pubblicazione: (2025)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
di: Lafuente-Mercado, Rodney
Pubblicazione: (2026)
di: Lafuente-Mercado, Rodney
Pubblicazione: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
Credit Assignment via Neural Manifold Noise Correlation
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams
di: Deshmukh, Shripad, et al.
Pubblicazione: (2026)
di: Deshmukh, Shripad, et al.
Pubblicazione: (2026)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026) -
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025) -
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026) -
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026) -
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)