DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
Fuente:
arXiv
Saved in:
| Main Authors: | Jin, Hongbo, Zhu, Rongpeng, Du, Zhongjing, Jiang, Xu, Tian, Jingqi, Zhang, Qiaoman, Ding, Jiayu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ContextGuard: Structured Self-Auditing for Context Learning in Language Models
by: Jin, Hongbo, et al.
Published: (2026)
by: Jin, Hongbo, et al.
Published: (2026)
Context-CoT: Enhancing Context Learning via High-Quality Reasoning Synthesis
by: Jin, Hongbo, et al.
Published: (2026)
by: Jin, Hongbo, et al.
Published: (2026)
VISD: Enhancing Video Reasoning via Structured Self-Distillation
by: Lin, Hao, et al.
Published: (2026)
by: Lin, Hao, et al.
Published: (2026)
DGPO: Discovering Multiple Strategies with Diversity-Guided Policy Optimization
by: Chen, Wentse, et al.
Published: (2022)
by: Chen, Wentse, et al.
Published: (2022)
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents
by: Jin, Hongbo, et al.
Published: (2026)
by: Jin, Hongbo, et al.
Published: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
by: Khandoga, Mykola, et al.
Published: (2026)
by: Khandoga, Mykola, et al.
Published: (2026)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
by: Guo, Yiran, et al.
Published: (2025)
by: Guo, Yiran, et al.
Published: (2025)
Hindsight Credit Assignment for Long-Horizon LLM Agents
by: Tan, Hui-Ze, et al.
Published: (2026)
by: Tan, Hui-Ze, et al.
Published: (2026)
RTMC: Step-Level Credit Assignment via Rollout Trees
by: Wang, Tao, et al.
Published: (2026)
by: Wang, Tao, et al.
Published: (2026)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
by: Ding, Fei, et al.
Published: (2026)
by: Ding, Fei, et al.
Published: (2026)
DGPO: RL-Steered Graph Diffusion for Neural Architecture Generation
by: Liuliakov, Aleksei, et al.
Published: (2026)
by: Liuliakov, Aleksei, et al.
Published: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
by: Auzina, Ilze Amanda, et al.
Published: (2026)
by: Auzina, Ilze Amanda, et al.
Published: (2026)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
by: Qu, Yun, et al.
Published: (2024)
by: Qu, Yun, et al.
Published: (2024)
Learning to Explore: Policy-Guided Outlier Synthesis for Graph Out-of-Distribution Detection
by: Sun, Li, et al.
Published: (2026)
by: Sun, Li, et al.
Published: (2026)
AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
by: Yang, Shiyi, et al.
Published: (2025)
by: Yang, Shiyi, et al.
Published: (2025)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
by: Parthasarathi, Prasanna, et al.
Published: (2025)
by: Parthasarathi, Prasanna, et al.
Published: (2025)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
by: Chen, Yanjun, et al.
Published: (2026)
by: Chen, Yanjun, et al.
Published: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
by: Xie, Guofu, et al.
Published: (2025)
by: Xie, Guofu, et al.
Published: (2025)
Pinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement Learning
by: Yin, Junxi, et al.
Published: (2025)
by: Yin, Junxi, et al.
Published: (2025)
Sequence Compression Speeds Up Credit Assignment in Reinforcement Learning
by: Ramesh, Aditya A., et al.
Published: (2024)
by: Ramesh, Aditya A., et al.
Published: (2024)
A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
by: Pignatelli, Eduardo, et al.
Published: (2023)
by: Pignatelli, Eduardo, et al.
Published: (2023)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
by: Mou, Chaoli, et al.
Published: (2026)
by: Mou, Chaoli, et al.
Published: (2026)
Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization
by: Han, Xinchen, et al.
Published: (2026)
by: Han, Xinchen, et al.
Published: (2026)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
by: He, Zhida, et al.
Published: (2026)
by: He, Zhida, et al.
Published: (2026)
Beyond Augmentation: Score-Guided Pathological Prior for EEG-based Depression Detection
by: Chen, Xiaojing, et al.
Published: (2026)
by: Chen, Xiaojing, et al.
Published: (2026)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
by: Lafuente-Mercado, Rodney
Published: (2026)
by: Lafuente-Mercado, Rodney
Published: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
by: Gao, Xiancheng, et al.
Published: (2025)
by: Gao, Xiancheng, et al.
Published: (2025)
In-Context Credit Assignment via the Core
by: Harris, Keegan, et al.
Published: (2026)
by: Harris, Keegan, et al.
Published: (2026)
Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core
by: Ji, Mengda, et al.
Published: (2025)
by: Ji, Mengda, et al.
Published: (2025)
Credit Assignment via Neural Manifold Noise Correlation
by: Kang, Byungwoo, et al.
Published: (2026)
by: Kang, Byungwoo, et al.
Published: (2026)
COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams
by: Deshmukh, Shripad, et al.
Published: (2026)
by: Deshmukh, Shripad, et al.
Published: (2026)
Single-stream Policy Optimization
by: Xu, Zhongwen, et al.
Published: (2025)
by: Xu, Zhongwen, et al.
Published: (2025)
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
by: Uzun, Mustafa, et al.
Published: (2026)
by: Uzun, Mustafa, et al.
Published: (2026)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
by: Low, Siow Meng, et al.
Published: (2025)
by: Low, Siow Meng, et al.
Published: (2025)
AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
by: Du, Shangheng, et al.
Published: (2025)
by: Du, Shangheng, et al.
Published: (2025)
Credit Card Fraud Detection Using Advanced Transformer Model
by: Yu, Chang, et al.
Published: (2024)
by: Yu, Chang, et al.
Published: (2024)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
by: Ekbote, Chanakya, et al.
Published: (2025)
by: Ekbote, Chanakya, et al.
Published: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
by: Yang, Matthew Y. R., et al.
Published: (2026)
by: Yang, Matthew Y. R., et al.
Published: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
by: Savani, Yash, et al.
Published: (2026)
by: Savani, Yash, et al.
Published: (2026)
Similar Items
-
ContextGuard: Structured Self-Auditing for Context Learning in Language Models
by: Jin, Hongbo, et al.
Published: (2026) -
Context-CoT: Enhancing Context Learning via High-Quality Reasoning Synthesis
by: Jin, Hongbo, et al.
Published: (2026) -
VISD: Enhancing Video Reasoning via Structured Self-Distillation
by: Lin, Hao, et al.
Published: (2026) -
DGPO: Discovering Multiple Strategies with Diversity-Guided Policy Optimization
by: Chen, Wentse, et al.
Published: (2022) -
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents
by: Jin, Hongbo, et al.
Published: (2026)