DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Monsefi, Amin Karimi, Culver, Dominic, Bhendawade, Nikhil, Boominathan, Lokesh, Ciosici, Manuel R., Zhang, Yizhe, Belousova, Irina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
di: Zhang, Chenchen
Pubblicazione: (2026)
di: Zhang, Chenchen
Pubblicazione: (2026)
GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models
di: Zhang, Jixiao, et al.
Pubblicazione: (2025)
di: Zhang, Jixiao, et al.
Pubblicazione: (2025)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
Controlla: Learning Controllability via Graph-Constrained Latent Geometry
di: Murthy, Jamuna S., et al.
Pubblicazione: (2026)
di: Murthy, Jamuna S., et al.
Pubblicazione: (2026)
Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization
di: He, Zhitao, et al.
Pubblicazione: (2025)
di: He, Zhitao, et al.
Pubblicazione: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
di: Tian, Minghao, et al.
Pubblicazione: (2026)
di: Tian, Minghao, et al.
Pubblicazione: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
di: Savani, Yash, et al.
Pubblicazione: (2026)
di: Savani, Yash, et al.
Pubblicazione: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
Execution-Grounded Credit Assignment for GRPO in Code Generation
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance
di: Che, Jiarui, et al.
Pubblicazione: (2026)
di: Che, Jiarui, et al.
Pubblicazione: (2026)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
CrashFormer: A Multimodal Architecture to Predict the Risk of Crash
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
VinePPO: Refining Credit Assignment in RL Training of LLMs
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
di: Wang, Kangyu, et al.
Pubblicazione: (2025)
di: Wang, Kangyu, et al.
Pubblicazione: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
di: Bai, Bizhe, et al.
Pubblicazione: (2025)
di: Bai, Bizhe, et al.
Pubblicazione: (2025)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
di: Wei, Kangda, et al.
Pubblicazione: (2026)
di: Wei, Kangda, et al.
Pubblicazione: (2026)
Reinforcement Learning from Denoising Feedback
di: He, Qi, et al.
Pubblicazione: (2026)
di: He, Qi, et al.
Pubblicazione: (2026)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
di: Kumar, Abhijit, et al.
Pubblicazione: (2026)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
di: Li, Ziheng, et al.
Pubblicazione: (2026)
di: Li, Ziheng, et al.
Pubblicazione: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
di: Wang, Yining, et al.
Pubblicazione: (2025)
di: Wang, Yining, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025) -
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026) -
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025) -
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025) -
Speculative Streaming: Fast LLM Inference without Auxiliary Models
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)