Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
Fuente:
arXiv
Salvato in:
| Autori principali: | Kunde, Vishnu Teja, Doudi, Fatemeh, Farahbakhsh, Mahdi, Kalathil, Dileep, Narayanan, Krishna, Chamberland, Jean-Francois |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction
di: Farahbakhsh, Mahdi, et al.
Pubblicazione: (2025)
di: Farahbakhsh, Mahdi, et al.
Pubblicazione: (2025)
Real-Time Text Transmission via LLM-Based Entropy Coding over Fixed-Rate Channels
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2026)
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2026)
Transformers are Provably Optimal In-context Estimators for Wireless Communications
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2023)
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2023)
Camera-Based Localization and Enhanced Normalized Mutual Information
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2024)
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2024)
PowerMamba: A Deep State Space Model and Comprehensive Benchmark for Time Series Prediction in Electric Power Systems
di: Menati, Ali, et al.
Pubblicazione: (2024)
di: Menati, Ali, et al.
Pubblicazione: (2024)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
di: Cheng, Min, et al.
Pubblicazione: (2025)
di: Cheng, Min, et al.
Pubblicazione: (2025)
Approximate Message Passing for Multi-Preamble Detection in OTFS Random Access
di: Mirri, Alessandro, et al.
Pubblicazione: (2025)
di: Mirri, Alessandro, et al.
Pubblicazione: (2025)
Complex Approximate Message Passing with Non-separable Denoising
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2026)
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2026)
Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning
di: Saj, Vishnu, et al.
Pubblicazione: (2026)
di: Saj, Vishnu, et al.
Pubblicazione: (2026)
Risk-Averse Finetuning of Large Language Models
di: Chaudhary, Sapana, et al.
Pubblicazione: (2025)
di: Chaudhary, Sapana, et al.
Pubblicazione: (2025)
Density Evolution Analysis of Sparse-Block IDMA
di: Chamberland, Jean-Francois, et al.
Pubblicazione: (2025)
di: Chamberland, Jean-Francois, et al.
Pubblicazione: (2025)
Teaching at Scale: Leveraging AI to Evaluate and Elevate Engineering Education
di: Chamberland, Jean-Francois, et al.
Pubblicazione: (2025)
di: Chamberland, Jean-Francois, et al.
Pubblicazione: (2025)
In-Context Learning for Gradient-Free Receiver Adaptation: Principles, Applications, and Theory
di: Zecchin, Matteo, et al.
Pubblicazione: (2025)
di: Zecchin, Matteo, et al.
Pubblicazione: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
di: Fei, Wu, et al.
Pubblicazione: (2025)
di: Fei, Wu, et al.
Pubblicazione: (2025)
MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection
di: Carleton, Jeremy, et al.
Pubblicazione: (2025)
di: Carleton, Jeremy, et al.
Pubblicazione: (2025)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
Federated Ensemble-Directed Offline Reinforcement Learning
di: Rengarajan, Desik, et al.
Pubblicazione: (2023)
di: Rengarajan, Desik, et al.
Pubblicazione: (2023)
Sparse Regression LDPC Codes
di: Ebert, Jamison R., et al.
Pubblicazione: (2023)
di: Ebert, Jamison R., et al.
Pubblicazione: (2023)
Multi-User SR-LDPC Codes
di: Ebert, Jamison R., et al.
Pubblicazione: (2024)
di: Ebert, Jamison R., et al.
Pubblicazione: (2024)
Multi-User SR-LDPC Codes via Coded Demixing with Applications to Cell-Free Systems
di: Ebert, Jamison R., et al.
Pubblicazione: (2024)
di: Ebert, Jamison R., et al.
Pubblicazione: (2024)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
Write Summary Step-by-Step: A Pilot Study of Stepwise Summarization
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
di: Le, Thanh-Long V., et al.
Pubblicazione: (2025)
di: Le, Thanh-Long V., et al.
Pubblicazione: (2025)
The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs
di: Berezin, Sergey, et al.
Pubblicazione: (2025)
di: Berezin, Sergey, et al.
Pubblicazione: (2025)
Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
di: Parashar, Shubham, et al.
Pubblicazione: (2025)
di: Parashar, Shubham, et al.
Pubblicazione: (2025)
The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?
di: Català, Mar Gonzàlez I, et al.
Pubblicazione: (2026)
di: Català, Mar Gonzàlez I, et al.
Pubblicazione: (2026)
Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection
di: Mavi, Vaibhav, et al.
Pubblicazione: (2025)
di: Mavi, Vaibhav, et al.
Pubblicazione: (2025)
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning
di: Yu, Yuanqing, et al.
Pubblicazione: (2024)
di: Yu, Yuanqing, et al.
Pubblicazione: (2024)
Abstractions-of-Thought: Intermediate Representations for LLM Reasoning in Hardware Design
di: DeLorenzo, Matthew, et al.
Pubblicazione: (2025)
di: DeLorenzo, Matthew, et al.
Pubblicazione: (2025)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
Enhancing Mathematical Reasoning in LLMs by Stepwise Correction
di: Wu, Zhenyu, et al.
Pubblicazione: (2024)
di: Wu, Zhenyu, et al.
Pubblicazione: (2024)
Step-Controlled DPO: Leveraging Stepwise Error for Enhanced Mathematical Reasoning
di: Lu, Zimu, et al.
Pubblicazione: (2024)
di: Lu, Zimu, et al.
Pubblicazione: (2024)
Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
di: Huang, Yiming, et al.
Pubblicazione: (2026)
di: Huang, Yiming, et al.
Pubblicazione: (2026)
Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2024)
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2024)
First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoning
di: Jain, Kushal, et al.
Pubblicazione: (2023)
di: Jain, Kushal, et al.
Pubblicazione: (2023)
Entropy Alone is Insufficient for Safe Selective Prediction in LLMs
di: Phillips, Edward, et al.
Pubblicazione: (2026)
di: Phillips, Edward, et al.
Pubblicazione: (2026)
Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
di: Lee, Sangmook, et al.
Pubblicazione: (2025)
di: Lee, Sangmook, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction
di: Farahbakhsh, Mahdi, et al.
Pubblicazione: (2025) -
Real-Time Text Transmission via LLM-Based Entropy Coding over Fixed-Rate Channels
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2026) -
Transformers are Provably Optimal In-context Estimators for Wireless Communications
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2023) -
Camera-Based Localization and Enhanced Normalized Mutual Information
di: Kunde, Vishnu Teja, et al.
Pubblicazione: (2024) -
PowerMamba: A Deep State Space Model and Comprehensive Benchmark for Time Series Prediction in Electric Power Systems
di: Menati, Ali, et al.
Pubblicazione: (2024)