Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Rojas, Kevin, Lin, Jiahe, Rasul, Kashif, Schneider, Anderson, Nevmyvaka, Yuriy, Tao, Molei, Deng, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Variational Schrödinger Momentum Diffusion
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
Structural Knowledge Informed Continual Multivariate Time Series Forecasting
di: Pan, Zijie, et al.
Pubblicazione: (2024)
di: Pan, Zijie, et al.
Pubblicazione: (2024)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
di: Roger, Alexis, et al.
Pubblicazione: (2025)
di: Roger, Alexis, et al.
Pubblicazione: (2025)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
di: Hogan, Brendan R., et al.
Pubblicazione: (2026)
di: Hogan, Brendan R., et al.
Pubblicazione: (2026)
Speculative Sampling for Parametric Temporal Point Processes
di: Biloš, Marin, et al.
Pubblicazione: (2025)
di: Biloš, Marin, et al.
Pubblicazione: (2025)
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
di: Ye, He, et al.
Pubblicazione: (2025)
di: Ye, He, et al.
Pubblicazione: (2025)
Reweighting Improves Conditional Risk Bounds
di: Zhang, Yikai, et al.
Pubblicazione: (2025)
di: Zhang, Yikai, et al.
Pubblicazione: (2025)
A Mechanistic Study of Tabular Foundation Models
di: Biloš, Marin, et al.
Pubblicazione: (2026)
di: Biloš, Marin, et al.
Pubblicazione: (2026)
Variational Schrödinger Diffusion Models
di: Deng, Wei, et al.
Pubblicazione: (2024)
di: Deng, Wei, et al.
Pubblicazione: (2024)
TS-RAG: Retrieval-Augmented Generation based Time Series Foundation Models are Stronger Zero-Shot Forecaster
di: Ning, Kanghui, et al.
Pubblicazione: (2025)
di: Ning, Kanghui, et al.
Pubblicazione: (2025)
Technical Report: Full-Stack Fine-Tuning for the Q Programming Language
di: Hogan, Brendan R., et al.
Pubblicazione: (2025)
di: Hogan, Brendan R., et al.
Pubblicazione: (2025)
Towards Interpretable and Trustworthy Time Series Reasoning: A BlueSky Vision
di: Ning, Kanghui, et al.
Pubblicazione: (2025)
di: Ning, Kanghui, et al.
Pubblicazione: (2025)
Zeroth-Order Sampling Methods for Non-Log-Concave Distributions: Alleviating Metastability by Denoising Diffusion
di: He, Ye, et al.
Pubblicazione: (2024)
di: He, Ye, et al.
Pubblicazione: (2024)
Random Initialization Can't Catch Up: The Advantage of Language Model Transfer for Time Series Forecasting
di: Riachi, Roland, et al.
Pubblicazione: (2025)
di: Riachi, Roland, et al.
Pubblicazione: (2025)
Empowering Time Series Analysis with Large Language Models: A Survey
di: Jiang, Yushan, et al.
Pubblicazione: (2024)
di: Jiang, Yushan, et al.
Pubblicazione: (2024)
Deep Generative Sampling in the Dual Divergence Space: A Data-efficient & Interpretative Approach for Generative AI
di: Garg, Sahil, et al.
Pubblicazione: (2024)
di: Garg, Sahil, et al.
Pubblicazione: (2024)
Recurrent Interpolants for Probabilistic Time Series Prediction
di: Chen, Yu, et al.
Pubblicazione: (2024)
di: Chen, Yu, et al.
Pubblicazione: (2024)
Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
Efficient Diffusion Models under Nonconvex Equality and Inequality constraints via Landing
di: Jeon, Kijung, et al.
Pubblicazione: (2026)
di: Jeon, Kijung, et al.
Pubblicazione: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
di: Wei, Quan, et al.
Pubblicazione: (2025)
di: Wei, Quan, et al.
Pubblicazione: (2025)
Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
di: Rojas, Kevin, et al.
Pubblicazione: (2025)
Trivialized Momentum Facilitates Diffusion Generative Modeling on Lie Groups
di: Zhu, Yuchen, et al.
Pubblicazione: (2024)
di: Zhu, Yuchen, et al.
Pubblicazione: (2024)
$\textbf{S}^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting
di: Pan, Zijie, et al.
Pubblicazione: (2024)
di: Pan, Zijie, et al.
Pubblicazione: (2024)
Quantitative Convergences of Lie Group Momentum Optimizers
di: Kong, Lingkai, et al.
Pubblicazione: (2024)
di: Kong, Lingkai, et al.
Pubblicazione: (2024)
Provable Separations between Memorization and Generalization in Diffusion Models
di: Ye, Zeqi, et al.
Pubblicazione: (2025)
di: Ye, Zeqi, et al.
Pubblicazione: (2025)
Privacy Amplification by Structured Subsampling for Deep Differentially Private Time Series Forecasting
di: Schuchardt, Jan, et al.
Pubblicazione: (2025)
di: Schuchardt, Jan, et al.
Pubblicazione: (2025)
Forecasting with Hyper-Trees
di: März, Alexander, et al.
Pubblicazione: (2024)
di: März, Alexander, et al.
Pubblicazione: (2024)
Proximal Diffusion Neural Sampler
di: Guo, Wei, et al.
Pubblicazione: (2025)
di: Guo, Wei, et al.
Pubblicazione: (2025)
Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold
di: He, Ye, et al.
Pubblicazione: (2026)
di: He, Ye, et al.
Pubblicazione: (2026)
SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Mirror Diffusion Models for Constrained and Watermarked Generation
di: Liu, Guan-Horng, et al.
Pubblicazione: (2023)
di: Liu, Guan-Horng, et al.
Pubblicazione: (2023)
Quantum State Generation with Structure-Preserving Diffusion Model
di: Zhu, Yuchen, et al.
Pubblicazione: (2024)
di: Zhu, Yuchen, et al.
Pubblicazione: (2024)
MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
di: Wang, Guanghan, et al.
Pubblicazione: (2025)
di: Wang, Guanghan, et al.
Pubblicazione: (2025)
TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
di: Tang, Sophia, et al.
Pubblicazione: (2025)
di: Tang, Sophia, et al.
Pubblicazione: (2025)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Variational Schrödinger Momentum Diffusion
di: Rojas, Kevin, et al.
Pubblicazione: (2025) -
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2025) -
Structural Knowledge Informed Continual Multivariate Time Series Forecasting
di: Pan, Zijie, et al.
Pubblicazione: (2024) -
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
di: Roger, Alexis, et al.
Pubblicazione: (2025) -
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
di: Hogan, Brendan R., et al.
Pubblicazione: (2026)