Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Rojas, Kevin, Lin, Jiahe, Rasul, Kashif, Schneider, Anderson, Nevmyvaka, Yuriy, Tao, Molei, Deng, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Variational Schrödinger Momentum Diffusion
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2025)
por: Sinha, Sanchit, et al.
Publicado: (2025)
Structural Knowledge Informed Continual Multivariate Time Series Forecasting
por: Pan, Zijie, et al.
Publicado: (2024)
por: Pan, Zijie, et al.
Publicado: (2024)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
por: Roger, Alexis, et al.
Publicado: (2025)
por: Roger, Alexis, et al.
Publicado: (2025)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
por: Hogan, Brendan R., et al.
Publicado: (2026)
por: Hogan, Brendan R., et al.
Publicado: (2026)
Speculative Sampling for Parametric Temporal Point Processes
por: Biloš, Marin, et al.
Publicado: (2025)
por: Biloš, Marin, et al.
Publicado: (2025)
Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
por: Zhu, Yuchen, et al.
Publicado: (2025)
por: Zhu, Yuchen, et al.
Publicado: (2025)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
por: Ye, He, et al.
Publicado: (2025)
por: Ye, He, et al.
Publicado: (2025)
Reweighting Improves Conditional Risk Bounds
por: Zhang, Yikai, et al.
Publicado: (2025)
por: Zhang, Yikai, et al.
Publicado: (2025)
A Mechanistic Study of Tabular Foundation Models
por: Biloš, Marin, et al.
Publicado: (2026)
por: Biloš, Marin, et al.
Publicado: (2026)
Variational Schrödinger Diffusion Models
por: Deng, Wei, et al.
Publicado: (2024)
por: Deng, Wei, et al.
Publicado: (2024)
TS-RAG: Retrieval-Augmented Generation based Time Series Foundation Models are Stronger Zero-Shot Forecaster
por: Ning, Kanghui, et al.
Publicado: (2025)
por: Ning, Kanghui, et al.
Publicado: (2025)
Technical Report: Full-Stack Fine-Tuning for the Q Programming Language
por: Hogan, Brendan R., et al.
Publicado: (2025)
por: Hogan, Brendan R., et al.
Publicado: (2025)
Towards Interpretable and Trustworthy Time Series Reasoning: A BlueSky Vision
por: Ning, Kanghui, et al.
Publicado: (2025)
por: Ning, Kanghui, et al.
Publicado: (2025)
Zeroth-Order Sampling Methods for Non-Log-Concave Distributions: Alleviating Metastability by Denoising Diffusion
por: He, Ye, et al.
Publicado: (2024)
por: He, Ye, et al.
Publicado: (2024)
Random Initialization Can't Catch Up: The Advantage of Language Model Transfer for Time Series Forecasting
por: Riachi, Roland, et al.
Publicado: (2025)
por: Riachi, Roland, et al.
Publicado: (2025)
Empowering Time Series Analysis with Large Language Models: A Survey
por: Jiang, Yushan, et al.
Publicado: (2024)
por: Jiang, Yushan, et al.
Publicado: (2024)
Deep Generative Sampling in the Dual Divergence Space: A Data-efficient & Interpretative Approach for Generative AI
por: Garg, Sahil, et al.
Publicado: (2024)
por: Garg, Sahil, et al.
Publicado: (2024)
Recurrent Interpolants for Probabilistic Time Series Prediction
por: Chen, Yu, et al.
Publicado: (2024)
por: Chen, Yu, et al.
Publicado: (2024)
Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Efficient Diffusion Models under Nonconvex Equality and Inequality constraints via Landing
por: Jeon, Kijung, et al.
Publicado: (2026)
por: Jeon, Kijung, et al.
Publicado: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
por: Wei, Quan, et al.
Publicado: (2025)
por: Wei, Quan, et al.
Publicado: (2025)
Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
Trivialized Momentum Facilitates Diffusion Generative Modeling on Lie Groups
por: Zhu, Yuchen, et al.
Publicado: (2024)
por: Zhu, Yuchen, et al.
Publicado: (2024)
$\textbf{S}^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting
por: Pan, Zijie, et al.
Publicado: (2024)
por: Pan, Zijie, et al.
Publicado: (2024)
Quantitative Convergences of Lie Group Momentum Optimizers
por: Kong, Lingkai, et al.
Publicado: (2024)
por: Kong, Lingkai, et al.
Publicado: (2024)
Provable Separations between Memorization and Generalization in Diffusion Models
por: Ye, Zeqi, et al.
Publicado: (2025)
por: Ye, Zeqi, et al.
Publicado: (2025)
Privacy Amplification by Structured Subsampling for Deep Differentially Private Time Series Forecasting
por: Schuchardt, Jan, et al.
Publicado: (2025)
por: Schuchardt, Jan, et al.
Publicado: (2025)
Forecasting with Hyper-Trees
por: März, Alexander, et al.
Publicado: (2024)
por: März, Alexander, et al.
Publicado: (2024)
Proximal Diffusion Neural Sampler
por: Guo, Wei, et al.
Publicado: (2025)
por: Guo, Wei, et al.
Publicado: (2025)
Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold
por: He, Ye, et al.
Publicado: (2026)
por: He, Ye, et al.
Publicado: (2026)
SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
por: Tang, Xiaohang, et al.
Publicado: (2025)
por: Tang, Xiaohang, et al.
Publicado: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
Mirror Diffusion Models for Constrained and Watermarked Generation
por: Liu, Guan-Horng, et al.
Publicado: (2023)
por: Liu, Guan-Horng, et al.
Publicado: (2023)
Quantum State Generation with Structure-Preserving Diffusion Model
por: Zhu, Yuchen, et al.
Publicado: (2024)
por: Zhu, Yuchen, et al.
Publicado: (2024)
MDNS: Masked Diffusion Neural Sampler via Stochastic Optimal Control
por: Zhu, Yuchen, et al.
Publicado: (2025)
por: Zhu, Yuchen, et al.
Publicado: (2025)
d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
por: Wang, Guanghan, et al.
Publicado: (2025)
por: Wang, Guanghan, et al.
Publicado: (2025)
TR2-D2: Tree Search Guided Trajectory-Aware Fine-Tuning for Discrete Diffusion
por: Tang, Sophia, et al.
Publicado: (2025)
por: Tang, Sophia, et al.
Publicado: (2025)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2025)
por: Zhao, Siyan, et al.
Publicado: (2025)
Ejemplares similares
-
Variational Schrödinger Momentum Diffusion
por: Rojas, Kevin, et al.
Publicado: (2025) -
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2025) -
Structural Knowledge Informed Continual Multivariate Time Series Forecasting
por: Pan, Zijie, et al.
Publicado: (2024) -
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
por: Roger, Alexis, et al.
Publicado: (2025) -
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
por: Hogan, Brendan R., et al.
Publicado: (2026)