SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chenyu, Rashidinejad, Paria, Su, DiJia, Jiang, Song, Wang, Sid, Zhao, Siyan, Zhou, Cai, Shen, Shannon Zejiang, Chen, Feiyu, Jaakkola, Tommi, Tian, Yuandong, Liu, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
par: Rashidinejad, Paria, et autres
Publié: (2024)
par: Rashidinejad, Paria, et autres
Publié: (2024)
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
par: Su, DiJia, et autres
Publié: (2025)
par: Su, DiJia, et autres
Publié: (2025)
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
par: Su, DiJia, et autres
Publié: (2024)
par: Su, DiJia, et autres
Publié: (2024)
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
par: Zhao, Siyan, et autres
Publié: (2025)
par: Zhao, Siyan, et autres
Publié: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
par: Liu, Yixin, et autres
Publié: (2026)
par: Liu, Yixin, et autres
Publié: (2026)
Solve the Loop: Attractor Models for Language and Reasoning
par: Fein-Ashley, Jacob, et autres
Publié: (2026)
par: Fein-Ashley, Jacob, et autres
Publié: (2026)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
par: Su, DiJia, et autres
Publié: (2025)
par: Su, DiJia, et autres
Publié: (2025)
Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
par: Zhou, Cai, et autres
Publié: (2025)
par: Zhou, Cai, et autres
Publié: (2025)
Learning Diffusion Models with Flexible Representation Guidance
par: Wang, Chenyu, et autres
Publié: (2025)
par: Wang, Chenyu, et autres
Publié: (2025)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
par: Setlur, Amrith, et autres
Publié: (2026)
par: Setlur, Amrith, et autres
Publié: (2026)
Training Large Language Models to Reason in a Continuous Latent Space
par: Hao, Shibo, et autres
Publié: (2024)
par: Hao, Shibo, et autres
Publié: (2024)
Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping
par: Lehnert, Lucas, et autres
Publié: (2024)
par: Lehnert, Lucas, et autres
Publié: (2024)
In-Context Symmetries: Self-Supervised Learning through Contextual World Models
par: Gupta, Sharut, et autres
Publié: (2024)
par: Gupta, Sharut, et autres
Publié: (2024)
Continuously Tempered Diffusion Samplers
par: Erives, Ezra, et autres
Publié: (2025)
par: Erives, Ezra, et autres
Publié: (2025)
Correcting Diffusion Generation through Resampling
par: Liu, Yujian, et autres
Publié: (2023)
par: Liu, Yujian, et autres
Publié: (2023)
Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
par: Zhou, Cai, et autres
Publié: (2025)
par: Zhou, Cai, et autres
Publié: (2025)
CrispEdit: Low-Curvature Projections for Scalable Non-Destructive LLM Editing
par: Ikram, Zarif, et autres
Publié: (2026)
par: Ikram, Zarif, et autres
Publié: (2026)
Thought calibration: Efficient and confident test-time scaling
par: Wu, Menghua, et autres
Publié: (2025)
par: Wu, Menghua, et autres
Publié: (2025)
Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models
par: Lifar, Egor, et autres
Publié: (2026)
par: Lifar, Egor, et autres
Publié: (2026)
Calibrated Selective Classification
par: Fisch, Adam, et autres
Publié: (2022)
par: Fisch, Adam, et autres
Publié: (2022)
Equivariant Scalar Fields for Molecular Docking with Fast Fourier Transforms
par: Jing, Bowen, et autres
Publié: (2023)
par: Jing, Bowen, et autres
Publié: (2023)
Verlet Flows: Exact-Likelihood Integrators for Flow-Based Generative Models
par: Erives, Ezra, et autres
Publié: (2024)
par: Erives, Ezra, et autres
Publié: (2024)
LEAPS: A discrete neural sampler via locally equivariant networks
par: Holderrieth, Peter, et autres
Publié: (2025)
par: Holderrieth, Peter, et autres
Publié: (2025)
AI-based Methods for Simulating, Sampling, and Predicting Protein Ensembles
par: Jing, Bowen, et autres
Publié: (2025)
par: Jing, Bowen, et autres
Publié: (2025)
AlphaFold Meets Flow Matching for Generating Protein Ensembles
par: Jing, Bowen, et autres
Publié: (2024)
par: Jing, Bowen, et autres
Publié: (2024)
Hamiltonian Score Matching and Generative Flows
par: Holderrieth, Peter, et autres
Publié: (2024)
par: Holderrieth, Peter, et autres
Publié: (2024)
Fine-Tuning Discrete Diffusion Models via Reward Optimization with Applications to DNA and Protein Design
par: Wang, Chenyu, et autres
Publié: (2024)
par: Wang, Chenyu, et autres
Publié: (2024)
Dirichlet Flow Matching with Applications to DNA Sequence Design
par: Stark, Hannes, et autres
Publié: (2024)
par: Stark, Hannes, et autres
Publié: (2024)
An Information Criterion for Controlled Disentanglement of Multimodal Data
par: Wang, Chenyu, et autres
Publié: (2024)
par: Wang, Chenyu, et autres
Publié: (2024)
DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents
par: Xu, Yilun, et autres
Publié: (2024)
par: Xu, Yilun, et autres
Publié: (2024)
The road ahead for functional foods: Promising opportunities amidst industry challenges
par: Ali Rashidinejad
Publié: (2024)
par: Ali Rashidinejad
Publié: (2024)
Bioactive compounds from New Zealand's native edible plants: Their role in future functional foods
par: Ali Rashidinejad
Publié: (2024)
par: Ali Rashidinejad
Publié: (2024)
Diffusion models in protein structure and docking
par: Jason Yim, et autres
Publié: (2024)
par: Jason Yim, et autres
Publié: (2024)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
par: Zhou, Cai, et autres
Publié: (2026)
par: Zhou, Cai, et autres
Publié: (2026)
ProxelGen: Generating Proteins as 3D Densities
par: Faltings, Felix, et autres
Publié: (2025)
par: Faltings, Felix, et autres
Publié: (2025)
Fictitious Synthetic Data Can Improve LLM Factuality via Prerequisite Learning
par: Liu, Yujian, et autres
Publié: (2024)
par: Liu, Yujian, et autres
Publié: (2024)
Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective
par: Liu, Yujian, et autres
Publié: (2024)
par: Liu, Yujian, et autres
Publié: (2024)
Harmonic Self-Conditioned Flow Matching for Multi-Ligand Docking and Binding Site Design
par: Stärk, Hannes, et autres
Publié: (2023)
par: Stärk, Hannes, et autres
Publié: (2023)
Generative Modeling of Molecular Dynamics Trajectories
par: Jing, Bowen, et autres
Publié: (2024)
par: Jing, Bowen, et autres
Publié: (2024)
Protein FID: Improved Evaluation of Protein Structure Generative Models
par: Faltings, Felix, et autres
Publié: (2025)
par: Faltings, Felix, et autres
Publié: (2025)
Documents similaires
-
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
par: Rashidinejad, Paria, et autres
Publié: (2024) -
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
par: Su, DiJia, et autres
Publié: (2025) -
Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces
par: Su, DiJia, et autres
Publié: (2024) -
Inpainting-Guided Policy Optimization for Diffusion Large Language Models
par: Zhao, Siyan, et autres
Publié: (2025) -
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
par: Liu, Yixin, et autres
Publié: (2026)