Learning Unmasking Policies for Diffusion Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Jazbec, Metod, Olausson, Theo X., Béthune, Louis, Ablin, Pierre, Kirchhof, Michael, Monteiro, João, Turrisi, Victor, Ramapuram, Jason, Cuturi, Marco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shielded Diffusion: Generating Novel and Diverse Images using Sparse Repellency
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
Amortizing Maximum Inner Product Search with Learned Support Functions
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
Scaling Categorical Flow Maps
di: Davis, Oscar, et al.
Pubblicazione: (2026)
di: Davis, Oscar, et al.
Pubblicazione: (2026)
The Geometries of Truth Are Orthogonal Across Tasks
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
The Design Space of Tri-Modal Masked Diffusion Models
di: Bethune, Louis, et al.
Pubblicazione: (2026)
di: Bethune, Louis, et al.
Pubblicazione: (2026)
Nectar: Neural Estimation of Cached-Token Attention via Regression
di: Monteiro, João, et al.
Pubblicazione: (2026)
di: Monteiro, João, et al.
Pubblicazione: (2026)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025)
di: Bethune, Louis, et al.
Pubblicazione: (2025)
The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
Sample and Map from a Single Convex Potential: Generation using Conjugate Moment Measures
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
Dynamic Mixture-of-Experts for Visual Autoregressive Model
di: Vincenti, Jort, et al.
Pubblicazione: (2025)
di: Vincenti, Jort, et al.
Pubblicazione: (2025)
Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning
di: Bui, Ha Manh, et al.
Pubblicazione: (2026)
di: Bui, Ha Manh, et al.
Pubblicazione: (2026)
Multivariate Conformal Prediction using Optimal Transport
di: Klein, Michal, et al.
Pubblicazione: (2025)
di: Klein, Michal, et al.
Pubblicazione: (2025)
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
Generative Uncertainty in Diffusion Models
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
Optimal Splitting of Language Models from Mixtures to Specialized Domains
di: Seto, Skyler, et al.
Pubblicazione: (2026)
di: Seto, Skyler, et al.
Pubblicazione: (2026)
Monitoring Risks in Test-Time Adaptation
di: Schirmer, Mona, et al.
Pubblicazione: (2025)
di: Schirmer, Mona, et al.
Pubblicazione: (2025)
Learning Elastic Costs to Shape Monge Displacements
di: Klein, Michal, et al.
Pubblicazione: (2023)
di: Klein, Michal, et al.
Pubblicazione: (2023)
Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting
di: Wynn, Andrea, et al.
Pubblicazione: (2025)
di: Wynn, Andrea, et al.
Pubblicazione: (2025)
Early-Exit Neural Networks with Nested Prediction Sets
di: Jazbec, Metod, et al.
Pubblicazione: (2023)
di: Jazbec, Metod, et al.
Pubblicazione: (2023)
Careful with that Scalpel: Improving Gradient Surgery with an EMA
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
Dynamic Vocabulary Pruning in Early-Exit LLMs
di: Vincenti, Jort, et al.
Pubblicazione: (2024)
di: Vincenti, Jort, et al.
Pubblicazione: (2024)
Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings
di: Jeha, Paul, et al.
Pubblicazione: (2026)
di: Jeha, Paul, et al.
Pubblicazione: (2026)
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
di: Filippova, Anastasiia, et al.
Pubblicazione: (2026)
di: Filippova, Anastasiia, et al.
Pubblicazione: (2026)
A Small-Scale System for Autoregressive Program Synthesis Enabling Controlled Experimentation
di: Webb, Russ, et al.
Pubblicazione: (2026)
di: Webb, Russ, et al.
Pubblicazione: (2026)
Scaling Laws for Optimal Data Mixtures
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
DuoDiff: Accelerating Diffusion Models with a Dual-Backbone Approach
di: Fernández, Daniel Gallo, et al.
Pubblicazione: (2024)
di: Fernández, Daniel Gallo, et al.
Pubblicazione: (2024)
GENOT: Entropic (Gromov) Wasserstein Flow Matching with Applications to Single-Cell Genomics
di: Klein, Dominik, et al.
Pubblicazione: (2023)
di: Klein, Dominik, et al.
Pubblicazione: (2023)
Uncertainties of Latent Representations in Computer Vision
di: Kirchhof, Michael
Pubblicazione: (2024)
di: Kirchhof, Michael
Pubblicazione: (2024)
Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models
di: Asano, Hikaru, et al.
Pubblicazione: (2026)
di: Asano, Hikaru, et al.
Pubblicazione: (2026)
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
SafeSteps: Learning Safer Footstep Planning Policies for Legged Robots via Model-Based Priors
di: Omar, Shafeef, et al.
Pubblicazione: (2023)
di: Omar, Shafeef, et al.
Pubblicazione: (2023)
1-Lipschitz Neural Distance Fields
di: Coiffier, Guillaume, et al.
Pubblicazione: (2024)
di: Coiffier, Guillaume, et al.
Pubblicazione: (2024)
1‐Lipschitz Neural Distance Fields
di: Guillaume Coiffier, et al.
Pubblicazione: (2024)
di: Guillaume Coiffier, et al.
Pubblicazione: (2024)
The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?
di: Gu, Alex, et al.
Pubblicazione: (2024)
di: Gu, Alex, et al.
Pubblicazione: (2024)
Controlling Language and Diffusion Models by Transporting Activations
di: Rodriguez, Pau, et al.
Pubblicazione: (2024)
di: Rodriguez, Pau, et al.
Pubblicazione: (2024)
Disentangled Representation Learning with the Gromov-Monge Gap
di: Uscidda, Théo, et al.
Pubblicazione: (2024)
di: Uscidda, Théo, et al.
Pubblicazione: (2024)
Need a Small Specialized Language Model? Plan Early!
di: Grangier, David, et al.
Pubblicazione: (2024)
di: Grangier, David, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Shielded Diffusion: Generating Novel and Diverse Images using Sparse Repellency
di: Kirchhof, Michael, et al.
Pubblicazione: (2024) -
Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025) -
Amortizing Maximum Inner Product Search with Learned Support Functions
di: Olausson, Theo X., et al.
Pubblicazione: (2026) -
Scaling Categorical Flow Maps
di: Davis, Oscar, et al.
Pubblicazione: (2026) -
The Geometries of Truth Are Orthogonal Across Tasks
di: Azizian, Waiss, et al.
Pubblicazione: (2025)