The Design Space of Tri-Modal Masked Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Bethune, Louis, Turrisi, Victor, Mlodozeniec, Bruno Kacper, Lopez, Pau Rodriguez, Boominathan, Lokesh, Bhendawade, Nikhil, Shidani, Amitis, Pelemans, Joris, Olausson, Theo X., Hjelm, Devon, Dixon, Paul, Monteiro, Joao, Ablin, Pierre, Banna, Vishnu, Blaas, Arno, Henderson, Nick, Noriy, Kari, Busbridge, Dan, Susskind, Josh, Cuturi, Marco, Belousova, Irina, Zappella, Luca, Webb, Russ, Ramapuram, Jason |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Poly-View Contrastive Learning
di: Shidani, Amitis, et al.
Pubblicazione: (2024)
di: Shidani, Amitis, et al.
Pubblicazione: (2024)
Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
Scaling Categorical Flow Maps
di: Davis, Oscar, et al.
Pubblicazione: (2026)
di: Davis, Oscar, et al.
Pubblicazione: (2026)
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
di: Krajewski, Jakub, et al.
Pubblicazione: (2025)
Learning Unmasking Policies for Diffusion Language Models
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
di: Jazbec, Metod, et al.
Pubblicazione: (2025)
Distillation Scaling Laws
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025)
di: Bethune, Louis, et al.
Pubblicazione: (2025)
Theory, Analysis, and Best Practices for Sigmoid Self-Attention
di: Ramapuram, Jason, et al.
Pubblicazione: (2024)
di: Ramapuram, Jason, et al.
Pubblicazione: (2024)
Scaling Properties of Continuous Diffusion Spoken Language Models
di: Ramapuram, Jason, et al.
Pubblicazione: (2026)
di: Ramapuram, Jason, et al.
Pubblicazione: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
Controlling Language and Diffusion Models by Transporting Activations
di: Rodriguez, Pau, et al.
Pubblicazione: (2024)
di: Rodriguez, Pau, et al.
Pubblicazione: (2024)
LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss
di: Rodriguez, Pau, et al.
Pubblicazione: (2025)
di: Rodriguez, Pau, et al.
Pubblicazione: (2025)
Ranking In Generalized Linear Bandits
di: Shidani, Amitis, et al.
Pubblicazione: (2022)
di: Shidani, Amitis, et al.
Pubblicazione: (2022)
Interpreting CLIP: Insights on the Robustness to ImageNet Distribution Shifts
di: Crabbé, Jonathan, et al.
Pubblicazione: (2023)
di: Crabbé, Jonathan, et al.
Pubblicazione: (2023)
Shielded Diffusion: Generating Novel and Diverse Images using Sparse Repellency
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
di: Kirchhof, Michael, et al.
Pubblicazione: (2024)
DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
di: Gualdoni, Eleonora, et al.
Pubblicazione: (2026)
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
The Data-Quality Illusion: Rethinking Classifier-Based Quality Filtering for LLM Pretraining
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
di: Saada, Thiziri Nait, et al.
Pubblicazione: (2025)
Bernstein-type dimension-free concentration for self-normalised martingales
di: Akhavan, Arya, et al.
Pubblicazione: (2025)
di: Akhavan, Arya, et al.
Pubblicazione: (2025)
Scaling Laws for Optimal Data Mixtures
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
di: Shukor, Mustafa, et al.
Pubblicazione: (2025)
The Geometries of Truth Are Orthogonal Across Tasks
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
di: Azizian, Waiss, et al.
Pubblicazione: (2025)
Sample and Map from a Single Convex Potential: Generation using Conjugate Moment Measures
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
di: Vesseron, Nina, et al.
Pubblicazione: (2025)
HyperTransport: Amortized Conditioning of T2I Generative Models
di: Maiorca, Valentino, et al.
Pubblicazione: (2026)
di: Maiorca, Valentino, et al.
Pubblicazione: (2026)
Beyond Real Data: Synthetic Data through the Lens of Regularization
di: Shidani, Amitis, et al.
Pubblicazione: (2025)
di: Shidani, Amitis, et al.
Pubblicazione: (2025)
GenCtrl -- A Formal Controllability Toolkit for Generative Models
di: Cheng, Emily, et al.
Pubblicazione: (2026)
di: Cheng, Emily, et al.
Pubblicazione: (2026)
Amortizing Maximum Inner Product Search with Learned Support Functions
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
di: Olausson, Theo X., et al.
Pubblicazione: (2026)
Multivariate Conformal Prediction using Optimal Transport
di: Klein, Michal, et al.
Pubblicazione: (2025)
di: Klein, Michal, et al.
Pubblicazione: (2025)
Nectar: Neural Estimation of Cached-Token Attention via Regression
di: Monteiro, João, et al.
Pubblicazione: (2026)
di: Monteiro, João, et al.
Pubblicazione: (2026)
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
di: Sakamoto, Keitaro, et al.
Pubblicazione: (2026)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
di: Klissarov, Martin, et al.
Pubblicazione: (2024)
di: Klissarov, Martin, et al.
Pubblicazione: (2024)
Attention when you need
di: Boominathan, Lokesh, et al.
Pubblicazione: (2025)
di: Boominathan, Lokesh, et al.
Pubblicazione: (2025)
Considerations for Distribution Shift Robustness of Diagnostic Models in Healthcare
di: Blaas, Arno, et al.
Pubblicazione: (2024)
di: Blaas, Arno, et al.
Pubblicazione: (2024)
GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning
di: Sapora, Silvia, et al.
Pubblicazione: (2025)
di: Sapora, Silvia, et al.
Pubblicazione: (2025)
Peribalus strictus subsp. strictus
di: Belousova, E. N.
Pubblicazione: (2007)
di: Belousova, E. N.
Pubblicazione: (2007)
Peribalus (Asioperibalus) przewalskii Belousova 2007, sp. n.
di: Belousova, E. N.
Pubblicazione: (2007)
di: Belousova, E. N.
Pubblicazione: (2007)
Status of the fisheries in Rostov Region over the period 2011-2015
di: Belousova, E.V.
Pubblicazione: (2017)
di: Belousova, E.V.
Pubblicazione: (2017)
Documenti analoghi
-
Poly-View Contrastive Learning
di: Shidani, Amitis, et al.
Pubblicazione: (2024) -
Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025) -
Scaling Categorical Flow Maps
di: Davis, Oscar, et al.
Pubblicazione: (2026) -
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
di: Krajewski, Jakub, et al.
Pubblicazione: (2025) -
Learning Unmasking Policies for Diffusion Language Models
di: Jazbec, Metod, et al.
Pubblicazione: (2025)