Infinite Mask Diffusion for Few-Step Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoo, Jaehoon, Kim, Wonjung, Lee, Chanhyuk, Hong, Seunghoon |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReDi: Rectified Discrete Flow
par: Yoo, Jaehoon, et autres
Publié: (2025)
par: Yoo, Jaehoon, et autres
Publié: (2025)
Flow Map Language Models: One-step Language Modeling via Continuous Denoising
par: Lee, Chanhyuk, et autres
Publié: (2026)
par: Lee, Chanhyuk, et autres
Publié: (2026)
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
par: Lee, Chanhyuk, et autres
Publié: (2025)
par: Lee, Chanhyuk, et autres
Publié: (2025)
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
par: Kim, Jaehoon, et autres
Publié: (2026)
par: Kim, Jaehoon, et autres
Publié: (2026)
Revisiting Weight Averaging for Model Merging
par: Choi, Jiho, et autres
Publié: (2024)
par: Choi, Jiho, et autres
Publié: (2024)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
par: Lee, Hanna, et autres
Publié: (2026)
par: Lee, Hanna, et autres
Publié: (2026)
FlowLM: Few-Step Language Modeling via Diffusion-to-Flow Adaptation
par: Zhang, Runzhe, et autres
Publié: (2026)
par: Zhang, Runzhe, et autres
Publié: (2026)
Training-Free Refinement of Flow Matching with Divergence-based Sampling
par: Cha, Yeonwoo, et autres
Publié: (2026)
par: Cha, Yeonwoo, et autres
Publié: (2026)
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
A Theoretical Analysis of Why Masked Diffusion Models Mitigate the Reversal Curse
par: Jeon, Moongyu, et autres
Publié: (2026)
par: Jeon, Moongyu, et autres
Publié: (2026)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
par: Lee, Kyumin, et autres
Publié: (2025)
par: Lee, Kyumin, et autres
Publié: (2025)
Universal Few-Shot Spatial Control for Diffusion Models
par: Nguyen, Kiet T., et autres
Publié: (2025)
par: Nguyen, Kiet T., et autres
Publié: (2025)
Understanding and Accelerating the Training of Masked Diffusion Language Models
par: Hong, Chunsan, et autres
Publié: (2026)
par: Hong, Chunsan, et autres
Publié: (2026)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
Mask-guided BERT for Few Shot Text Classification
par: Liao, Wenxiong, et autres
Publié: (2023)
par: Liao, Wenxiong, et autres
Publié: (2023)
The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models
par: Kim, Dueun, et autres
Publié: (2026)
par: Kim, Dueun, et autres
Publié: (2026)
HyperFlow: Gradient-Free Emulation of Few-Shot Fine-Tuning
par: Kim, Donggyun, et autres
Publié: (2025)
par: Kim, Donggyun, et autres
Publié: (2025)
FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models
par: Kim, Jaemin, et autres
Publié: (2026)
par: Kim, Jaemin, et autres
Publié: (2026)
Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
par: Kang, Jaehoon, et autres
Publié: (2026)
par: Kang, Jaehoon, et autres
Publié: (2026)
Exploiting the Potential of Seq2Seq Models as Robust Few-Shot Learners
par: Lee, Jihyeon, et autres
Publié: (2023)
par: Lee, Jihyeon, et autres
Publié: (2023)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
par: Zhong, Qiyong, et autres
Publié: (2026)
par: Zhong, Qiyong, et autres
Publié: (2026)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
par: Tang, Xiangru, et autres
Publié: (2024)
par: Tang, Xiangru, et autres
Publié: (2024)
A Two-Step Approach for Data-Efficient French Pronunciation Learning
par: Lee, Hoyeon, et autres
Publié: (2024)
par: Lee, Hoyeon, et autres
Publié: (2024)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
par: Kim, Jaeik, et autres
Publié: (2026)
par: Kim, Jaeik, et autres
Publié: (2026)
DCG-SQL: Enhancing In-Context Learning for Text-to-SQL with Deep Contextual Schema Link Graph
par: Lee, Jihyung, et autres
Publié: (2025)
par: Lee, Jihyung, et autres
Publié: (2025)
TabDistill: Distilling Transformers into Neural Nets for Few-Shot Tabular Classification
par: Dissanayake, Pasan, et autres
Publié: (2025)
par: Dissanayake, Pasan, et autres
Publié: (2025)
Machine Unlearning for Masked Diffusion Language Models
par: Lee, Georu, et autres
Publié: (2026)
par: Lee, Georu, et autres
Publié: (2026)
Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection
par: Kim, San, et autres
Publié: (2025)
par: Kim, San, et autres
Publié: (2025)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
par: Yu, Seonghoon, et autres
Publié: (2026)
par: Yu, Seonghoon, et autres
Publié: (2026)
MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification
par: Zheng, Bo, et autres
Publié: (2026)
par: Zheng, Bo, et autres
Publié: (2026)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
par: Huang, Pengcheng, et autres
Publié: (2025)
par: Huang, Pengcheng, et autres
Publié: (2025)
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
par: Jeung, Wonje, et autres
Publié: (2025)
par: Jeung, Wonje, et autres
Publié: (2025)
DSG-KD: Knowledge Distillation from Domain-Specific to General Language Models
par: Cho, Sangyeon, et autres
Publié: (2024)
par: Cho, Sangyeon, et autres
Publié: (2024)
Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
par: Liu, Tao, et autres
Publié: (2026)
par: Liu, Tao, et autres
Publié: (2026)
Diffutron: A Masked Diffusion Language Model for Turkish Language
par: Kocabay, Şuayp Talha, et autres
Publié: (2026)
par: Kocabay, Şuayp Talha, et autres
Publié: (2026)
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
par: Wang, Chenyu, et autres
Publié: (2025)
par: Wang, Chenyu, et autres
Publié: (2025)
THEME: Enhancing Thematic Investing with Semantic Stock Representations and Temporal Dynamics
par: Lee, Hoyoung, et autres
Publié: (2025)
par: Lee, Hoyoung, et autres
Publié: (2025)
Variational Masked Diffusion Models
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Documents similaires
-
ReDi: Rectified Discrete Flow
par: Yoo, Jaehoon, et autres
Publié: (2025) -
Flow Map Language Models: One-step Language Modeling via Continuous Denoising
par: Lee, Chanhyuk, et autres
Publié: (2026) -
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
par: Lee, Chanhyuk, et autres
Publié: (2025) -
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
par: Kim, Jaehoon, et autres
Publié: (2026) -
Revisiting Weight Averaging for Model Merging
par: Choi, Jiho, et autres
Publié: (2024)