Infinite Mask Diffusion for Few-Step Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yoo, Jaehoon, Kim, Wonjung, Lee, Chanhyuk, Hong, Seunghoon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReDi: Rectified Discrete Flow
por: Yoo, Jaehoon, et al.
Publicado: (2025)
por: Yoo, Jaehoon, et al.
Publicado: (2025)
Flow Map Language Models: One-step Language Modeling via Continuous Denoising
por: Lee, Chanhyuk, et al.
Publicado: (2026)
por: Lee, Chanhyuk, et al.
Publicado: (2026)
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
por: Lee, Chanhyuk, et al.
Publicado: (2025)
por: Lee, Chanhyuk, et al.
Publicado: (2025)
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
por: Kim, Jaehoon, et al.
Publicado: (2026)
por: Kim, Jaehoon, et al.
Publicado: (2026)
Revisiting Weight Averaging for Model Merging
por: Choi, Jiho, et al.
Publicado: (2024)
por: Choi, Jiho, et al.
Publicado: (2024)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
por: Lee, Hanna, et al.
Publicado: (2026)
por: Lee, Hanna, et al.
Publicado: (2026)
FlowLM: Few-Step Language Modeling via Diffusion-to-Flow Adaptation
por: Zhang, Runzhe, et al.
Publicado: (2026)
por: Zhang, Runzhe, et al.
Publicado: (2026)
Training-Free Refinement of Flow Matching with Divergence-based Sampling
por: Cha, Yeonwoo, et al.
Publicado: (2026)
por: Cha, Yeonwoo, et al.
Publicado: (2026)
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
A Theoretical Analysis of Why Masked Diffusion Models Mitigate the Reversal Curse
por: Jeon, Moongyu, et al.
Publicado: (2026)
por: Jeon, Moongyu, et al.
Publicado: (2026)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
por: Lee, Kyumin, et al.
Publicado: (2025)
por: Lee, Kyumin, et al.
Publicado: (2025)
Universal Few-Shot Spatial Control for Diffusion Models
por: Nguyen, Kiet T., et al.
Publicado: (2025)
por: Nguyen, Kiet T., et al.
Publicado: (2025)
Understanding and Accelerating the Training of Masked Diffusion Language Models
por: Hong, Chunsan, et al.
Publicado: (2026)
por: Hong, Chunsan, et al.
Publicado: (2026)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
por: Yang, Jingyi, et al.
Publicado: (2025)
por: Yang, Jingyi, et al.
Publicado: (2025)
Mask-guided BERT for Few Shot Text Classification
por: Liao, Wenxiong, et al.
Publicado: (2023)
por: Liao, Wenxiong, et al.
Publicado: (2023)
The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models
por: Kim, Dueun, et al.
Publicado: (2026)
por: Kim, Dueun, et al.
Publicado: (2026)
HyperFlow: Gradient-Free Emulation of Few-Shot Fine-Tuning
por: Kim, Donggyun, et al.
Publicado: (2025)
por: Kim, Donggyun, et al.
Publicado: (2025)
FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
por: Monsefi, Amin Karimi, et al.
Publicado: (2025)
por: Monsefi, Amin Karimi, et al.
Publicado: (2025)
Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models
por: Kim, Jaemin, et al.
Publicado: (2026)
por: Kim, Jaemin, et al.
Publicado: (2026)
Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
por: Kang, Jaehoon, et al.
Publicado: (2026)
por: Kang, Jaehoon, et al.
Publicado: (2026)
Exploiting the Potential of Seq2Seq Models as Robust Few-Shot Learners
por: Lee, Jihyeon, et al.
Publicado: (2023)
por: Lee, Jihyeon, et al.
Publicado: (2023)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
por: Zhong, Qiyong, et al.
Publicado: (2026)
por: Zhong, Qiyong, et al.
Publicado: (2026)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
por: Tang, Xiangru, et al.
Publicado: (2024)
por: Tang, Xiangru, et al.
Publicado: (2024)
A Two-Step Approach for Data-Efficient French Pronunciation Learning
por: Lee, Hoyeon, et al.
Publicado: (2024)
por: Lee, Hoyeon, et al.
Publicado: (2024)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
por: Ghosal, Soumya Suvra, et al.
Publicado: (2026)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2026)
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
por: Kim, Jaeik, et al.
Publicado: (2026)
por: Kim, Jaeik, et al.
Publicado: (2026)
DCG-SQL: Enhancing In-Context Learning for Text-to-SQL with Deep Contextual Schema Link Graph
por: Lee, Jihyung, et al.
Publicado: (2025)
por: Lee, Jihyung, et al.
Publicado: (2025)
TabDistill: Distilling Transformers into Neural Nets for Few-Shot Tabular Classification
por: Dissanayake, Pasan, et al.
Publicado: (2025)
por: Dissanayake, Pasan, et al.
Publicado: (2025)
Machine Unlearning for Masked Diffusion Language Models
por: Lee, Georu, et al.
Publicado: (2026)
por: Lee, Georu, et al.
Publicado: (2026)
Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection
por: Kim, San, et al.
Publicado: (2025)
por: Kim, San, et al.
Publicado: (2025)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
por: Yu, Seonghoon, et al.
Publicado: (2026)
por: Yu, Seonghoon, et al.
Publicado: (2026)
MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification
por: Zheng, Bo, et al.
Publicado: (2026)
por: Zheng, Bo, et al.
Publicado: (2026)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
por: Huang, Pengcheng, et al.
Publicado: (2025)
por: Huang, Pengcheng, et al.
Publicado: (2025)
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
por: Jeung, Wonje, et al.
Publicado: (2025)
por: Jeung, Wonje, et al.
Publicado: (2025)
DSG-KD: Knowledge Distillation from Domain-Specific to General Language Models
por: Cho, Sangyeon, et al.
Publicado: (2024)
por: Cho, Sangyeon, et al.
Publicado: (2024)
Continuous-Time Distribution Matching for Few-Step Diffusion Distillation
por: Liu, Tao, et al.
Publicado: (2026)
por: Liu, Tao, et al.
Publicado: (2026)
Diffutron: A Masked Diffusion Language Model for Turkish Language
por: Kocabay, Şuayp Talha, et al.
Publicado: (2026)
por: Kocabay, Şuayp Talha, et al.
Publicado: (2026)
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
por: Wang, Chenyu, et al.
Publicado: (2025)
por: Wang, Chenyu, et al.
Publicado: (2025)
THEME: Enhancing Thematic Investing with Semantic Stock Representations and Temporal Dynamics
por: Lee, Hoyoung, et al.
Publicado: (2025)
por: Lee, Hoyoung, et al.
Publicado: (2025)
Variational Masked Diffusion Models
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
Ejemplares similares
-
ReDi: Rectified Discrete Flow
por: Yoo, Jaehoon, et al.
Publicado: (2025) -
Flow Map Language Models: One-step Language Modeling via Continuous Denoising
por: Lee, Chanhyuk, et al.
Publicado: (2026) -
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
por: Lee, Chanhyuk, et al.
Publicado: (2025) -
OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models
por: Kim, Jaehoon, et al.
Publicado: (2026) -
Revisiting Weight Averaging for Model Merging
por: Choi, Jiho, et al.
Publicado: (2024)