Diffusion Language Models Generation Can Be Halted Early
Fuente:
arXiv
Saved in:
| Main Authors: | Vaina, Sofia Maria Lo Cicero, Balagansky, Nikita, Gavrilov, Daniil |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
by: Aksenov, Yaroslav, et al.
Published: (2024)
by: Aksenov, Yaroslav, et al.
Published: (2024)
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
by: Laptev, Daniil, et al.
Published: (2025)
by: Laptev, Daniil, et al.
Published: (2025)
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
by: Kurochkin, Vadim, et al.
Published: (2025)
by: Kurochkin, Vadim, et al.
Published: (2025)
Teach Old SAEs New Domain Tricks with Boosting
by: Koriagin, Nikita, et al.
Published: (2025)
by: Koriagin, Nikita, et al.
Published: (2025)
You Do Not Fully Utilize Transformer's Representation Capacity
by: Gerasimov, Gleb, et al.
Published: (2025)
by: Gerasimov, Gleb, et al.
Published: (2025)
Learn Your Reference Model for Real Good Alignment
by: Gorbatovski, Alexey, et al.
Published: (2024)
by: Gorbatovski, Alexey, et al.
Published: (2024)
Mechanistic Permutability: Match Features Across Layers
by: Balagansky, Nikita, et al.
Published: (2024)
by: Balagansky, Nikita, et al.
Published: (2024)
Next Embedding Prediction Makes World Models Stronger
by: Bredis, George, et al.
Published: (2026)
by: Bredis, George, et al.
Published: (2026)
Mashup Learning: Faster Finetuning by Remixing Past Checkpoints
by: Vaina, Sofia Maria Lo Cicero, et al.
Published: (2026)
by: Vaina, Sofia Maria Lo Cicero, et al.
Published: (2026)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
by: Balagansky, Nikita, et al.
Published: (2025)
by: Balagansky, Nikita, et al.
Published: (2025)
Guided Star-Shaped Masked Diffusion
by: Meshchaninov, Viacheslav, et al.
Published: (2025)
by: Meshchaninov, Viacheslav, et al.
Published: (2025)
Trust-Region Behavior Blending for On-Policy Distillation
by: Plyusov, Daniil, et al.
Published: (2026)
by: Plyusov, Daniil, et al.
Published: (2026)
Steering LLM Reasoning Through Bias-Only Adaptation
by: Sinii, Viacheslav, et al.
Published: (2025)
by: Sinii, Viacheslav, et al.
Published: (2025)
Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models
by: Sedykh, Ivan, et al.
Published: (2026)
by: Sedykh, Ivan, et al.
Published: (2026)
Small Vectors, Big Effects: A Mechanistic Study of RL-Induced Reasoning via Steering Vectors
by: Sinii, Viacheslav, et al.
Published: (2025)
by: Sinii, Viacheslav, et al.
Published: (2025)
Review, Remask, Refine (R3): Process-Guided Block Diffusion for Text Generation
by: Mounier, Nikita, et al.
Published: (2025)
by: Mounier, Nikita, et al.
Published: (2025)
Non-Halting Queries: Exploiting Fixed Points in LLMs
by: Hammouri, Ghaith, et al.
Published: (2024)
by: Hammouri, Ghaith, et al.
Published: (2024)
Just on Time: Token-Level Early Stopping for Diffusion Language Models
by: Kohut, Zahar, et al.
Published: (2026)
by: Kohut, Zahar, et al.
Published: (2026)
Can Large Language Models Generalize Procedures Across Representations?
by: Lin, Fangru, et al.
Published: (2026)
by: Lin, Fangru, et al.
Published: (2026)
Energy-Based Diffusion Language Models for Text Generation
by: Xu, Minkai, et al.
Published: (2024)
by: Xu, Minkai, et al.
Published: (2024)
Can Memory-Augmented Language Models Generalize on Reasoning-in-a-Haystack Tasks?
by: Das, Payel, et al.
Published: (2025)
by: Das, Payel, et al.
Published: (2025)
Generative Frontiers: Why Evaluation Matters for Diffusion Language Models
by: Pynadath, Patrick, et al.
Published: (2026)
by: Pynadath, Patrick, et al.
Published: (2026)
Unlocking the Potentials of Retrieval-Augmented Generation for Diffusion Language Models
by: Yu, Chuanyue, et al.
Published: (2026)
by: Yu, Chuanyue, et al.
Published: (2026)
Can Language Models Learn Typologically Implausible Languages?
by: Xu, Tianyang, et al.
Published: (2025)
by: Xu, Tianyang, et al.
Published: (2025)
Quantization of Large Language Models with an Overdetermined Basis
by: Merkulov, Daniil, et al.
Published: (2024)
by: Merkulov, Daniil, et al.
Published: (2024)
Test Code Generation for Telecom Software Systems using Two-Stage Generative Model
by: Nabeel, Mohamad, et al.
Published: (2024)
by: Nabeel, Mohamad, et al.
Published: (2024)
On-Device Collaborative Language Modeling via a Mixture of Generalists and Specialists
by: Fan, Dongyang, et al.
Published: (2024)
by: Fan, Dongyang, et al.
Published: (2024)
DLM-One: Diffusion Language Models for One-Step Sequence Generation
by: Chen, Tianqi, et al.
Published: (2025)
by: Chen, Tianqi, et al.
Published: (2025)
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
by: Bai, Haolei, et al.
Published: (2026)
by: Bai, Haolei, et al.
Published: (2026)
Can Language Models Compose Skills In-Context?
by: Liu, Zidong, et al.
Published: (2025)
by: Liu, Zidong, et al.
Published: (2025)
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning
by: Ye, Jiasheng, et al.
Published: (2023)
by: Ye, Jiasheng, et al.
Published: (2023)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
by: Christopher, Jacob K, et al.
Published: (2024)
by: Christopher, Jacob K, et al.
Published: (2024)
A Single-Layer Model Can Do Language Modeling
by: Wang, Zanmin
Published: (2026)
by: Wang, Zanmin
Published: (2026)
End-to-End Ontology Learning with Large Language Models
by: Lo, Andy, et al.
Published: (2024)
by: Lo, Andy, et al.
Published: (2024)
Improving Variable-Length Generation in Diffusion Language Models via Length Regularization
by: Cheng, Zicong, et al.
Published: (2026)
by: Cheng, Zicong, et al.
Published: (2026)
Sequential Diffusion Language Models
by: Liu, Yangzhou, et al.
Published: (2025)
by: Liu, Yangzhou, et al.
Published: (2025)
Large Language Diffusion Models
by: Nie, Shen, et al.
Published: (2025)
by: Nie, Shen, et al.
Published: (2025)
Diffusion Guided Language Modeling
by: Lovelace, Justin, et al.
Published: (2024)
by: Lovelace, Justin, et al.
Published: (2024)
Anchored Diffusion Language Model
by: Rout, Litu, et al.
Published: (2025)
by: Rout, Litu, et al.
Published: (2025)
nach0-pc: Multi-task Language Model with Molecular Point Cloud Encoder
by: Kuznetsov, Maksim, et al.
Published: (2024)
by: Kuznetsov, Maksim, et al.
Published: (2024)
Similar Items
-
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
by: Aksenov, Yaroslav, et al.
Published: (2024) -
Analyze Feature Flow to Enhance Interpretation and Steering in Language Models
by: Laptev, Daniil, et al.
Published: (2025) -
Kronecker Factorization Improves Efficiency and Interpretability of Sparse Autoencoders
by: Kurochkin, Vadim, et al.
Published: (2025) -
Teach Old SAEs New Domain Tricks with Boosting
by: Koriagin, Nikita, et al.
Published: (2025) -
You Do Not Fully Utilize Transformer's Representation Capacity
by: Gerasimov, Gleb, et al.
Published: (2025)