Attention-Based Sampler for Diffusion Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yuyan, Hou, Kai Syun, Chen, Weiyu, Kwok, James |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
por: Zhou, Xueyu, et al.
Publicado: (2026)
por: Zhou, Xueyu, et al.
Publicado: (2026)
Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models
por: Geiping, Jonas, et al.
Publicado: (2025)
por: Geiping, Jonas, et al.
Publicado: (2025)
Deterministic Differentiable Structured Pruning for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2026)
por: Huang, Weiyu, et al.
Publicado: (2026)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2025)
por: Huang, Weiyu, et al.
Publicado: (2025)
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
por: Chen, Shuhao, et al.
Publicado: (2024)
por: Chen, Shuhao, et al.
Publicado: (2024)
The Crucial Role of Samplers in Online Direct Preference Optimization
por: Shi, Ruizhe, et al.
Publicado: (2024)
por: Shi, Ruizhe, et al.
Publicado: (2024)
Pareto Merging: Multi-Objective Optimization for Preference-Aware Model Merging
por: Chen, Weiyu, et al.
Publicado: (2024)
por: Chen, Weiyu, et al.
Publicado: (2024)
Dynamic Chunking for Diffusion Language Models
por: Zhu, Yichen, et al.
Publicado: (2026)
por: Zhu, Yichen, et al.
Publicado: (2026)
DLM-One: Diffusion Language Models for One-Step Sequence Generation
por: Chen, Tianqi, et al.
Publicado: (2025)
por: Chen, Tianqi, et al.
Publicado: (2025)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
por: Peng, Runyu, et al.
Publicado: (2026)
por: Peng, Runyu, et al.
Publicado: (2026)
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
por: Xi, Haocheng, et al.
Publicado: (2026)
por: Xi, Haocheng, et al.
Publicado: (2026)
A Survey on Training-free Alignment of Large Language Models
por: Pan, Birong, et al.
Publicado: (2025)
por: Pan, Birong, et al.
Publicado: (2025)
Diffusion Guided Language Modeling
por: Lovelace, Justin, et al.
Publicado: (2024)
por: Lovelace, Justin, et al.
Publicado: (2024)
Large Language Diffusion Models
por: Nie, Shen, et al.
Publicado: (2025)
por: Nie, Shen, et al.
Publicado: (2025)
Diffusion Language Models are Provably Optimal Parallel Samplers
por: Jiang, Haozhe, et al.
Publicado: (2025)
por: Jiang, Haozhe, et al.
Publicado: (2025)
Energy-Based Diffusion Language Models for Text Generation
por: Xu, Minkai, et al.
Publicado: (2024)
por: Xu, Minkai, et al.
Publicado: (2024)
Harnessing Large Language Models for Disaster Management: A Survey
por: Lei, Zhenyu, et al.
Publicado: (2025)
por: Lei, Zhenyu, et al.
Publicado: (2025)
Efficient Pareto Manifold Learning with Low-Rank Structure
por: Chen, Weiyu, et al.
Publicado: (2024)
por: Chen, Weiyu, et al.
Publicado: (2024)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
por: Peng, Runyu, et al.
Publicado: (2026)
por: Peng, Runyu, et al.
Publicado: (2026)
Sequential Diffusion Language Models
por: Liu, Yangzhou, et al.
Publicado: (2025)
por: Liu, Yangzhou, et al.
Publicado: (2025)
dLLM: Simple Diffusion Language Modeling
por: Zhou, Zhanhui, et al.
Publicado: (2026)
por: Zhou, Zhanhui, et al.
Publicado: (2026)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
DPad: Efficient Diffusion Language Models with Suffix Dropout
por: Chen, Xinhua, et al.
Publicado: (2025)
por: Chen, Xinhua, et al.
Publicado: (2025)
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models
por: Zhang, Shuibai, et al.
Publicado: (2026)
por: Zhang, Shuibai, et al.
Publicado: (2026)
Anchored Diffusion Language Model
por: Rout, Litu, et al.
Publicado: (2025)
por: Rout, Litu, et al.
Publicado: (2025)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
por: Jiang, Weisen, et al.
Publicado: (2023)
por: Jiang, Weisen, et al.
Publicado: (2023)
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention
por: Gao, Bin, et al.
Publicado: (2024)
por: Gao, Bin, et al.
Publicado: (2024)
Few-Step Diffusion Language Models via Trajectory Self-Distillation
por: Zhang, Tunyu, et al.
Publicado: (2026)
por: Zhang, Tunyu, et al.
Publicado: (2026)
Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
por: Zhou, Cai, et al.
Publicado: (2025)
por: Zhou, Cai, et al.
Publicado: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler
por: Wang, Minghan, et al.
Publicado: (2026)
por: Wang, Minghan, et al.
Publicado: (2026)
Large Language Models Reveal Information Operation Goals, Tactics, and Narrative Frames
por: Burghardt, Keith, et al.
Publicado: (2024)
por: Burghardt, Keith, et al.
Publicado: (2024)
LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling
por: Chen, Yuxin, et al.
Publicado: (2026)
por: Chen, Yuxin, et al.
Publicado: (2026)
Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
por: Song, Yuxuan, et al.
Publicado: (2025)
por: Song, Yuxuan, et al.
Publicado: (2025)
SAP: Syntactic Attention Pruning for Transformer-based Language Models
por: Lee, Tzu-Yun, et al.
Publicado: (2025)
por: Lee, Tzu-Yun, et al.
Publicado: (2025)
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
por: Baker, Mohammed Abu, et al.
Publicado: (2025)
por: Baker, Mohammed Abu, et al.
Publicado: (2025)
Deconstructing Attention: Investigating Design Principles for Effective Language Modeling
por: Xue, Huiyin, et al.
Publicado: (2025)
por: Xue, Huiyin, et al.
Publicado: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
por: Das, Anindya Sundar, et al.
Publicado: (2025)
por: Das, Anindya Sundar, et al.
Publicado: (2025)
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
por: Bai, Haolei, et al.
Publicado: (2026)
por: Bai, Haolei, et al.
Publicado: (2026)
Ejemplares similares
-
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
por: Zhou, Xueyu, et al.
Publicado: (2026) -
Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models
por: Geiping, Jonas, et al.
Publicado: (2025) -
Deterministic Differentiable Structured Pruning for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2026) -
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2025) -
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
por: Chen, Shuhao, et al.
Publicado: (2024)