Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Bowen, Cai, Yujun, Yang, Ming-Hsuan, Wang, Yiwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unveiling the Potential of Diffusion Large Language Model in Controllable Generation
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
Structured Attention Matters to Multimodal LLMs in Document Understanding
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Causal Autoregressive Diffusion Language Model
par: Ruan, Junhao, et autres
Publié: (2026)
par: Ruan, Junhao, et autres
Publié: (2026)
Symbolic or Numerical? Understanding Physics Problem Solving in Reasoning LLMs
par: Dan, Nifu, et autres
Publié: (2025)
par: Dan, Nifu, et autres
Publié: (2025)
PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
Exploring and Improving Drafts in Blockwise Parallel Decoding
par: Kim, Taehyeon, et autres
Publié: (2024)
par: Kim, Taehyeon, et autres
Publié: (2024)
Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
par: Rawlekar, Samyak, et autres
Publié: (2026)
par: Rawlekar, Samyak, et autres
Publié: (2026)
Do "New Snow Tablets" Contain Snow? Large Language Models Over-Rely on Names to Identify Ingredients of Chinese Drugs
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
par: Sun, Bowen, et autres
Publié: (2025)
par: Sun, Bowen, et autres
Publié: (2025)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
par: Liu, Aiwei, et autres
Publié: (2025)
par: Liu, Aiwei, et autres
Publié: (2025)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
par: Li, Pengxiang, et autres
Publié: (2026)
par: Li, Pengxiang, et autres
Publié: (2026)
Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree
par: Gao, Xiangxiang, et autres
Publié: (2024)
par: Gao, Xiangxiang, et autres
Publié: (2024)
Adaptive Blockwise Search: Inference-Time Alignment for Large Language Models
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
Bitune: Leveraging Bidirectional Attention to Improve Decoder-Only LLMs
par: Kopiczko, Dawid J., et autres
Publié: (2024)
par: Kopiczko, Dawid J., et autres
Publié: (2024)
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
par: Li, Zhecheng, et autres
Publié: (2025)
par: Li, Zhecheng, et autres
Publié: (2025)
Mapping the Minds of LLMs: A Graph-Based Analysis of Reasoning LLM
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation
par: Li, Sifan, et autres
Publié: (2026)
par: Li, Sifan, et autres
Publié: (2026)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Understanding GUI Agent Localization Biases through Logit Sharpness
par: Tao, Xingjian, et autres
Publié: (2025)
par: Tao, Xingjian, et autres
Publié: (2025)
Are LLMs Really Not Knowledgeable? Mining the Submerged Knowledge in LLMs' Memory
par: Tao, Xingjian, et autres
Publié: (2024)
par: Tao, Xingjian, et autres
Publié: (2024)
A Factuality and Diversity Reconciled Decoding Method for Knowledge-Grounded Dialogue Generation
par: Yang, Chenxu, et autres
Publié: (2024)
par: Yang, Chenxu, et autres
Publié: (2024)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
par: Li, Jia-Nan, et autres
Publié: (2025)
par: Li, Jia-Nan, et autres
Publié: (2025)
$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement
par: Li, Zhecheng, et autres
Publié: (2025)
par: Li, Zhecheng, et autres
Publié: (2025)
FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation
par: He, Siyang, et autres
Publié: (2026)
par: He, Siyang, et autres
Publié: (2026)
Bidirectional Awareness Induction in Autoregressive Seq2Seq Models
par: Hu, Jia Cheng, et autres
Publié: (2024)
par: Hu, Jia Cheng, et autres
Publié: (2024)
An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models
par: Feng, Yuming, et autres
Publié: (2026)
par: Feng, Yuming, et autres
Publié: (2026)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
par: You, Haoran, et autres
Publié: (2024)
par: You, Haoran, et autres
Publié: (2024)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
par: Wang, Yujun, et autres
Publié: (2025)
par: Wang, Yujun, et autres
Publié: (2025)
SparseD: Sparse Attention for Diffusion Language Models
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
par: Lin, Liang, et autres
Publié: (2026)
par: Lin, Liang, et autres
Publié: (2026)
DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
par: Li, Guanghao, et autres
Publié: (2025)
par: Li, Guanghao, et autres
Publié: (2025)
Reversible Diffusion Decoding for Diffusion Language Models
par: Wang, Xinyun, et autres
Publié: (2026)
par: Wang, Xinyun, et autres
Publié: (2026)
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
par: Gong, Shansan, et autres
Publié: (2024)
par: Gong, Shansan, et autres
Publié: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
Documents similaires
-
Unveiling the Potential of Diffusion Large Language Model in Controllable Generation
par: Xiong, Zhen, et autres
Publié: (2025) -
Structured Attention Matters to Multimodal LLMs in Document Understanding
par: Liu, Chang, et autres
Publié: (2025) -
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025) -
Causal Autoregressive Diffusion Language Model
par: Ruan, Junhao, et autres
Publié: (2026) -
Symbolic or Numerical? Understanding Physics Problem Solving in Reasoning LLMs
par: Dan, Nifu, et autres
Publié: (2025)