Towards Closing the Autoregressive Gap in Language Modeling via Entropy-Gated Continuous Bitstream Diffusion
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Batzolis, Georgios, Girolami, Mark, Ambrogioni, Luca |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
von: Pham, Bao, et al.
Veröffentlicht: (2026)
von: Pham, Bao, et al.
Veröffentlicht: (2026)
Causal Autoregressive Diffusion Language Model
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
von: Gong, Shansan, et al.
Veröffentlicht: (2024)
von: Gong, Shansan, et al.
Veröffentlicht: (2024)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
von: Nakka, Kalyan, et al.
Veröffentlicht: (2025)
von: Nakka, Kalyan, et al.
Veröffentlicht: (2025)
Noise Scheduling as Information-Guided Allocation in Diffusion Training
von: Raya, Gabriel, et al.
Veröffentlicht: (2026)
von: Raya, Gabriel, et al.
Veröffentlicht: (2026)
Continuous Autoregressive Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling
von: Čugalj, Dejan, et al.
Veröffentlicht: (2026)
von: Čugalj, Dejan, et al.
Veröffentlicht: (2026)
MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies
von: Zhang, Shiyue, et al.
Veröffentlicht: (2023)
von: Zhang, Shiyue, et al.
Veröffentlicht: (2023)
Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
von: Wang, Jiapeng, et al.
Veröffentlicht: (2025)
von: Wang, Jiapeng, et al.
Veröffentlicht: (2025)
Closing the Confidence-Faithfulness Gap in Large Language Models
von: Miao, Miranda Muqing, et al.
Veröffentlicht: (2026)
von: Miao, Miranda Muqing, et al.
Veröffentlicht: (2026)
Differences in Text Generated by Diffusion and Autoregressive Language Models
von: Zhang, Zeyang, et al.
Veröffentlicht: (2026)
von: Zhang, Zeyang, et al.
Veröffentlicht: (2026)
Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison
von: Vicentino, Caio
Veröffentlicht: (2026)
von: Vicentino, Caio
Veröffentlicht: (2026)
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
von: Zhang, Siyue, et al.
Veröffentlicht: (2025)
von: Zhang, Siyue, et al.
Veröffentlicht: (2025)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
von: Lin, Liang, et al.
Veröffentlicht: (2026)
von: Lin, Liang, et al.
Veröffentlicht: (2026)
FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation
von: He, Siyang, et al.
Veröffentlicht: (2026)
von: He, Siyang, et al.
Veröffentlicht: (2026)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
von: Hou, Yuchen, et al.
Veröffentlicht: (2026)
von: Hou, Yuchen, et al.
Veröffentlicht: (2026)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
von: Sun, Bowen, et al.
Veröffentlicht: (2025)
von: Sun, Bowen, et al.
Veröffentlicht: (2025)
EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models
von: Cheong, Minsoo, et al.
Veröffentlicht: (2026)
von: Cheong, Minsoo, et al.
Veröffentlicht: (2026)
Projected Autoregression: Autoregressive Language Generation in Continuous State Space
von: Naparstek, Oshri
Veröffentlicht: (2026)
von: Naparstek, Oshri
Veröffentlicht: (2026)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
von: Zhang, Ruixiang, et al.
Veröffentlicht: (2025)
von: Zhang, Ruixiang, et al.
Veröffentlicht: (2025)
GateKD: Confidence-Gated Closed-Loop Distillation for Robust Reasoning
von: Sermsri, Kasidit, et al.
Veröffentlicht: (2026)
von: Sermsri, Kasidit, et al.
Veröffentlicht: (2026)
Gated Integration of Low-Rank Adaptation for Continual Learning of Large Language Models
von: Liang, Yan-Shuo, et al.
Veröffentlicht: (2025)
von: Liang, Yan-Shuo, et al.
Veröffentlicht: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
von: Wang, Chaoren, et al.
Veröffentlicht: (2026)
von: Wang, Chaoren, et al.
Veröffentlicht: (2026)
Masked Diffusion Language Models with Frequency-Informed Training
von: Kosmopoulou, Despoina, et al.
Veröffentlicht: (2025)
von: Kosmopoulou, Despoina, et al.
Veröffentlicht: (2025)
Reversal Invariance in Autoregressive Language Models
von: Sahasrabudhe, Mihir
Veröffentlicht: (2025)
von: Sahasrabudhe, Mihir
Veröffentlicht: (2025)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
von: Li, Pengxiang, et al.
Veröffentlicht: (2026)
von: Li, Pengxiang, et al.
Veröffentlicht: (2026)
How Out-of-Equilibrium Phase Transitions can Seed Pattern Formation in Trained Diffusion Models
von: Ambrogioni, Luca
Veröffentlicht: (2026)
von: Ambrogioni, Luca
Veröffentlicht: (2026)
Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion
von: Xu, Yuanfeng, et al.
Veröffentlicht: (2026)
von: Xu, Yuanfeng, et al.
Veröffentlicht: (2026)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
von: Xiao, Yisong, et al.
Veröffentlicht: (2025)
von: Xiao, Yisong, et al.
Veröffentlicht: (2025)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
von: Zhang, Wei, et al.
Veröffentlicht: (2026)
von: Zhang, Wei, et al.
Veröffentlicht: (2026)
Revisiting Knowledge Distillation for Autoregressive Language Models
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
Autoregressive Large Language Models are Computationally Universal
von: Schuurmans, Dale, et al.
Veröffentlicht: (2024)
von: Schuurmans, Dale, et al.
Veröffentlicht: (2024)
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
von: Fu, Yonggan, et al.
Veröffentlicht: (2025)
TextLDM: Language Modeling with Continuous Latent Diffusion
von: Jiang, Jiaxiu, et al.
Veröffentlicht: (2026)
von: Jiang, Jiaxiu, et al.
Veröffentlicht: (2026)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
Combining Autoregressive and Autoencoder Language Models for Text Classification
von: Gonçalves, João
Veröffentlicht: (2024)
von: Gonçalves, João
Veröffentlicht: (2024)
Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation
von: Du, Tianqi, et al.
Veröffentlicht: (2026)
von: Du, Tianqi, et al.
Veröffentlicht: (2026)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
Learning from Imperfect Data: Towards Efficient Knowledge Distillation of Autoregressive Language Models for Text-to-SQL
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
von: Zhong, Qihuang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
von: Pham, Bao, et al.
Veröffentlicht: (2026) -
Causal Autoregressive Diffusion Language Model
von: Ruan, Junhao, et al.
Veröffentlicht: (2026) -
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
von: Gong, Shansan, et al.
Veröffentlicht: (2024) -
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
von: Nakka, Kalyan, et al.
Veröffentlicht: (2025) -
Noise Scheduling as Information-Guided Allocation in Diffusion Training
von: Raya, Gabriel, et al.
Veröffentlicht: (2026)