Layer Collapse in Diffusion Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Conzelmann, Alexander, Catalan-Tatjer, Albert, Liu, Shiwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training Dynamics Impact Post-Training Quantization Robustness
par: Catalan-Tatjer, Albert, et autres
Publié: (2025)
par: Catalan-Tatjer, Albert, et autres
Publié: (2025)
Reducing Storage of Pretrained Neural Networks by Rate-Constrained Quantization and Entropy Coding
par: Conzelmann, Alexander, et autres
Publié: (2025)
par: Conzelmann, Alexander, et autres
Publié: (2025)
Decentralized Task Offloading and Load-Balancing for Mobile Edge Computing in Dense Networks
par: Yahya, Mariam, et autres
Publié: (2024)
par: Yahya, Mariam, et autres
Publié: (2024)
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
par: Lu, Haiquan, et autres
Publié: (2024)
par: Lu, Haiquan, et autres
Publié: (2024)
Quantifying Error Propagation and Model Collapse in Diffusion Models
par: Khelifa, Nail B., et autres
Publié: (2026)
par: Khelifa, Nail B., et autres
Publié: (2026)
dgMARK: Decoding-Guided Watermarking for Diffusion Language Models
par: Hong, Pyo Min, et autres
Publié: (2026)
par: Hong, Pyo Min, et autres
Publié: (2026)
ActTail: Global Activation Sparsity in Large Language Models
par: Hou, Wenwen, et autres
Publié: (2026)
par: Hou, Wenwen, et autres
Publié: (2026)
Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN
par: Li, Pengxiang, et autres
Publié: (2024)
par: Li, Pengxiang, et autres
Publié: (2024)
Path-Dependent Denoising: A Non-Conservative Field Perspective on Order Collapse in Diffusion Language Models
par: Kim, Jeonseong
Publié: (2026)
par: Kim, Jeonseong
Publié: (2026)
On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Dominating vs. Dominated: Generative Collapse in Diffusion Models
par: Jeong, Hayeon, et autres
Publié: (2025)
par: Jeong, Hayeon, et autres
Publié: (2025)
LaCoOT: Layer Collapse through Optimal Transport
par: Quétu, Victor, et autres
Publié: (2024)
par: Quétu, Victor, et autres
Publié: (2024)
Layer Collapse Can be Induced by Unstructured Pruning
par: Liao, Zhu, et autres
Publié: (2024)
par: Liao, Zhu, et autres
Publié: (2024)
LayerCollapse: Adaptive compression of neural networks
par: Shabgahi, Soheil Zibakhsh, et autres
Publié: (2023)
par: Shabgahi, Soheil Zibakhsh, et autres
Publié: (2023)
Strong Model Collapse
par: Dohmatob, Elvis, et autres
Publié: (2024)
par: Dohmatob, Elvis, et autres
Publié: (2024)
Language Generation with Replay: A Learning-Theoretic View of Model Collapse
par: Racca, Giorgio, et autres
Publié: (2026)
par: Racca, Giorgio, et autres
Publié: (2026)
Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine
par: Huang, Wei, et autres
Publié: (2026)
par: Huang, Wei, et autres
Publié: (2026)
The Curse of Depth in Large Language Models
par: Sun, Wenfang, et autres
Publié: (2025)
par: Sun, Wenfang, et autres
Publié: (2025)
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
par: Wang, Keyu, et autres
Publié: (2025)
par: Wang, Keyu, et autres
Publié: (2025)
When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion Models
par: Wang, Qitong, et autres
Publié: (2026)
par: Wang, Qitong, et autres
Publié: (2026)
Collapse-Free Prototype Readout Layer for Transformer Encoders
par: Cirrincione, Giansalvo, et autres
Publié: (2026)
par: Cirrincione, Giansalvo, et autres
Publié: (2026)
Monitoring Neural Training with Topology: A Footprint-Predictable Collapse Index
par: Kalinowski, Alexander
Publié: (2026)
par: Kalinowski, Alexander
Publié: (2026)
Mind the Gap: a Spectral Analysis of Rank Collapse and Signal Propagation in Attention Layers
par: Saada, Thiziri Nait, et autres
Publié: (2024)
par: Saada, Thiziri Nait, et autres
Publié: (2024)
Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank Gradients
par: Zhang, Zhenyu, et autres
Publié: (2024)
par: Zhang, Zhenyu, et autres
Publié: (2024)
Model Unmerging: Making Your Models Unmergeable for Secure Model Sharing
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2025)
par: Hu, Zizhao, et autres
Publié: (2025)
A Probabilistic Perspective on Model Collapse
par: Xu, Shirong, et autres
Publié: (2025)
par: Xu, Shirong, et autres
Publié: (2025)
Scaling Embedding Layers in Language Models
par: Yu, Da, et autres
Publié: (2025)
par: Yu, Da, et autres
Publié: (2025)
On the Robustness of Neural Collapse and the Neural Collapse of Robustness
par: Su, Jingtong, et autres
Publié: (2023)
par: Su, Jingtong, et autres
Publié: (2023)
When Attention Collapses: How Degenerate Layers in LLMs Enable Smaller, Stronger Models
par: Sanyal, Sunny, et autres
Publié: (2024)
par: Sanyal, Sunny, et autres
Publié: (2024)
Diffusion Language Models for Speech Recognition
par: Naveriani, Davyd, et autres
Publié: (2026)
par: Naveriani, Davyd, et autres
Publié: (2026)
TUBE: Tangent Upper Bound on Evidence for Discrete Diffusion Language Models
par: Ivanov, Arseny, et autres
Publié: (2026)
par: Ivanov, Arseny, et autres
Publié: (2026)
LOST: Low-rank and Sparse Pre-training for Large Language Models
par: Li, Jiaxi, et autres
Publié: (2025)
par: Li, Jiaxi, et autres
Publié: (2025)
Variational Language Concepts for Interpreting Foundation Language Models
par: Wang, Hengyi, et autres
Publié: (2024)
par: Wang, Hengyi, et autres
Publié: (2024)
Golden Ratio Weighting Prevents Model Collapse
par: He, Hengzhi, et autres
Publié: (2025)
par: He, Hengzhi, et autres
Publié: (2025)
On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization
par: Xiao, Jiancong, et autres
Publié: (2024)
par: Xiao, Jiancong, et autres
Publié: (2024)
Continuous Diffusion Model for Language Modeling
par: Jo, Jaehyeong, et autres
Publié: (2025)
par: Jo, Jaehyeong, et autres
Publié: (2025)
Diffusion Language Models are Super Data Learners
par: Ni, Jinjie, et autres
Publié: (2025)
par: Ni, Jinjie, et autres
Publié: (2025)
Consistent Diffusion Language Models
par: Amin, Hasan, et autres
Publié: (2026)
par: Amin, Hasan, et autres
Publié: (2026)
Corrective Diffusion Language Models
par: Zhang, Shuibai, et autres
Publié: (2025)
par: Zhang, Shuibai, et autres
Publié: (2025)
Documents similaires
-
Training Dynamics Impact Post-Training Quantization Robustness
par: Catalan-Tatjer, Albert, et autres
Publié: (2025) -
Reducing Storage of Pretrained Neural Networks by Rate-Constrained Quantization and Entropy Coding
par: Conzelmann, Alexander, et autres
Publié: (2025) -
Decentralized Task Offloading and Load-Balancing for Mobile Edge Computing in Dense Networks
par: Yahya, Mariam, et autres
Publié: (2024) -
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
par: Lu, Haiquan, et autres
Publié: (2024) -
Quantifying Error Propagation and Model Collapse in Diffusion Models
par: Khelifa, Nail B., et autres
Publié: (2026)