MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Gongfan, Yin, Hongxu, Muralidharan, Saurav, Heinrich, Greg, Pool, Jeff, Kautz, Jan, Molchanov, Pavlo, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Flextron: Many-in-One Flexible Large Language Model
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
dParallel: Learnable Parallel Decoding for dLLMs
di: Chen, Zigeng, et al.
Pubblicazione: (2025)
di: Chen, Zigeng, et al.
Pubblicazione: (2025)
dMoE: dLLMs with Learnable Block Experts
di: Feng, Sicheng, et al.
Pubblicazione: (2026)
di: Feng, Sicheng, et al.
Pubblicazione: (2026)
Thinkless: LLM Learns When to Think
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
Compact Language Models via Pruning and Knowledge Distillation
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation
di: Belcak, Peter, et al.
Pubblicazione: (2025)
di: Belcak, Peter, et al.
Pubblicazione: (2025)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
FasterViT: Fast Vision Transformers with Hierarchical Attention
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
dKV-Cache: The Cache for Diffusion Language Models
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2024)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
SparseD: Sparse Attention for Diffusion Language Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2026)
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2026)
Small Language Models are the Future of Agentic AI
di: Belcak, Peter, et al.
Pubblicazione: (2025)
di: Belcak, Peter, et al.
Pubblicazione: (2025)
Efficient Reasoning Models: A Survey
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
LITA: Language Instructed Temporal-Localization Assistant
di: Huang, De-An, et al.
Pubblicazione: (2024)
di: Huang, De-An, et al.
Pubblicazione: (2024)
Learnable Permutation for Structured Sparsity on Transformer Models
di: Li, Zekai, et al.
Pubblicazione: (2026)
di: Li, Zekai, et al.
Pubblicazione: (2026)
FeatSharp: Your Vision Model Features, Sharper
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
di: Tang, Siao, et al.
Pubblicazione: (2025)
di: Tang, Siao, et al.
Pubblicazione: (2025)
Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs
di: Lu, Haiquan, et al.
Pubblicazione: (2026)
di: Lu, Haiquan, et al.
Pubblicazione: (2026)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
di: Diao, Shizhe, et al.
Pubblicazione: (2025)
di: Diao, Shizhe, et al.
Pubblicazione: (2025)
MixReasoning: Switching Modes to Think
di: Lu, Haiquan, et al.
Pubblicazione: (2025)
di: Lu, Haiquan, et al.
Pubblicazione: (2025)
dVoting: Fast Voting for dLLMs
di: Feng, Sicheng, et al.
Pubblicazione: (2026)
di: Feng, Sicheng, et al.
Pubblicazione: (2026)
CoT-Valve: Length-Compressible Chain-of-Thought Tuning
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
Minitron-SSM: Efficient Hybrid Language Model Compression through Group-Aware SSM Pruning
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
di: Taghibakhshi, Ali, et al.
Pubblicazione: (2025)
From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection
di: Zhou, Hongxu
Pubblicazione: (2026)
di: Zhou, Hongxu
Pubblicazione: (2026)
Dependency-Aware Semi-Structured Sparsity of GLU Variants in Large Language Models
di: Guo, Zhiyu, et al.
Pubblicazione: (2024)
di: Guo, Zhiyu, et al.
Pubblicazione: (2024)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
di: Huang, Weiyu, et al.
Pubblicazione: (2025)
A deeper look at depth pruning of LLMs
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
C-RADIOv4 (Tech Report)
di: Ranzinger, Mike, et al.
Pubblicazione: (2026)
di: Ranzinger, Mike, et al.
Pubblicazione: (2026)
LLM-Barber: Block-Aware Rebuilder for Sparsity Mask in One-Shot for Large Language Models
di: Su, Yupeng, et al.
Pubblicazione: (2024)
di: Su, Yupeng, et al.
Pubblicazione: (2024)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
TiDAR: Think in Diffusion, Talk in Autoregression
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
di: Liu, Shih-Yang, et al.
Pubblicazione: (2025)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2025)
LLM Pruning and Distillation in Practice: The Minitron Approach
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2024)
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2024)
Scaling RL to Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Flextron: Many-in-One Flexible Large Language Model
di: Cai, Ruisi, et al.
Pubblicazione: (2024) -
dParallel: Learnable Parallel Decoding for dLLMs
di: Chen, Zigeng, et al.
Pubblicazione: (2025) -
dMoE: dLLMs with Learnable Block Experts
di: Feng, Sicheng, et al.
Pubblicazione: (2026) -
Thinkless: LLM Learns When to Think
di: Fang, Gongfan, et al.
Pubblicazione: (2025) -
Compact Language Models via Pruning and Knowledge Distillation
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)