Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment
Fuente:
arXiv
Salvato in:
| Autori principali: | Agarwalla, Abhinav, Gupta, Abhay, Marques, Alexandre, Pandit, Shubhra, Goin, Michael, Kurtic, Eldar, Leong, Kevin, Nguyen, Tuan, Salem, Mahmoud, Alistarh, Dan, Lie, Sean, Kurtz, Mark |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
Statistically-Lossless Quantization of Large Language Models
di: Helcig, Michael, et al.
Pubblicazione: (2026)
di: Helcig, Michael, et al.
Pubblicazione: (2026)
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
di: Kurtic, Eldar, et al.
Pubblicazione: (2024)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
di: Egiazarian, Vage, et al.
Pubblicazione: (2025)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
di: Tang, Shengkun, et al.
Pubblicazione: (2025)
Error Feedback Can Accurately Compress Preconditioners
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2023)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2023)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
di: Dadgarnia, Alireza, et al.
Pubblicazione: (2026)
di: Dadgarnia, Alireza, et al.
Pubblicazione: (2026)
MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2024)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
di: Nicolicioiu, Armand, et al.
Pubblicazione: (2024)
Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2023)
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2023)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
di: Sawmya, Shashata, et al.
Pubblicazione: (2024)
di: Sawmya, Shashata, et al.
Pubblicazione: (2024)
SPADE: Sparsity-Guided Debugging for Deep Neural Networks
di: Moakhar, Arshia Soltani, et al.
Pubblicazione: (2023)
di: Moakhar, Arshia Soltani, et al.
Pubblicazione: (2023)
Compression Scaling Laws:Unifying Sparsity and Quantization
di: Frantar, Elias, et al.
Pubblicazione: (2025)
di: Frantar, Elias, et al.
Pubblicazione: (2025)
The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
di: Lee, Kwanhee, et al.
Pubblicazione: (2025)
Atribuições privativas, estudo socioeconômico e serviço social: o trabalho profissional na assistência estudantil
di: Marileia Goin
Pubblicazione: (2022)
di: Marileia Goin
Pubblicazione: (2022)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
Notes on the natural history of the lizard Eumeces laticeps, in northern Florida
di: Goin, Olive Bown, et al.
Pubblicazione: (1951)
di: Goin, Olive Bown, et al.
Pubblicazione: (1951)
Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
di: Pankratov, Sergey, et al.
Pubblicazione: (2025)
di: Pankratov, Sergey, et al.
Pubblicazione: (2025)
Simple Opinion Dynamics for No-Regret Learning
di: Lazarsfeld, John, et al.
Pubblicazione: (2023)
di: Lazarsfeld, John, et al.
Pubblicazione: (2023)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
di: Iofinova, Eugenia, et al.
Pubblicazione: (2026)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
di: Helcig, Michael, et al.
Pubblicazione: (2026)
di: Helcig, Michael, et al.
Pubblicazione: (2026)
Code Llama: Open Foundation Models for Code
di: Rozière, Baptiste, et al.
Pubblicazione: (2023)
di: Rozière, Baptiste, et al.
Pubblicazione: (2023)
The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes
di: arXiv, Redacted by
Pubblicazione: (2026)
di: arXiv, Redacted by
Pubblicazione: (2026)
Hearing Touch: Audio-Visual Pretraining for Contact-Rich Manipulation
di: Mejia, Jared, et al.
Pubblicazione: (2024)
di: Mejia, Jared, et al.
Pubblicazione: (2024)
SPADE-S: A Sparsity-Robust Foundational Forecaster
di: Wolff, Malcolm, et al.
Pubblicazione: (2025)
di: Wolff, Malcolm, et al.
Pubblicazione: (2025)
Buffering the Block: Can Individual Interventions Offset Neighbourhood Harms to Pregnancy?
di: Teresa Janevic, et al.
Pubblicazione: (2026)
di: Teresa Janevic, et al.
Pubblicazione: (2026)
Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective
di: Yao, Yunzhen, et al.
Pubblicazione: (2025)
di: Yao, Yunzhen, et al.
Pubblicazione: (2025)
Timed walk tests in spina bifida: A new functional vital sign?
di: Shubhra Mukherjee
Pubblicazione: (2025)
di: Shubhra Mukherjee
Pubblicazione: (2025)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
di: Kleinegger, Maximilian, et al.
Pubblicazione: (2026)
di: Kleinegger, Maximilian, et al.
Pubblicazione: (2026)
Powerset Convolutional Neural Networks
di: Wendler, Chris, et al.
Pubblicazione: (2019)
di: Wendler, Chris, et al.
Pubblicazione: (2019)
Position: It's Time to Act on the Risk of Efficient Personalized Text Generation
di: Iofinova, Eugenia, et al.
Pubblicazione: (2025)
di: Iofinova, Eugenia, et al.
Pubblicazione: (2025)
Towards Combinatorial Interpretability of Neural Computation
di: Adler, Micah, et al.
Pubblicazione: (2025)
di: Adler, Micah, et al.
Pubblicazione: (2025)
Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting
di: Rasul, Kashif, et al.
Pubblicazione: (2023)
di: Rasul, Kashif, et al.
Pubblicazione: (2023)
QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning
di: Wei, Xiaoyang, et al.
Pubblicazione: (2025)
di: Wei, Xiaoyang, et al.
Pubblicazione: (2025)
Introduction to herpetology / Coleman J. Goin, Olive B. Goin, George R. Zug
di: Goin, Coleman J. (Coleman Jett), (1911-)
Pubblicazione: (1911)
di: Goin, Coleman J. (Coleman Jett), (1911-)
Pubblicazione: (1911)
Anomalous transport in long-ranged open quantum systems
di: Dhawan, Abhinav, et al.
Pubblicazione: (2024)
di: Dhawan, Abhinav, et al.
Pubblicazione: (2024)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2026)
di: Modoranu, Ionut-Vlad, et al.
Pubblicazione: (2026)
Documenti analoghi
-
"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
di: Kurtic, Eldar, et al.
Pubblicazione: (2024) -
Statistically-Lossless Quantization of Large Language Models
di: Helcig, Michael, et al.
Pubblicazione: (2026) -
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
di: Kurtic, Eldar, et al.
Pubblicazione: (2024) -
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2025) -
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
di: Sieberling, Oliver, et al.
Pubblicazione: (2024)