Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment
Fuente:
arXiv
Guardado en:
| Autores principales: | Agarwalla, Abhinav, Gupta, Abhay, Marques, Alexandre, Pandit, Shubhra, Goin, Michael, Kurtic, Eldar, Leong, Kevin, Nguyen, Tuan, Salem, Mahmoud, Alistarh, Dan, Lie, Sean, Kurtz, Mark |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
por: Kurtic, Eldar, et al.
Publicado: (2024)
por: Kurtic, Eldar, et al.
Publicado: (2024)
Statistically-Lossless Quantization of Large Language Models
por: Helcig, Michael, et al.
Publicado: (2026)
por: Helcig, Michael, et al.
Publicado: (2026)
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
por: Kurtic, Eldar, et al.
Publicado: (2024)
por: Kurtic, Eldar, et al.
Publicado: (2024)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
por: Egiazarian, Vage, et al.
Publicado: (2025)
por: Egiazarian, Vage, et al.
Publicado: (2025)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
por: Sieberling, Oliver, et al.
Publicado: (2024)
por: Sieberling, Oliver, et al.
Publicado: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
por: Tang, Shengkun, et al.
Publicado: (2025)
por: Tang, Shengkun, et al.
Publicado: (2025)
Error Feedback Can Accurately Compress Preconditioners
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2023)
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2023)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
por: Dadgarnia, Alireza, et al.
Publicado: (2026)
por: Dadgarnia, Alireza, et al.
Publicado: (2026)
MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2024)
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2024)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
por: Thangarasa, Vithursan, et al.
Publicado: (2024)
por: Thangarasa, Vithursan, et al.
Publicado: (2024)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
por: Schultheis, Erik, et al.
Publicado: (2025)
por: Schultheis, Erik, et al.
Publicado: (2025)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
por: Nicolicioiu, Armand, et al.
Publicado: (2024)
por: Nicolicioiu, Armand, et al.
Publicado: (2024)
Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency
por: Thangarasa, Vithursan, et al.
Publicado: (2023)
por: Thangarasa, Vithursan, et al.
Publicado: (2023)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
por: Sawmya, Shashata, et al.
Publicado: (2024)
por: Sawmya, Shashata, et al.
Publicado: (2024)
SPADE: Sparsity-Guided Debugging for Deep Neural Networks
por: Moakhar, Arshia Soltani, et al.
Publicado: (2023)
por: Moakhar, Arshia Soltani, et al.
Publicado: (2023)
Compression Scaling Laws:Unifying Sparsity and Quantization
por: Frantar, Elias, et al.
Publicado: (2025)
por: Frantar, Elias, et al.
Publicado: (2025)
The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
por: Lee, Kwanhee, et al.
Publicado: (2025)
por: Lee, Kwanhee, et al.
Publicado: (2025)
Atribuições privativas, estudo socioeconômico e serviço social: o trabalho profissional na assistência estudantil
por: Marileia Goin
Publicado: (2022)
por: Marileia Goin
Publicado: (2022)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
por: Egiazarian, Vage, et al.
Publicado: (2024)
por: Egiazarian, Vage, et al.
Publicado: (2024)
Notes on the natural history of the lizard Eumeces laticeps, in northern Florida
por: Goin, Olive Bown, et al.
Publicado: (1951)
por: Goin, Olive Bown, et al.
Publicado: (1951)
Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
por: Pankratov, Sergey, et al.
Publicado: (2025)
por: Pankratov, Sergey, et al.
Publicado: (2025)
Simple Opinion Dynamics for No-Regret Learning
por: Lazarsfeld, John, et al.
Publicado: (2023)
por: Lazarsfeld, John, et al.
Publicado: (2023)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
por: Iofinova, Eugenia, et al.
Publicado: (2026)
por: Iofinova, Eugenia, et al.
Publicado: (2026)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
por: Helcig, Michael, et al.
Publicado: (2026)
por: Helcig, Michael, et al.
Publicado: (2026)
Code Llama: Open Foundation Models for Code
por: Rozière, Baptiste, et al.
Publicado: (2023)
por: Rozière, Baptiste, et al.
Publicado: (2023)
The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes
por: arXiv, Redacted by
Publicado: (2026)
por: arXiv, Redacted by
Publicado: (2026)
Hearing Touch: Audio-Visual Pretraining for Contact-Rich Manipulation
por: Mejia, Jared, et al.
Publicado: (2024)
por: Mejia, Jared, et al.
Publicado: (2024)
SPADE-S: A Sparsity-Robust Foundational Forecaster
por: Wolff, Malcolm, et al.
Publicado: (2025)
por: Wolff, Malcolm, et al.
Publicado: (2025)
Buffering the Block: Can Individual Interventions Offset Neighbourhood Harms to Pregnancy?
por: Teresa Janevic, et al.
Publicado: (2026)
por: Teresa Janevic, et al.
Publicado: (2026)
Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective
por: Yao, Yunzhen, et al.
Publicado: (2025)
por: Yao, Yunzhen, et al.
Publicado: (2025)
Timed walk tests in spina bifida: A new functional vital sign?
por: Shubhra Mukherjee
Publicado: (2025)
por: Shubhra Mukherjee
Publicado: (2025)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
por: Kleinegger, Maximilian, et al.
Publicado: (2026)
por: Kleinegger, Maximilian, et al.
Publicado: (2026)
Powerset Convolutional Neural Networks
por: Wendler, Chris, et al.
Publicado: (2019)
por: Wendler, Chris, et al.
Publicado: (2019)
Position: It's Time to Act on the Risk of Efficient Personalized Text Generation
por: Iofinova, Eugenia, et al.
Publicado: (2025)
por: Iofinova, Eugenia, et al.
Publicado: (2025)
Towards Combinatorial Interpretability of Neural Computation
por: Adler, Micah, et al.
Publicado: (2025)
por: Adler, Micah, et al.
Publicado: (2025)
Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting
por: Rasul, Kashif, et al.
Publicado: (2023)
por: Rasul, Kashif, et al.
Publicado: (2023)
QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning
por: Wei, Xiaoyang, et al.
Publicado: (2025)
por: Wei, Xiaoyang, et al.
Publicado: (2025)
Introduction to herpetology / Coleman J. Goin, Olive B. Goin, George R. Zug
por: Goin, Coleman J. (Coleman Jett), (1911-)
Publicado: (1911)
por: Goin, Coleman J. (Coleman Jett), (1911-)
Publicado: (1911)
Anomalous transport in long-ranged open quantum systems
por: Dhawan, Abhinav, et al.
Publicado: (2024)
por: Dhawan, Abhinav, et al.
Publicado: (2024)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2026)
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2026)
Ejemplares similares
-
"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
por: Kurtic, Eldar, et al.
Publicado: (2024) -
Statistically-Lossless Quantization of Large Language Models
por: Helcig, Michael, et al.
Publicado: (2026) -
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
por: Kurtic, Eldar, et al.
Publicado: (2024) -
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
por: Egiazarian, Vage, et al.
Publicado: (2025) -
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
por: Sieberling, Oliver, et al.
Publicado: (2024)