"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization
Fuente:
arXiv
Guardado en:
| Autores principales: | Kurtic, Eldar, Marques, Alexandre, Pandit, Shubhra, Kurtz, Mark, Alistarh, Dan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
por: Kurtic, Eldar, et al.
Publicado: (2024)
por: Kurtic, Eldar, et al.
Publicado: (2024)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
por: Egiazarian, Vage, et al.
Publicado: (2025)
por: Egiazarian, Vage, et al.
Publicado: (2025)
Statistically-Lossless Quantization of Large Language Models
por: Helcig, Michael, et al.
Publicado: (2026)
por: Helcig, Michael, et al.
Publicado: (2026)
Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment
por: Agarwalla, Abhinav, et al.
Publicado: (2024)
por: Agarwalla, Abhinav, et al.
Publicado: (2024)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
por: Sieberling, Oliver, et al.
Publicado: (2024)
por: Sieberling, Oliver, et al.
Publicado: (2024)
Fairness-Accuracy Trade-Offs: A Causal Perspective
por: Plecko, Drago, et al.
Publicado: (2024)
por: Plecko, Drago, et al.
Publicado: (2024)
"Oh LLM, I'm Asking Thee, Please Give Me a Decision Tree": Zero-Shot Decision Tree Induction and Embedding with Large Language Models
por: Knauer, Ricardo, et al.
Publicado: (2024)
por: Knauer, Ricardo, et al.
Publicado: (2024)
Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?
por: Onoda, Ku, et al.
Publicado: (2026)
por: Onoda, Ku, et al.
Publicado: (2026)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
por: Nicolicioiu, Armand, et al.
Publicado: (2024)
por: Nicolicioiu, Armand, et al.
Publicado: (2024)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
por: Tang, Shengkun, et al.
Publicado: (2025)
por: Tang, Shengkun, et al.
Publicado: (2025)
Do Transformer World Models Give Better Policy Gradients?
por: Ma, Michel, et al.
Publicado: (2024)
por: Ma, Michel, et al.
Publicado: (2024)
ECO: Quantized Training without Full-Precision Master Weights
por: Nikdan, Mahdi, et al.
Publicado: (2026)
por: Nikdan, Mahdi, et al.
Publicado: (2026)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
por: Dadgarnia, Alireza, et al.
Publicado: (2026)
por: Dadgarnia, Alireza, et al.
Publicado: (2026)
See Me and Believe Me: Causality and Intersectionality in Testimonial Injustice in Healthcare
por: Andrews, Kenya S., et al.
Publicado: (2024)
por: Andrews, Kenya S., et al.
Publicado: (2024)
"Give Me an Example Like This": Episodic Active Reinforcement Learning from Demonstrations
por: Hou, Muhan, et al.
Publicado: (2024)
por: Hou, Muhan, et al.
Publicado: (2024)
The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
por: Lee, Kwanhee, et al.
Publicado: (2025)
por: Lee, Kwanhee, et al.
Publicado: (2025)
First-See-Then-Design: A Multi-Stakeholder View for Optimal Performance-Fairness Trade-Offs
por: Gupta, Kavya, et al.
Publicado: (2026)
por: Gupta, Kavya, et al.
Publicado: (2026)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2026)
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2026)
Error Feedback Can Accurately Compress Preconditioners
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2023)
por: Modoranu, Ionut-Vlad, et al.
Publicado: (2023)
Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM
por: Bianco, Francesca, et al.
Publicado: (2026)
por: Bianco, Francesca, et al.
Publicado: (2026)
Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves
por: Knupp, Jonas, et al.
Publicado: (2026)
por: Knupp, Jonas, et al.
Publicado: (2026)
GiveMeLabeledIssues: An Open Source Issue Recommendation System
por: Vargovich, Joseph, et al.
Publicado: (2023)
por: Vargovich, Joseph, et al.
Publicado: (2023)
Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
por: Liu, Yong, et al.
Publicado: (2024)
por: Liu, Yong, et al.
Publicado: (2024)
Accuracy-Efficiency Trade-Offs in Spiking Neural Networks: A Lempel-Ziv Complexity Perspective on Learning Rules
por: Rudnicka, Zofia, et al.
Publicado: (2025)
por: Rudnicka, Zofia, et al.
Publicado: (2025)
Textual Unlearning Gives a False Sense of Unlearning
por: Du, Jiacheng, et al.
Publicado: (2024)
por: Du, Jiacheng, et al.
Publicado: (2024)
Pruning Extensions and Efficiency Trade-Offs for Sustainable Time Series Classification
por: Fischer, Raphael, et al.
Publicado: (2026)
por: Fischer, Raphael, et al.
Publicado: (2026)
MeSH: Memory-as-State-Highways for Recursive Transformers
por: Yu, Chengting, et al.
Publicado: (2025)
por: Yu, Chengting, et al.
Publicado: (2025)
First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs
por: Norman, Ben, et al.
Publicado: (2023)
por: Norman, Ben, et al.
Publicado: (2023)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
por: Ding, Ning, et al.
Publicado: (2026)
por: Ding, Ning, et al.
Publicado: (2026)
AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments
por: Cai, Zhijie, et al.
Publicado: (2026)
por: Cai, Zhijie, et al.
Publicado: (2026)
Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models
por: Ennadir, Sofiane, et al.
Publicado: (2025)
por: Ennadir, Sofiane, et al.
Publicado: (2025)
MeMo: Memory as a Model
por: Quek, Ryan Wei Heng, et al.
Publicado: (2026)
por: Quek, Ryan Wei Heng, et al.
Publicado: (2026)
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
por: Shutova, Alina, et al.
Publicado: (2025)
por: Shutova, Alina, et al.
Publicado: (2025)
Stop Listening to Me! How Multi-turn Conversations Can Degrade LLM Reliability
por: Guo, Kevin H., et al.
Publicado: (2026)
por: Guo, Kevin H., et al.
Publicado: (2026)
Teach Me to Trick: Exploring Adversarial Transferability via Knowledge Distillation
por: Pradhan, Siddhartha, et al.
Publicado: (2025)
por: Pradhan, Siddhartha, et al.
Publicado: (2025)
CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
por: Zhao, Runsong, et al.
Publicado: (2026)
por: Zhao, Runsong, et al.
Publicado: (2026)
MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
por: Duanmu, Haojie, et al.
Publicado: (2025)
por: Duanmu, Haojie, et al.
Publicado: (2025)
Wasserstein Distances, Neuronal Entanglement, and Sparsity
por: Sawmya, Shashata, et al.
Publicado: (2024)
por: Sawmya, Shashata, et al.
Publicado: (2024)
PatternPortrait: Draw Me Like One of Your Scribbles
por: Wieluch, Sabine, et al.
Publicado: (2024)
por: Wieluch, Sabine, et al.
Publicado: (2024)
Differential Diffusion: Giving Each Pixel Its Strength
por: Levin, Eran, et al.
Publicado: (2023)
por: Levin, Eran, et al.
Publicado: (2023)
Ejemplares similares
-
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
por: Kurtic, Eldar, et al.
Publicado: (2024) -
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
por: Egiazarian, Vage, et al.
Publicado: (2025) -
Statistically-Lossless Quantization of Large Language Models
por: Helcig, Michael, et al.
Publicado: (2026) -
Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment
por: Agarwalla, Abhinav, et al.
Publicado: (2024) -
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
por: Sieberling, Oliver, et al.
Publicado: (2024)