HALO: Hadamard-Assisted Lower-Precision Optimization for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ashkboos, Saleh, Nikdan, Mahdi, Tabesh, Soroush, Castro, Roberto L., Hoefler, Torsten, Alistarh, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quartet: Native FP4 Training Can Be Optimal for Large Language Models
par: Castro, Roberto L., et autres
Publié: (2025)
par: Castro, Roberto L., et autres
Publié: (2025)
QuEST: Stable Training of LLMs with 1-Bit Weights and Activations
par: Panferov, Andrei, et autres
Publié: (2025)
par: Panferov, Andrei, et autres
Publié: (2025)
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
par: Nikdan, Mahdi, et autres
Publié: (2024)
par: Nikdan, Mahdi, et autres
Publié: (2024)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
par: Dadgarnia, Alireza, et autres
Publié: (2026)
par: Dadgarnia, Alireza, et autres
Publié: (2026)
Beyond Outliers: A Study of Optimizers Under Quantization
par: Vlassis, Georgios, et autres
Publié: (2025)
par: Vlassis, Georgios, et autres
Publié: (2025)
ECO: Quantized Training without Full-Precision Master Weights
par: Nikdan, Mahdi, et autres
Publié: (2026)
par: Nikdan, Mahdi, et autres
Publié: (2026)
MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models
par: Frantar, Elias, et autres
Publié: (2024)
par: Frantar, Elias, et autres
Publié: (2024)
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
EfQAT: An Efficient Framework for Quantization-Aware Training
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
Efficient Data Selection at Scale via Influence Distillation
par: Nikdan, Mahdi, et autres
Publié: (2025)
par: Nikdan, Mahdi, et autres
Publié: (2025)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
par: Egiazarian, Vage, et autres
Publié: (2025)
par: Egiazarian, Vage, et autres
Publié: (2025)
WUSH: Near-Optimal Adaptive Transforms for LLM Quantization
par: Chen, Jiale, et autres
Publié: (2025)
par: Chen, Jiale, et autres
Publié: (2025)
CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training
par: Tabesh, Soroush, et autres
Publié: (2025)
par: Tabesh, Soroush, et autres
Publié: (2025)
SliceGPT: Compress Large Language Models by Deleting Rows and Columns
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
par: Schultheis, Erik, et autres
Publié: (2025)
par: Schultheis, Erik, et autres
Publié: (2025)
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
par: Egiazarian, Vage, et autres
Publié: (2026)
par: Egiazarian, Vage, et autres
Publié: (2026)
The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm
par: Chen, Jiale, et autres
Publié: (2025)
par: Chen, Jiale, et autres
Publié: (2025)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
par: Iofinova, Eugenia, et autres
Publié: (2026)
par: Iofinova, Eugenia, et autres
Publié: (2026)
Taming Unbalanced Training Workloads in Deep Learning with Partial Collective Operations
par: Li, Shigang, et autres
Publié: (2019)
par: Li, Shigang, et autres
Publié: (2019)
Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?
par: Zverev, Egor, et autres
Publié: (2024)
par: Zverev, Egor, et autres
Publié: (2024)
Panza: Design and Analysis of a Fully-Local Personalized Text Writing Assistant
par: Nicolicioiu, Armand, et autres
Publié: (2024)
par: Nicolicioiu, Armand, et autres
Publié: (2024)
Breaking (Global) Barriers in Parallel Stochastic Optimization with Wait-Avoiding Group Averaging
par: Li, Shigang, et autres
Publié: (2020)
par: Li, Shigang, et autres
Publié: (2020)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
Towards Robust Scaling Laws for Optimizers
par: Volkova, Alexandra, et autres
Publié: (2026)
par: Volkova, Alexandra, et autres
Publié: (2026)
EntryPrune: Neural Network Feature Selection using First Impressions
par: Zimmer, Felix, et autres
Publié: (2024)
par: Zimmer, Felix, et autres
Publié: (2024)
MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization
par: Kleinegger, Maximilian, et autres
Publié: (2026)
par: Kleinegger, Maximilian, et autres
Publié: (2026)
Statistically-Lossless Quantization of Large Language Models
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
Powerset Convolutional Neural Networks
par: Wendler, Chris, et autres
Publié: (2019)
par: Wendler, Chris, et autres
Publié: (2019)
Hybrid Decentralized Optimization: Leveraging Both First- and Zeroth-Order Optimizers for Faster Convergence
par: Ansaripour, Matin, et autres
Publié: (2022)
par: Ansaripour, Matin, et autres
Publié: (2022)
LDAdam: Adaptive Optimization from Low-Dimensional Gradient Statistics
par: Robert, Thomas, et autres
Publié: (2024)
par: Robert, Thomas, et autres
Publié: (2024)
Simple Opinion Dynamics for No-Regret Learning
par: Lazarsfeld, John, et autres
Publié: (2023)
par: Lazarsfeld, John, et autres
Publié: (2023)
Computational Bottlenecks of Training Small-scale Large Language Models
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
Scaling Laws of Global Weather Models
par: Yu, Yuejiang, et autres
Publié: (2026)
par: Yu, Yuejiang, et autres
Publié: (2026)
Near-Optimal Sparse Allreduce for Distributed Deep Learning
par: Li, Shigang, et autres
Publié: (2022)
par: Li, Shigang, et autres
Publié: (2022)
Chimera: Efficiently Training Large-Scale Neural Networks with Bidirectional Pipelines
par: Li, Shigang, et autres
Publié: (2021)
par: Li, Shigang, et autres
Publié: (2021)
Apertus LLM Family Expansion via Distillation and Quantization
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
par: Sieberling, Oliver, et autres
Publié: (2024)
par: Sieberling, Oliver, et autres
Publié: (2024)
Communication-Efficient Federated Learning With Data and Client Heterogeneity
par: Zakerinia, Hossein, et autres
Publié: (2022)
par: Zakerinia, Hossein, et autres
Publié: (2022)
HOT: Hadamard-based Optimized Training
par: Kim, Seonggon, et autres
Publié: (2025)
par: Kim, Seonggon, et autres
Publié: (2025)
Documents similaires
-
Quartet: Native FP4 Training Can Be Optimal for Large Language Models
par: Castro, Roberto L., et autres
Publié: (2025) -
QuEST: Stable Training of LLMs with 1-Bit Weights and Activations
par: Panferov, Andrei, et autres
Publié: (2025) -
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation
par: Nikdan, Mahdi, et autres
Publié: (2024) -
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
par: Dadgarnia, Alireza, et autres
Publié: (2026) -
Beyond Outliers: A Study of Optimizers Under Quantization
par: Vlassis, Georgios, et autres
Publié: (2025)