ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Bingxin, Dong, Zhen, Elachqar, Oussama, Shang, Yuzhang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization
por: Liu, Weiyang, et al.
Publicado: (2023)
por: Liu, Weiyang, et al.
Publicado: (2023)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
por: Li, Pingzhi, et al.
Publicado: (2024)
por: Li, Pingzhi, et al.
Publicado: (2024)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026)
por: Wang, Dongwei, et al.
Publicado: (2026)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
por: Shen, Xuan, et al.
Publicado: (2023)
por: Shen, Xuan, et al.
Publicado: (2023)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
por: Xu, Zukang, et al.
Publicado: (2025)
por: Xu, Zukang, et al.
Publicado: (2025)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization
por: Xiang, Maoyang, et al.
Publicado: (2026)
por: Xiang, Maoyang, et al.
Publicado: (2026)
ButterflyMoE: Sub-Linear Ternary Experts via Structured Butterfly Orbits
por: Karmore, Aryan
Publicado: (2026)
por: Karmore, Aryan
Publicado: (2026)
GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
por: Zhou, Sifan, et al.
Publicado: (2025)
por: Zhou, Sifan, et al.
Publicado: (2025)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
por: Yan, Xianglong, et al.
Publicado: (2026)
por: Yan, Xianglong, et al.
Publicado: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
por: Xiao, Guangxuan, et al.
Publicado: (2022)
por: Xiao, Guangxuan, et al.
Publicado: (2022)
When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity
por: Feuer, Benjamin, et al.
Publicado: (2025)
por: Feuer, Benjamin, et al.
Publicado: (2025)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)
por: Qiu, Zeju, et al.
Publicado: (2025)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
por: Chen, Jianhui, et al.
Publicado: (2026)
por: Chen, Jianhui, et al.
Publicado: (2026)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
por: Chen, Han, et al.
Publicado: (2025)
por: Chen, Han, et al.
Publicado: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
PolarQuant: Quantizing KV Caches with Polar Transformation
por: Han, Insu, et al.
Publicado: (2025)
por: Han, Insu, et al.
Publicado: (2025)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation
por: Qiu, Zeju, et al.
Publicado: (2026)
por: Qiu, Zeju, et al.
Publicado: (2026)
LESA: Learnable LLM Layer Scaling-Up
por: Yang, Yifei, et al.
Publicado: (2025)
por: Yang, Yifei, et al.
Publicado: (2025)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
por: Song, Yurun, et al.
Publicado: (2025)
por: Song, Yurun, et al.
Publicado: (2025)
Squat: Quant Small Language Models on the Edge
por: Shen, Xuan, et al.
Publicado: (2024)
por: Shen, Xuan, et al.
Publicado: (2024)
Changes by Butterflies: Farsighted Forecasting with Group Reservoir Transformer
por: Kowsher, Md, et al.
Publicado: (2024)
por: Kowsher, Md, et al.
Publicado: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
por: Liu, Zechun, et al.
Publicado: (2025)
por: Liu, Zechun, et al.
Publicado: (2025)
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
por: Choi, Euntae, et al.
Publicado: (2025)
por: Choi, Euntae, et al.
Publicado: (2025)
LLM4DistReconfig: A Fine-tuned Large Language Model for Power Distribution Network Reconfiguration
por: Christou, Panayiotis, et al.
Publicado: (2025)
por: Christou, Panayiotis, et al.
Publicado: (2025)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
por: Zhao, Zhixiong, et al.
Publicado: (2025)
por: Zhao, Zhixiong, et al.
Publicado: (2025)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
por: Yankun, Hong, et al.
Publicado: (2025)
por: Yankun, Hong, et al.
Publicado: (2025)
ICQuant: Index Coding enables Low-bit LLM Quantization
por: Li, Xinlin, et al.
Publicado: (2025)
por: Li, Xinlin, et al.
Publicado: (2025)
SpinQuant: LLM quantization with learned rotations
por: Liu, Zechun, et al.
Publicado: (2024)
por: Liu, Zechun, et al.
Publicado: (2024)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
por: Zekri, Oussama, et al.
Publicado: (2025)
por: Zekri, Oussama, et al.
Publicado: (2025)
Turning LLM Activations Quantization-Friendly
por: Czakó, Patrik, et al.
Publicado: (2025)
por: Czakó, Patrik, et al.
Publicado: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
por: Li, Xiaomin, et al.
Publicado: (2024)
por: Li, Xiaomin, et al.
Publicado: (2024)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
por: Pei, Zehua, et al.
Publicado: (2024)
por: Pei, Zehua, et al.
Publicado: (2024)
Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation
por: Feuer, Benjamin, et al.
Publicado: (2026)
por: Feuer, Benjamin, et al.
Publicado: (2026)
Learning to Reason at the Frontier of Learnability
por: Foster, Thomas, et al.
Publicado: (2025)
por: Foster, Thomas, et al.
Publicado: (2025)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
por: Lee, Banseok, et al.
Publicado: (2025)
por: Lee, Banseok, et al.
Publicado: (2025)
Large-scale Training of Foundation Models for Wearable Biosignals
por: Abbaspourazad, Salar, et al.
Publicado: (2023)
por: Abbaspourazad, Salar, et al.
Publicado: (2023)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025)
por: Zhang, Tianao, et al.
Publicado: (2025)
Ejemplares similares
-
Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization
por: Liu, Weiyang, et al.
Publicado: (2023) -
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
por: Li, Pingzhi, et al.
Publicado: (2024) -
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026) -
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
por: Shen, Xuan, et al.
Publicado: (2023) -
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
por: Xu, Zukang, et al.
Publicado: (2025)