SBVR: Summation of BitVector Representation for Efficient LLM Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Bang, Wonjun, Park, Jongseok, Yu, Hongseung, Bin, Kyungmin, Lee, Kyunghan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
di: Lee, Deokjae, et al.
Pubblicazione: (2025)
di: Lee, Deokjae, et al.
Pubblicazione: (2025)
DecDEC: A Systems Approach to Advancing Low-Bit LLM Quantization
di: Park, Yeonhong, et al.
Pubblicazione: (2024)
di: Park, Yeonhong, et al.
Pubblicazione: (2024)
Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
di: Zhang, Xi, et al.
Pubblicazione: (2025)
di: Zhang, Xi, et al.
Pubblicazione: (2025)
BitSnap: Checkpoint Sparsification and Quantization in LLM Training
di: Peng, Yanxin, et al.
Pubblicazione: (2025)
di: Peng, Yanxin, et al.
Pubblicazione: (2025)
Leech Lattice Vector Quantization for Efficient LLM Compression
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026)
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
di: Zhao, Jiayu, et al.
Pubblicazione: (2026)
di: Zhao, Jiayu, et al.
Pubblicazione: (2026)
MSQ: Memory-Efficient Bit Sparsification Quantization
di: Han, Seokho, et al.
Pubblicazione: (2025)
di: Han, Seokho, et al.
Pubblicazione: (2025)
FireQ: Fast INT4-FP8 Kernel and RoPE-aware Quantization for LLM Inference Acceleration
di: Baek, Daehyeon, et al.
Pubblicazione: (2025)
di: Baek, Daehyeon, et al.
Pubblicazione: (2025)
DyBit: Dynamic Bit-Precision Numbers for Efficient Quantized Neural Network Inference
di: Zhou, Jiajun, et al.
Pubblicazione: (2023)
di: Zhou, Jiajun, et al.
Pubblicazione: (2023)
Task Vector Quantization for Memory-Efficient Model Merging
di: Kim, Youngeun, et al.
Pubblicazione: (2025)
di: Kim, Youngeun, et al.
Pubblicazione: (2025)
Efficient Generative Modeling with Residual Vector Quantization-Based Tokens
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
Representation Collapsing Problems in Vector Quantization
di: Zhao, Wenhao, et al.
Pubblicazione: (2024)
di: Zhao, Wenhao, et al.
Pubblicazione: (2024)
ResBit: Residual Bit Vector for Categorical Values
di: Fuchi, Masane, et al.
Pubblicazione: (2023)
di: Fuchi, Masane, et al.
Pubblicazione: (2023)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
di: Duan, Bowen, et al.
Pubblicazione: (2026)
di: Duan, Bowen, et al.
Pubblicazione: (2026)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
di: Hu, Xing, et al.
Pubblicazione: (2024)
di: Hu, Xing, et al.
Pubblicazione: (2024)
Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
di: Park, Jongseok, et al.
Pubblicazione: (2026)
di: Park, Jongseok, et al.
Pubblicazione: (2026)
PrismQuant: Rate-Distortion-Optimal Vector Quantization for Gaussian-Mixture Sources
di: Park, Bumsu, et al.
Pubblicazione: (2026)
di: Park, Bumsu, et al.
Pubblicazione: (2026)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
di: Zeng, Chao, et al.
Pubblicazione: (2024)
di: Zeng, Chao, et al.
Pubblicazione: (2024)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
di: Lee, Banseok, et al.
Pubblicazione: (2025)
di: Lee, Banseok, et al.
Pubblicazione: (2025)
BAQ: Efficient Bit Allocation Quantization for Large Language Models
di: Zhang, Chao, et al.
Pubblicazione: (2025)
di: Zhang, Chao, et al.
Pubblicazione: (2025)
Why Do Some Inputs Break Low-Bit LLM Quantization?
di: Chang, Ting-Yun, et al.
Pubblicazione: (2025)
di: Chang, Ting-Yun, et al.
Pubblicazione: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
di: Chong, Hyochan, et al.
Pubblicazione: (2026)
di: Chong, Hyochan, et al.
Pubblicazione: (2026)
TesseraQ: Ultra Low-Bit LLM Post-Training Quantization with Block Reconstruction
di: Li, Yuhang, et al.
Pubblicazione: (2024)
di: Li, Yuhang, et al.
Pubblicazione: (2024)
TruncQuant: Truncation-Ready Quantization for DNNs with Flexible Weight Bit Precision
di: Kim, Jinhee, et al.
Pubblicazione: (2025)
di: Kim, Jinhee, et al.
Pubblicazione: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
di: Son, Donghyun, et al.
Pubblicazione: (2025)
di: Son, Donghyun, et al.
Pubblicazione: (2025)
One-Bit Quantization for Random Features Models
di: Akhtiamov, Danil, et al.
Pubblicazione: (2025)
di: Akhtiamov, Danil, et al.
Pubblicazione: (2025)
Multi-output Classification for Compound Fault Diagnosis in Motor under Partially Labeled Target Domain
di: Yi, Wonjun, et al.
Pubblicazione: (2025)
di: Yi, Wonjun, et al.
Pubblicazione: (2025)
Multi-output Classification Framework and Frequency Layer Normalization for Compound Fault Diagnosis in Motor
di: Yi, Wonjun, et al.
Pubblicazione: (2025)
di: Yi, Wonjun, et al.
Pubblicazione: (2025)
From Bits to Chips: An LLM-based Hardware-Aware Quantization Agent for Streamlined Deployment of LLMs
di: Deng, Kaiyuan, et al.
Pubblicazione: (2026)
di: Deng, Kaiyuan, et al.
Pubblicazione: (2026)
QQQ: Quality Quattuor-Bit Quantization for Large Language Models
di: Zhang, Ying, et al.
Pubblicazione: (2024)
di: Zhang, Ying, et al.
Pubblicazione: (2024)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
di: Kim, Junseok, et al.
Pubblicazione: (2026)
di: Kim, Junseok, et al.
Pubblicazione: (2026)
Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
di: Huang, Hong, et al.
Pubblicazione: (2026)
di: Huang, Hong, et al.
Pubblicazione: (2026)
Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization
di: Wang, YiFeng, et al.
Pubblicazione: (2026)
di: Wang, YiFeng, et al.
Pubblicazione: (2026)
Where and How to Enhance: Discovering Bit-Width Contribution for Mixed Precision Quantization
di: Kang, Haidong, et al.
Pubblicazione: (2025)
di: Kang, Haidong, et al.
Pubblicazione: (2025)
Online Conformal Prediction with Adversarial Semi-bandit Feedback via Regret Minimization
di: Yang, Junyoung, et al.
Pubblicazione: (2026)
di: Yang, Junyoung, et al.
Pubblicazione: (2026)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
di: Tao, Qian, et al.
Pubblicazione: (2024)
di: Tao, Qian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
di: Lee, Deokjae, et al.
Pubblicazione: (2025) -
DecDEC: A Systems Approach to Advancing Low-Bit LLM Quantization
di: Park, Yeonhong, et al.
Pubblicazione: (2024) -
Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
di: Zhang, Xi, et al.
Pubblicazione: (2025) -
BitSnap: Checkpoint Sparsification and Quantization in LLM Training
di: Peng, Yanxin, et al.
Pubblicazione: (2025) -
Leech Lattice Vector Quantization for Efficient LLM Compression
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026)