BCJR-QAT: A Differentiable Relaxation of Trellis-Coded Weight Quantization
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Iyengar, Venugopalan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StatQAT: Statistical Quantizer Optimization for Deep Networks
par: Aktukmak, Mehmet, et autres
Publié: (2026)
par: Aktukmak, Mehmet, et autres
Publié: (2026)
EfQAT: An Efficient Framework for Quantization-Aware Training
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
par: Zhang, Peiyuan, et autres
Publié: (2026)
par: Zhang, Peiyuan, et autres
Publié: (2026)
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
par: Gernigon, Cédric, et autres
Publié: (2024)
par: Gernigon, Cédric, et autres
Publié: (2024)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
par: Ke, Wenjin, et autres
Publié: (2025)
par: Ke, Wenjin, et autres
Publié: (2025)
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
par: Chen, Tianyi, et autres
Publié: (2026)
par: Chen, Tianyi, et autres
Publié: (2026)
MF-QAT: Multi-Format Quantization-Aware Training for Elastic Inference
par: Xu, Zifei, et autres
Publié: (2026)
par: Xu, Zifei, et autres
Publié: (2026)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
1-Bit Wonder: Improving QAT Performance in the Low-Bit Regime through K-Means Quantization
par: Maskey, Sohir, et autres
Publié: (2026)
par: Maskey, Sohir, et autres
Publié: (2026)
DivQAT: Enhancing Robustness of Quantized Convolutional Neural Networks against Model Extraction Attacks
par: Khaled, Kacem, et autres
Publié: (2025)
par: Khaled, Kacem, et autres
Publié: (2025)
Optimizing Large Language Models through Quantization: A Comparative Analysis of PTQ and QAT Techniques
par: Hasan, Jahid
Publié: (2024)
par: Hasan, Jahid
Publié: (2024)
Trellis: Learning to Compress Key-Value Memory in Attention Models
par: Karami, Mahdi, et autres
Publié: (2025)
par: Karami, Mahdi, et autres
Publié: (2025)
Unifying Block-wise PTQ and Distillation-based QAT for Progressive Quantization toward 2-bit Instruction-Tuned LLMs
par: Lee, Jung Hyun, et autres
Publié: (2025)
par: Lee, Jung Hyun, et autres
Publié: (2025)
Efficient VQ-QAT and Mixed Vector/Linear quantized Neural Networks
par: Gou, Terry, et autres
Publié: (2026)
par: Gou, Terry, et autres
Publié: (2026)
Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs
par: Xu, Binxing, et autres
Publié: (2026)
par: Xu, Binxing, et autres
Publié: (2026)
SLA2: Sparse-Linear Attention with Learnable Routing and QAT
par: Zhang, Jintao, et autres
Publié: (2026)
par: Zhang, Jintao, et autres
Publié: (2026)
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
A Differentiable Bayesian Relaxation for Latent Partial-Order Inference
par: Li, Dongqing, et autres
Publié: (2026)
par: Li, Dongqing, et autres
Publié: (2026)
Trust via Reputation of Conviction
par: Iyengar, Aravind R.
Publié: (2026)
par: Iyengar, Aravind R.
Publié: (2026)
ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models
par: Lucas, Ryan, et autres
Publié: (2026)
par: Lucas, Ryan, et autres
Publié: (2026)
Effect of Weight Quantization on Learning Models by Typical Case Analysis
par: Kashiwamura, Shuhei, et autres
Publié: (2024)
par: Kashiwamura, Shuhei, et autres
Publié: (2024)
Restructuring Vector Quantization with the Rotation Trick
par: Fifty, Christopher, et autres
Publié: (2024)
par: Fifty, Christopher, et autres
Publié: (2024)
Model-Free Approximate Bayesian Learning for Large-Scale Conversion Funnel Optimization
par: Iyengar, Garud, et autres
Publié: (2024)
par: Iyengar, Garud, et autres
Publié: (2024)
Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training
par: Ahn, Myeonghwan, et autres
Publié: (2025)
par: Ahn, Myeonghwan, et autres
Publié: (2025)
AWP: Activation-Aware Weight Pruning and Quantization with Projected Gradient Descent
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
Quantized Delta Weight Is Safety Keeper
par: Liu, Yule, et autres
Publié: (2024)
par: Liu, Yule, et autres
Publié: (2024)
Generalized Radius and Integrated Codebook Transforms for Differentiable Vector Quantization
par: You, Haochen, et autres
Publié: (2026)
par: You, Haochen, et autres
Publié: (2026)
The Cost of Learning under Multiple Change Points
par: Gafni, Tomer, et autres
Publié: (2026)
par: Gafni, Tomer, et autres
Publié: (2026)
Learning the Pareto Front Using Bootstrapped Observation Samples
par: Kim, Wonyoung, et autres
Publié: (2023)
par: Kim, Wonyoung, et autres
Publié: (2023)
A Giant-Step Baby-Step Classifier For Scalable and Real-Time Anomaly Detection In Industrial Control Systems and Water Treatment Systems
par: Venugopalan, Sarad, et autres
Publié: (2025)
par: Venugopalan, Sarad, et autres
Publié: (2025)
A Differentially Private Weighted Empirical Risk Minimization Procedure and its Application to Outcome Weighted Learning
par: Giddens, Spencer, et autres
Publié: (2023)
par: Giddens, Spencer, et autres
Publié: (2023)
SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights
par: Müller, Lorenz K., et autres
Publié: (2025)
par: Müller, Lorenz K., et autres
Publié: (2025)
TruncQuant: Truncation-Ready Quantization for DNNs with Flexible Weight Bit Precision
par: Kim, Jinhee, et autres
Publié: (2025)
par: Kim, Jinhee, et autres
Publié: (2025)
A2Q+: Improving Accumulator-Aware Weight Quantization
par: Colbert, Ian, et autres
Publié: (2024)
par: Colbert, Ian, et autres
Publié: (2024)
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
par: Zhou, Zhaojing, et autres
Publié: (2025)
par: Zhou, Zhaojing, et autres
Publié: (2025)
DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick
par: Vali, Mohammad Hassan, et autres
Publié: (2025)
par: Vali, Mohammad Hassan, et autres
Publié: (2025)
Leveraging Continuously Differentiable Activation Functions for Learning in Quantized Noisy Environments
par: Shah, Vivswan, et autres
Publié: (2024)
par: Shah, Vivswan, et autres
Publié: (2024)
Quantized Convolutional Neural Networks Through the Lens of Partial Differential Equations
par: Ben-Yair, Ido, et autres
Publié: (2021)
par: Ben-Yair, Ido, et autres
Publié: (2021)
Hierarchical Vector Quantized Graph Autoencoder with Annealing-Based Code Selection
par: Zeng, Long, et autres
Publié: (2025)
par: Zeng, Long, et autres
Publié: (2025)
Differentiable Search for Finding Optimal Quantization Strategy
par: Li, Lianqiang, et autres
Publié: (2024)
par: Li, Lianqiang, et autres
Publié: (2024)
Documents similaires
-
StatQAT: Statistical Quantizer Optimization for Deep Networks
par: Aktukmak, Mehmet, et autres
Publié: (2026) -
EfQAT: An Efficient Framework for Quantization-Aware Training
par: Ashkboos, Saleh, et autres
Publié: (2024) -
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
par: Zhang, Peiyuan, et autres
Publié: (2026) -
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
par: Gernigon, Cédric, et autres
Publié: (2024) -
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
par: Ke, Wenjin, et autres
Publié: (2025)