Interpreting the Effects of Quantization on LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singh, Manpreet, Sajjad, Hassan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantifying the Capabilities of LLMs across Scale and Precision
par: Badshah, Sher, et autres
Publié: (2024)
par: Badshah, Sher, et autres
Publié: (2024)
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
par: Garg, Ankur, et autres
Publié: (2025)
par: Garg, Ankur, et autres
Publié: (2025)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
par: Wong, Sing Hieng, et autres
Publié: (2026)
par: Wong, Sing Hieng, et autres
Publié: (2026)
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)
par: Bondarenko, Yelysei, et autres
Publié: (2024)
Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression
par: Xiao, Hanqi, et autres
Publié: (2025)
par: Xiao, Hanqi, et autres
Publié: (2025)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025)
par: Butler, Landon, et autres
Publié: (2025)
Continuous Approximations for Improving Quantization Aware Training of LLMs
par: Li, He, et autres
Publié: (2024)
par: Li, He, et autres
Publié: (2024)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Evaluating the Generalization Ability of Quantized LLMs: Benchmark, Analysis, and Toolbox
par: Liu, Yijun, et autres
Publié: (2024)
par: Liu, Yijun, et autres
Publié: (2024)
RSQ: Learning from Important Tokens Leads to Better Quantized LLMs
par: Sung, Yi-Lin, et autres
Publié: (2025)
par: Sung, Yi-Lin, et autres
Publié: (2025)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
par: Cheng, Wenhua, et autres
Publié: (2023)
par: Cheng, Wenhua, et autres
Publié: (2023)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
par: Haider, Muhammad Umair, et autres
Publié: (2025)
par: Haider, Muhammad Umair, et autres
Publié: (2025)
Crafting Interpretable Embeddings by Asking LLMs Questions
par: Benara, Vinamra, et autres
Publié: (2024)
par: Benara, Vinamra, et autres
Publié: (2024)
SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
par: Czakó, Patrik, et autres
Publié: (2025)
par: Czakó, Patrik, et autres
Publié: (2025)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
par: Xiong, Boya, et autres
Publié: (2025)
par: Xiong, Boya, et autres
Publié: (2025)
MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs
par: Zhao, Guojiang, et autres
Publié: (2025)
par: Zhao, Guojiang, et autres
Publié: (2025)
GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
par: Zhou, Sifan, et autres
Publié: (2025)
par: Zhou, Sifan, et autres
Publié: (2025)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
par: Huang, Xijie, et autres
Publié: (2024)
par: Huang, Xijie, et autres
Publié: (2024)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability
par: Lee, Yu-Ting, et autres
Publié: (2025)
par: Lee, Yu-Ting, et autres
Publié: (2025)
Certifying Knowledge Comprehension in LLMs
par: Chaudhary, Isha, et autres
Publié: (2024)
par: Chaudhary, Isha, et autres
Publié: (2024)
Rethinking Interpretability in the Era of Large Language Models
par: Singh, Chandan, et autres
Publié: (2024)
par: Singh, Chandan, et autres
Publié: (2024)
Do LLMs Encode Functional Importance of Reasoning Tokens?
par: Singh, Janvijay, et autres
Publié: (2026)
par: Singh, Janvijay, et autres
Publié: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Data Doping or True Intelligence? Evaluating the Transferability of Injected Knowledge in LLMs
par: Jan, Essa, et autres
Publié: (2025)
par: Jan, Essa, et autres
Publié: (2025)
LLMs cannot find reasoning errors, but can correct them given the error location
par: Tyen, Gladys, et autres
Publié: (2023)
par: Tyen, Gladys, et autres
Publié: (2023)
Nudging: Inference-time Alignment of LLMs via Guided Decoding
par: Fei, Yu, et autres
Publié: (2024)
par: Fei, Yu, et autres
Publié: (2024)
Interpretable Next-token Prediction via the Generalized Induction Head
par: Kim, Eunji, et autres
Publié: (2024)
par: Kim, Eunji, et autres
Publié: (2024)
Automated Unity Game Template Generation from GDDs via NLP and Multi-Modal LLMs
par: Hassan, Amna
Publié: (2025)
par: Hassan, Amna
Publié: (2025)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
par: Reddy, Avinash, et autres
Publié: (2026)
par: Reddy, Avinash, et autres
Publié: (2026)
Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs
par: Bozoukov, Matthew, et autres
Publié: (2025)
par: Bozoukov, Matthew, et autres
Publié: (2025)
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation
par: Manvi, Rohin, et autres
Publié: (2024)
par: Manvi, Rohin, et autres
Publié: (2024)
A Unified Framework with Novel Metrics for Evaluating the Effectiveness of XAI Techniques in LLMs
par: Mersha, Melkamu Abay, et autres
Publié: (2025)
par: Mersha, Melkamu Abay, et autres
Publié: (2025)
Optimal Embedding Learning Rate in LLMs: The Effect of Vocabulary Size
par: Hayou, Soufiane, et autres
Publié: (2025)
par: Hayou, Soufiane, et autres
Publié: (2025)
From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts?
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Turning LLM Activations Quantization-Friendly
par: Czakó, Patrik, et autres
Publié: (2025)
par: Czakó, Patrik, et autres
Publié: (2025)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
Documents similaires
-
Quantifying the Capabilities of LLMs across Scale and Precision
par: Badshah, Sher, et autres
Publié: (2024) -
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
par: Garg, Ankur, et autres
Publié: (2025) -
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024) -
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
par: Wong, Sing Hieng, et autres
Publié: (2026) -
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)