Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yanshu, He, Wenyang, Yang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Interactions Across Blocks in Post-Training Quantization of Large Language Models
par: Shabanovi, Khasmamad, et autres
Publié: (2024)
par: Shabanovi, Khasmamad, et autres
Publié: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022)
par: Xiao, Guangxuan, et autres
Publié: (2022)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
par: Zhou, Chenxi, et autres
Publié: (2025)
par: Zhou, Chenxi, et autres
Publié: (2025)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
par: Guan, Ziyi, et autres
Publié: (2024)
par: Guan, Ziyi, et autres
Publié: (2024)
Second-Order Information Matters: Revisiting Machine Unlearning for Large Language Models
par: Gu, Kang, et autres
Publié: (2024)
par: Gu, Kang, et autres
Publié: (2024)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
The Role of Diversity in In-Context Learning for Large Language Models
par: Xiao, Wenyang, et autres
Publié: (2025)
par: Xiao, Wenyang, et autres
Publié: (2025)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
Channel-Wise Mixed-Precision Quantization for Large Language Models
par: Chen, Zihan, et autres
Publié: (2024)
par: Chen, Zihan, et autres
Publié: (2024)
Efficient Post-training Quantization with FP8 Formats
par: Shen, Haihao, et autres
Publié: (2023)
par: Shen, Haihao, et autres
Publié: (2023)
SiLQ: Simple Large Language Model Quantization-Aware Training
par: Esser, Steven K., et autres
Publié: (2025)
par: Esser, Steven K., et autres
Publié: (2025)
Sliding Window Attention Training for Efficient Large Language Models
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-Tuning
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
An Efficient Inference Framework for Early-exit Large Language Models
par: Miao, Ruijie, et autres
Publié: (2024)
par: Miao, Ruijie, et autres
Publié: (2024)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
par: Park, Jungwoo, et autres
Publié: (2025)
par: Park, Jungwoo, et autres
Publié: (2025)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Athena: Retrieval-augmented Legal Judgment Prediction with Large Language Models
par: Peng, Xiao, et autres
Publié: (2024)
par: Peng, Xiao, et autres
Publié: (2024)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024)
par: Guo, Song, et autres
Publié: (2024)
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
par: Ichikawa, Yuma, et autres
Publié: (2025)
par: Ichikawa, Yuma, et autres
Publié: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
Post Training Quantization of Large Language Models with Microscaling Formats
par: Sharify, Sayeh, et autres
Publié: (2024)
par: Sharify, Sayeh, et autres
Publié: (2024)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
par: He, Liulu, et autres
Publié: (2025)
par: He, Liulu, et autres
Publié: (2025)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
Pushing the Limits of Block Rotations in Post-Training Quantization
par: Sanjeet, Sai, et autres
Publié: (2026)
par: Sanjeet, Sai, et autres
Publié: (2026)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)
par: Li, Yanshu
Publié: (2025)
Art and Science of Quantizing Large-Scale Models: A Comprehensive Overview
par: Wang, Yanshu, et autres
Publié: (2024)
par: Wang, Yanshu, et autres
Publié: (2024)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
par: Zhao, Shiwan, et autres
Publié: (2026)
par: Zhao, Shiwan, et autres
Publié: (2026)
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost
par: Cao, Sheng, et autres
Publié: (2025)
par: Cao, Sheng, et autres
Publié: (2025)
LLM-BIP: Structured Pruning for Large Language Models with Block-Wise Forward Importance Propagation
par: Wu, Haihang
Publié: (2024)
par: Wu, Haihang
Publié: (2024)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
Mapping Post-Training Forgetting in Language Models at Scale
par: Harmon, Jackson, et autres
Publié: (2025)
par: Harmon, Jackson, et autres
Publié: (2025)
SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
par: Czakó, Patrik, et autres
Publié: (2025)
par: Czakó, Patrik, et autres
Publié: (2025)
Documents similaires
-
Interactions Across Blocks in Post-Training Quantization of Large Language Models
par: Shabanovi, Khasmamad, et autres
Publié: (2024) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022) -
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024) -
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
par: Zhou, Chenxi, et autres
Publié: (2025) -
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
par: Guan, Ziyi, et autres
Publié: (2024)