A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Killian, Earl |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
par: Liu, Qunyou, et autres
Publié: (2026)
par: Liu, Qunyou, et autres
Publié: (2026)
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
par: Klhufek, Jan, et autres
Publié: (2024)
par: Klhufek, Jan, et autres
Publié: (2024)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
par: Mueller, Lion, et autres
Publié: (2025)
par: Mueller, Lion, et autres
Publié: (2025)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
Improving Quantization with Post-Training Model Expansion
par: Franco, Giuseppe, et autres
Publié: (2025)
par: Franco, Giuseppe, et autres
Publié: (2025)
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
par: AbouElhamayed, Ahmed F., et autres
Publié: (2023)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2023)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
AHCQ-SAM: Toward Accurate and Hardware-Compatible Post-Training Segment Anything Model Quantization
par: Zhang, Wenlun, et autres
Publié: (2025)
par: Zhang, Wenlun, et autres
Publié: (2025)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
par: Zhang, Zixi, et autres
Publié: (2023)
par: Zhang, Zixi, et autres
Publié: (2023)
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
par: Wang, Irene, et autres
Publié: (2025)
par: Wang, Irene, et autres
Publié: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
Energy Efficient Software Hardware CoDesign for Machine Learning: From TinyML to Large Language Models
par: Vahdatpour, Mohammad Saleh, et autres
Publié: (2026)
par: Vahdatpour, Mohammad Saleh, et autres
Publié: (2026)
Energy-Aware Deep Learning on Resource-Constrained Hardware
par: Millar, Josh, et autres
Publié: (2025)
par: Millar, Josh, et autres
Publié: (2025)
Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices
par: Choi, Dawon, et autres
Publié: (2026)
par: Choi, Dawon, et autres
Publié: (2026)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
LOTION: Smoothing the Optimization Landscape for Quantized Training
par: Kwun, Mujin, et autres
Publié: (2025)
par: Kwun, Mujin, et autres
Publié: (2025)
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
par: Yu, Zhewen, et autres
Publié: (2024)
par: Yu, Zhewen, et autres
Publié: (2024)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
par: Xie, Xilong, et autres
Publié: (2025)
par: Xie, Xilong, et autres
Publié: (2025)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
par: Wang, Run, et autres
Publié: (2026)
par: Wang, Run, et autres
Publié: (2026)
SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training
par: Pan, Yunjie, et autres
Publié: (2026)
par: Pan, Yunjie, et autres
Publié: (2026)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
par: Wang, Wenxun, et autres
Publié: (2025)
par: Wang, Wenxun, et autres
Publié: (2025)
Hardware-Aware Neural Dropout Search for Reliable Uncertainty Prediction on FPGA
par: Zhang, Zehuan, et autres
Publié: (2024)
par: Zhang, Zehuan, et autres
Publié: (2024)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
par: Cho, Eunyeong, et autres
Publié: (2026)
par: Cho, Eunyeong, et autres
Publié: (2026)
Challenges and Research Directions for Large Language Model Inference Hardware
par: Ma, Xiaoyu, et autres
Publié: (2026)
par: Ma, Xiaoyu, et autres
Publié: (2026)
Low Power Vision Transformer Accelerator with Hardware-Aware Pruning and Optimized Dataflow
par: Hsiung, Ching-Lin, et autres
Publié: (2025)
par: Hsiung, Ching-Lin, et autres
Publié: (2025)
Exploring the Limitations of Kolmogorov-Arnold Networks in Classification: Insights to Software Training and Hardware Implementation
par: Tran, Van Duy, et autres
Publié: (2024)
par: Tran, Van Duy, et autres
Publié: (2024)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
par: Andronic, Marta, et autres
Publié: (2025)
par: Andronic, Marta, et autres
Publié: (2025)
Hardware-Aware Fine-Tuning of Spiking Q-Networks on the SpiNNaker2 Neuromorphic Platform
par: Arfa, Sirine, et autres
Publié: (2025)
par: Arfa, Sirine, et autres
Publié: (2025)
MaRVIn: A Cross-Layer Mixed-Precision RISC-V Framework for DNN Inference, from ISA Extension to Hardware Acceleration
par: Armeniakos, Giorgos, et autres
Publié: (2025)
par: Armeniakos, Giorgos, et autres
Publié: (2025)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
par: Jang, Hongsun, et autres
Publié: (2024)
par: Jang, Hongsun, et autres
Publié: (2024)
Hardware-Aware Data and Instruction Mapping for AI Tasks: Balancing Parallelism, I/O and Memory Tradeoffs
par: Chowdhury, Md Rownak Hossain, et autres
Publié: (2025)
par: Chowdhury, Md Rownak Hossain, et autres
Publié: (2025)
A2Q+: Improving Accumulator-Aware Weight Quantization
par: Colbert, Ian, et autres
Publié: (2024)
par: Colbert, Ian, et autres
Publié: (2024)
Hardware Software Optimizations for Fast Model Recovery on Reconfigurable Architectures
par: Xu, Bin, et autres
Publié: (2025)
par: Xu, Bin, et autres
Publié: (2025)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
par: Koo, Jahyun, et autres
Publié: (2024)
par: Koo, Jahyun, et autres
Publié: (2024)
A Joint Learning Approach to Hardware Caching and Prefetching
par: Yuan, Samuel, et autres
Publié: (2025)
par: Yuan, Samuel, et autres
Publié: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
par: Xiang, Maoyang, et autres
Publié: (2025)
par: Xiang, Maoyang, et autres
Publié: (2025)
ATHEENA: A Toolflow for Hardware Early-Exit Network Automation
par: Biggs, Benjamin, et autres
Publié: (2023)
par: Biggs, Benjamin, et autres
Publié: (2023)
EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning
par: Hu, Guangyu, et autres
Publié: (2026)
par: Hu, Guangyu, et autres
Publié: (2026)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
par: Hsieh, Fen-Yu, et autres
Publié: (2025)
par: Hsieh, Fen-Yu, et autres
Publié: (2025)
Documents similaires
-
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
par: Liu, Qunyou, et autres
Publié: (2026) -
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
par: Klhufek, Jan, et autres
Publié: (2024) -
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
par: Mueller, Lion, et autres
Publié: (2025) -
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024) -
Improving Quantization with Post-Training Model Expansion
par: Franco, Giuseppe, et autres
Publié: (2025)