A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Killian, Earl |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
von: Liu, Qunyou, et al.
Veröffentlicht: (2026)
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
von: Klhufek, Jan, et al.
Veröffentlicht: (2024)
von: Klhufek, Jan, et al.
Veröffentlicht: (2024)
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
von: Mueller, Lion, et al.
Veröffentlicht: (2025)
von: Mueller, Lion, et al.
Veröffentlicht: (2025)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
von: Li, Jinhao, et al.
Veröffentlicht: (2024)
Improving Quantization with Post-Training Model Expansion
von: Franco, Giuseppe, et al.
Veröffentlicht: (2025)
von: Franco, Giuseppe, et al.
Veröffentlicht: (2025)
PQA: Exploring the Potential of Product Quantization in DNN Hardware Acceleration
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2023)
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2023)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
von: Huang, Wei, et al.
Veröffentlicht: (2023)
von: Huang, Wei, et al.
Veröffentlicht: (2023)
AHCQ-SAM: Toward Accurate and Hardware-Compatible Post-Training Segment Anything Model Quantization
von: Zhang, Wenlun, et al.
Veröffentlicht: (2025)
von: Zhang, Wenlun, et al.
Veröffentlicht: (2025)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
von: Zhang, Zixi, et al.
Veröffentlicht: (2023)
CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
von: Wang, Irene, et al.
Veröffentlicht: (2025)
von: Wang, Irene, et al.
Veröffentlicht: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
von: Kim, Wonung, et al.
Veröffentlicht: (2025)
Energy Efficient Software Hardware CoDesign for Machine Learning: From TinyML to Large Language Models
von: Vahdatpour, Mohammad Saleh, et al.
Veröffentlicht: (2026)
von: Vahdatpour, Mohammad Saleh, et al.
Veröffentlicht: (2026)
Energy-Aware Deep Learning on Resource-Constrained Hardware
von: Millar, Josh, et al.
Veröffentlicht: (2025)
von: Millar, Josh, et al.
Veröffentlicht: (2025)
Hardware-Efficient Softmax and Layer Normalization with Guaranteed Normalization for Edge Devices
von: Choi, Dawon, et al.
Veröffentlicht: (2026)
von: Choi, Dawon, et al.
Veröffentlicht: (2026)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
von: Hooper, Coleman, et al.
Veröffentlicht: (2025)
von: Hooper, Coleman, et al.
Veröffentlicht: (2025)
LOTION: Smoothing the Optimization Landscape for Quantized Training
von: Kwun, Mujin, et al.
Veröffentlicht: (2025)
von: Kwun, Mujin, et al.
Veröffentlicht: (2025)
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
von: Yu, Zhewen, et al.
Veröffentlicht: (2024)
von: Yu, Zhewen, et al.
Veröffentlicht: (2024)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
von: Xie, Xilong, et al.
Veröffentlicht: (2025)
von: Xie, Xilong, et al.
Veröffentlicht: (2025)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
von: Wang, Run, et al.
Veröffentlicht: (2026)
von: Wang, Run, et al.
Veröffentlicht: (2026)
SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training
von: Pan, Yunjie, et al.
Veröffentlicht: (2026)
von: Pan, Yunjie, et al.
Veröffentlicht: (2026)
SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
von: Wang, Wenxun, et al.
Veröffentlicht: (2025)
Hardware-Aware Neural Dropout Search for Reliable Uncertainty Prediction on FPGA
von: Zhang, Zehuan, et al.
Veröffentlicht: (2024)
von: Zhang, Zehuan, et al.
Veröffentlicht: (2024)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
von: Cho, Eunyeong, et al.
Veröffentlicht: (2026)
Challenges and Research Directions for Large Language Model Inference Hardware
von: Ma, Xiaoyu, et al.
Veröffentlicht: (2026)
von: Ma, Xiaoyu, et al.
Veröffentlicht: (2026)
Low Power Vision Transformer Accelerator with Hardware-Aware Pruning and Optimized Dataflow
von: Hsiung, Ching-Lin, et al.
Veröffentlicht: (2025)
von: Hsiung, Ching-Lin, et al.
Veröffentlicht: (2025)
Exploring the Limitations of Kolmogorov-Arnold Networks in Classification: Insights to Software Training and Hardware Implementation
von: Tran, Van Duy, et al.
Veröffentlicht: (2024)
von: Tran, Van Duy, et al.
Veröffentlicht: (2024)
PolyLUT: Ultra-low Latency Polynomial Inference with Hardware-Aware Structured Pruning
von: Andronic, Marta, et al.
Veröffentlicht: (2025)
von: Andronic, Marta, et al.
Veröffentlicht: (2025)
Hardware-Aware Fine-Tuning of Spiking Q-Networks on the SpiNNaker2 Neuromorphic Platform
von: Arfa, Sirine, et al.
Veröffentlicht: (2025)
von: Arfa, Sirine, et al.
Veröffentlicht: (2025)
MaRVIn: A Cross-Layer Mixed-Precision RISC-V Framework for DNN Inference, from ISA Extension to Hardware Acceleration
von: Armeniakos, Giorgos, et al.
Veröffentlicht: (2025)
von: Armeniakos, Giorgos, et al.
Veröffentlicht: (2025)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
von: Jang, Hongsun, et al.
Veröffentlicht: (2024)
Hardware-Aware Data and Instruction Mapping for AI Tasks: Balancing Parallelism, I/O and Memory Tradeoffs
von: Chowdhury, Md Rownak Hossain, et al.
Veröffentlicht: (2025)
von: Chowdhury, Md Rownak Hossain, et al.
Veröffentlicht: (2025)
A2Q+: Improving Accumulator-Aware Weight Quantization
von: Colbert, Ian, et al.
Veröffentlicht: (2024)
von: Colbert, Ian, et al.
Veröffentlicht: (2024)
Hardware Software Optimizations for Fast Model Recovery on Reconfigurable Architectures
von: Xu, Bin, et al.
Veröffentlicht: (2025)
von: Xu, Bin, et al.
Veröffentlicht: (2025)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
von: Zhang, Yu, et al.
Veröffentlicht: (2024)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
von: Koo, Jahyun, et al.
Veröffentlicht: (2024)
von: Koo, Jahyun, et al.
Veröffentlicht: (2024)
A Joint Learning Approach to Hardware Caching and Prefetching
von: Yuan, Samuel, et al.
Veröffentlicht: (2025)
von: Yuan, Samuel, et al.
Veröffentlicht: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
von: Xiang, Maoyang, et al.
Veröffentlicht: (2025)
von: Xiang, Maoyang, et al.
Veröffentlicht: (2025)
ATHEENA: A Toolflow for Hardware Early-Exit Network Automation
von: Biggs, Benjamin, et al.
Veröffentlicht: (2023)
von: Biggs, Benjamin, et al.
Veröffentlicht: (2023)
EvolveGen: Algorithmic Level Hardware Model Checking Benchmark Generation through Reinforcement Learning
von: Hu, Guangyu, et al.
Veröffentlicht: (2026)
von: Hu, Guangyu, et al.
Veröffentlicht: (2026)
FPGA Co-Design for Efficient N:M Sparse and Quantized Model Inference
von: Hsieh, Fen-Yu, et al.
Veröffentlicht: (2025)
von: Hsieh, Fen-Yu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
von: Liu, Qunyou, et al.
Veröffentlicht: (2026) -
Exploring Quantization and Mapping Synergy in Hardware-Aware Deep Neural Network Accelerators
von: Klhufek, Jan, et al.
Veröffentlicht: (2024) -
Rescaling-Aware Training for Efficient Deployment of Deep Learning Models on Full-Integer Hardware
von: Mueller, Lion, et al.
Veröffentlicht: (2025) -
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
von: Li, Jinhao, et al.
Veröffentlicht: (2024) -
Improving Quantization with Post-Training Model Expansion
von: Franco, Giuseppe, et al.
Veröffentlicht: (2025)