FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiao, Ye, Wang, Yian, Chen, Zhiheng, Kwon, Hyoukjun, Huang, Sitao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
Characterizing State Space Model and Hybrid Language Model Performance with Long Context
par: Mitra, Saptarshi, et autres
Publié: (2025)
par: Mitra, Saptarshi, et autres
Publié: (2025)
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
par: Xu, Haocheng, et autres
Publié: (2024)
par: Xu, Haocheng, et autres
Publié: (2024)
FlexLLM: Composable HLS Library for Flexible Hybrid LLM Accelerator Design
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
SCAR: Scheduling Multi-Model AI Workloads on Heterogeneous Multi-Chiplet Module Accelerators
par: Odema, Mohanad, et autres
Publié: (2024)
par: Odema, Mohanad, et autres
Publié: (2024)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
par: Kabir, Ehsan, et autres
Publié: (2024)
par: Kabir, Ehsan, et autres
Publié: (2024)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
par: Ma, Shaobo, et autres
Publié: (2025)
par: Ma, Shaobo, et autres
Publié: (2025)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
par: Kim, Jiyoon, et autres
Publié: (2025)
par: Kim, Jiyoon, et autres
Publié: (2025)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025)
par: Liang, Yanbiao, et autres
Publié: (2025)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
AutoHLS: Learning to Accelerate Design Space Exploration for HLS Designs
par: Ahmed, Md Rubel, et autres
Publié: (2024)
par: Ahmed, Md Rubel, et autres
Publié: (2024)
TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators
par: Meng, Chang, et autres
Publié: (2026)
par: Meng, Chang, et autres
Publié: (2026)
D-com: Accelerating Iterative Processing to Enable Low-rank Decomposition of Activations
par: Tahmasebi, Faraz, et autres
Publié: (2025)
par: Tahmasebi, Faraz, et autres
Publié: (2025)
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
par: Li, Guoyu, et autres
Publié: (2025)
par: Li, Guoyu, et autres
Publié: (2025)
Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads
par: Karami, Rachid, et autres
Publié: (2024)
par: Karami, Rachid, et autres
Publié: (2024)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Late Breaking Results: Quamba-SE: Soft-edge Quantizer for Activations in State Space Models
par: Chen, Yizhi, et autres
Publié: (2026)
par: Chen, Yizhi, et autres
Publié: (2026)
Efficient Calibration for RRAM-based In-Memory Computing using DoRA
par: Dong, Weirong, et autres
Publié: (2025)
par: Dong, Weirong, et autres
Publié: (2025)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
FlexiSAGA: A Flexible Systolic Array GEMM Accelerator for Sparse and Dense Processing
par: Müller, Mika Markus, et autres
Publié: (2025)
par: Müller, Mika Markus, et autres
Publié: (2025)
Improving Quantization with Post-Training Model Expansion
par: Franco, Giuseppe, et autres
Publié: (2025)
par: Franco, Giuseppe, et autres
Publié: (2025)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
par: Jeong, Geonhwa, et autres
Publié: (2024)
par: Jeong, Geonhwa, et autres
Publié: (2024)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization
par: Matsushima, Kosuke, et autres
Publié: (2026)
par: Matsushima, Kosuke, et autres
Publié: (2026)
Neural Network Quantization for Microcontrollers: A Comprehensive Survey of Methods, Platforms, and Applications
par: Abushahla, Hamza A., et autres
Publié: (2025)
par: Abushahla, Hamza A., et autres
Publié: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024)
par: Ma, Shaobo, et autres
Publié: (2024)
'1'-bit Count-based Sorting Unit to Reduce Link Power in DNN Accelerators
par: Han, Ruichi, et autres
Publié: (2026)
par: Han, Ruichi, et autres
Publié: (2026)
RESQ: A Unified Framework for REliability- and Security Enhancement of Quantized Deep Neural Networks
par: Mohammadi, Ali Soltan, et autres
Publié: (2026)
par: Mohammadi, Ali Soltan, et autres
Publié: (2026)
SmartQuant: CXL-based AI Model Store in Support of Runtime Configurable Weight Quantization
par: Xie, Rui, et autres
Publié: (2024)
par: Xie, Rui, et autres
Publié: (2024)
Heterogeneous Acceleration Pipeline for Recommendation System Training
par: Adnan, Muhammad, et autres
Publié: (2022)
par: Adnan, Muhammad, et autres
Publié: (2022)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
par: Cong, Rongqing, et autres
Publié: (2024)
par: Cong, Rongqing, et autres
Publié: (2024)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
par: Lin, Yujun, et autres
Publié: (2025)
par: Lin, Yujun, et autres
Publié: (2025)
Mirage: An RNS-Based Photonic Accelerator for DNN Training
par: Demirkiran, Cansu, et autres
Publié: (2023)
par: Demirkiran, Cansu, et autres
Publié: (2023)
NeuroSim V1.5: Improved Software Backbone for Benchmarking Compute-in-Memory Accelerators with Device and Circuit-level Non-idealities
par: Read, James, et autres
Publié: (2025)
par: Read, James, et autres
Publié: (2025)
Documents similaires
-
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
par: Qiao, Ye, et autres
Publié: (2025) -
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
par: Qiao, Ye, et autres
Publié: (2025) -
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
par: Qiao, Ye, et autres
Publié: (2025) -
Characterizing State Space Model and Hybrid Language Model Performance with Long Context
par: Mitra, Saptarshi, et autres
Publié: (2025) -
Optimized Spatial Architecture Mapping Flow for Transformer Accelerators
par: Xu, Haocheng, et autres
Publié: (2024)