M-ANT: Efficient Low-bit Group Quantization for LLMs via Mathematically Adaptive Numerical Type
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Weiming, Zhang, Haoyan, Guo, Cong, Feng, Yu, Guan, Renyang, Hua, Zhendong, Liu, Zihan, Guan, Yue, Guo, Minyi, Leng, Jingwen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
par: Hu, Weiming, et autres
Publié: (2026)
par: Hu, Weiming, et autres
Publié: (2026)
Cicero: Addressing Algorithmic and Architectural Bottlenecks in Neural Rendering by Radiance Warping and Memory Optimizations
par: Feng, Yu, et autres
Publié: (2024)
par: Feng, Yu, et autres
Publié: (2024)
SLTarch: Towards Scalable Point-Based Neural Rendering by Taming Workload Imbalance and Memory Irregularity
par: Li, Xingyang, et autres
Publié: (2025)
par: Li, Xingyang, et autres
Publié: (2025)
StreamGrid: Streaming Point Cloud Analytics via Compulsory Splitting and Deterministic Termination
par: Feng, Yu, et autres
Publié: (2025)
par: Feng, Yu, et autres
Publié: (2025)
Lumina: Real-Time Mobile Neural Rendering by Exploiting Computational Redundancy
par: Feng, Yu, et autres
Publié: (2025)
par: Feng, Yu, et autres
Publié: (2025)
Potamoi: Accelerating Neural Rendering via a Unified Streaming Architecture
par: Feng, Yu, et autres
Publié: (2024)
par: Feng, Yu, et autres
Publié: (2024)
Splatonic: Architecture Support for 3D Gaussian Splatting SLAM via Sparse Processing
par: Huang, Xiaotong, et autres
Publié: (2025)
par: Huang, Xiaotong, et autres
Publié: (2025)
An Optimizing Framework on MLIR for Efficient FPGA-based Accelerator Generation
par: Zhang, Weichuang, et autres
Publié: (2024)
par: Zhang, Weichuang, et autres
Publié: (2024)
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
par: Errabii, Sohaib, et autres
Publié: (2026)
par: Errabii, Sohaib, et autres
Publié: (2026)
Design of a 6-bit Threshold Inverter Quantization (TIQ) Flash Analog to Digital Converter (ADC)
par: Sarkar, Noyon Kumar, et autres
Publié: (2025)
par: Sarkar, Noyon Kumar, et autres
Publié: (2025)
bitSMM: A bit-Serial Matrix Multiplication Accelerator
par: Antunes, Pedro, et autres
Publié: (2026)
par: Antunes, Pedro, et autres
Publié: (2026)
Gaze into the Pattern: Characterizing Spatial Patterns with Internal Temporal Correlations for Hardware Prefetching
par: Chen, Zixiao, et autres
Publié: (2024)
par: Chen, Zixiao, et autres
Publié: (2024)
Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation
par: Ke, Chih-Hua
Publié: (2026)
par: Ke, Chih-Hua
Publié: (2026)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
AutoVCoder: A Systematic Framework for Automated Verilog Code Generation using LLMs
par: Gao, Mingzhe, et autres
Publié: (2024)
par: Gao, Mingzhe, et autres
Publié: (2024)
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
par: Shan, Haoxuan, et autres
Publié: (2025)
par: Shan, Haoxuan, et autres
Publié: (2025)
TMA-Adaptive FP8 Grouped GEMM: Eliminating Padding Requirements in Low-Precision Training and Inference on Hopper
par: Su, Zhongling, et autres
Publié: (2025)
par: Su, Zhongling, et autres
Publié: (2025)
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
CODO: An Automated Compiler for Comprehensive Dataflow Optimization
par: Zhang, Weichuang, et autres
Publié: (2026)
par: Zhang, Weichuang, et autres
Publié: (2026)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
Sensitivity-Aware Mixed-Precision Quantization for ReRAM-based Computing-in-Memory
par: Chen, Guan-Cheng, et autres
Publié: (2025)
par: Chen, Guan-Cheng, et autres
Publié: (2025)
D-Legion: A Scalable Many-Core Architecture for Accelerating Matrix Multiplication in Quantized LLMs
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2026)
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2026)
Hardware-Efficient Accurate 4-bit Multiplier for Xilinx 7 Series FPGAs
par: Kida, Misaki, et autres
Publié: (2025)
par: Kida, Misaki, et autres
Publié: (2025)
Hemlet: A Heterogeneous Compute-in-Memory Chiplet Architecture for Vision Transformers with Group-Level Parallelism
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Nebula: Enable City-Scale 3D Gaussian Splatting in Virtual Reality via Collaborative Rendering and Accelerated Stereo Rasterization
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs
par: Malekar, Jinendra, et autres
Publié: (2025)
par: Malekar, Jinendra, et autres
Publié: (2025)
UVLLM: An Automated Universal RTL Verification Framework using LLMs
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Hardware Generation and Exploration of Lookup Table-Based Accelerators for 1.58-bit LLM Inference
par: Geens, Robin, et autres
Publié: (2026)
par: Geens, Robin, et autres
Publié: (2026)
A Tensor-Train Decomposition based Compression of LLMs on Group Vector Systolic Accelerator
par: Huang, Sixiao, et autres
Publié: (2025)
par: Huang, Sixiao, et autres
Publié: (2025)
FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
par: Xie, Xilong, et autres
Publié: (2025)
par: Xie, Xilong, et autres
Publié: (2025)
Modulo-$(2^{2n}+1)$ Arithmetic via Two Parallel n-bit Residue Channels
par: Jaberipur, Ghassem, et autres
Publié: (2024)
par: Jaberipur, Ghassem, et autres
Publié: (2024)
Semicustom Frontend VLSI Design and Analysis of a 32-bit Brent-Kung Adder in Cadence Suite
par: Singh, Yashvardhan
Publié: (2025)
par: Singh, Yashvardhan
Publié: (2025)
WebRISC-V: A 64-bit RISC-V Pipeline Simulator for Computer Architecture Classes
par: Giorgi, Roberto, et autres
Publié: (2025)
par: Giorgi, Roberto, et autres
Publié: (2025)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
par: Duan, Bowen, et autres
Publié: (2026)
par: Duan, Bowen, et autres
Publié: (2026)
Hierarchical Source-to-Post-Route QoR Prediction in High-Level Synthesis with GNNs
par: Gao, Mingzhe, et autres
Publié: (2024)
par: Gao, Mingzhe, et autres
Publié: (2024)
ARAS: An Adaptive Low-Cost ReRAM-Based Accelerator for DNNs
par: Sabri, Mohammad, et autres
Publié: (2024)
par: Sabri, Mohammad, et autres
Publié: (2024)
VerilogMonkey: Exploring Parallel Scaling for Automated Verilog Code Generation with LLMs
par: Niu, Juxin, et autres
Publié: (2025)
par: Niu, Juxin, et autres
Publié: (2025)
A Survey on LUT-based Deep Neural Networks Implemented in FPGAs
par: Guo, Zeyu
Publié: (2025)
par: Guo, Zeyu
Publié: (2025)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
par: Guo, Cong, et autres
Publié: (2025)
par: Guo, Cong, et autres
Publié: (2025)
Documents similaires
-
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
par: Hu, Weiming, et autres
Publié: (2026) -
Cicero: Addressing Algorithmic and Architectural Bottlenecks in Neural Rendering by Radiance Warping and Memory Optimizations
par: Feng, Yu, et autres
Publié: (2024) -
SLTarch: Towards Scalable Point-Based Neural Rendering by Taming Workload Imbalance and Memory Irregularity
par: Li, Xingyang, et autres
Publié: (2025) -
StreamGrid: Streaming Point Cloud Analytics via Compulsory Splitting and Deterministic Termination
par: Feng, Yu, et autres
Publié: (2025) -
Lumina: Real-Time Mobile Neural Rendering by Exploiting Computational Redundancy
par: Feng, Yu, et autres
Publié: (2025)