Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Shaobo, Fang, Chao, Shao, Haikuo, Wang, Zhongfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
por: Ma, Shaobo, et al.
Publicado: (2025)
por: Ma, Shaobo, et al.
Publicado: (2025)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
por: Wang, Aotao, et al.
Publicado: (2025)
por: Wang, Aotao, et al.
Publicado: (2025)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
por: Liang, Yanbiao, et al.
Publicado: (2025)
por: Liang, Yanbiao, et al.
Publicado: (2025)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
por: Shao, Haikuo, et al.
Publicado: (2024)
por: Shao, Haikuo, et al.
Publicado: (2024)
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
por: Ji, Yuhao, et al.
Publicado: (2024)
por: Ji, Yuhao, et al.
Publicado: (2024)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
por: Fang, Chao, et al.
Publicado: (2024)
por: Fang, Chao, et al.
Publicado: (2024)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
por: Wang, Miaoxin, et al.
Publicado: (2024)
por: Wang, Miaoxin, et al.
Publicado: (2024)
Enable Lightweight and Precision-Scalable Posit/IEEE-754 Arithmetic in RISC-V Cores for Transprecision Computing
por: Li, Qiong, et al.
Publicado: (2025)
por: Li, Qiong, et al.
Publicado: (2025)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
por: Liu, Mingju, et al.
Publicado: (2026)
por: Liu, Mingju, et al.
Publicado: (2026)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
por: Lin, Yujun, et al.
Publicado: (2025)
por: Lin, Yujun, et al.
Publicado: (2025)
ElasticAI: Creating and Deploying Energy-Efficient Deep Learning Accelerator for Pervasive Computing
por: Qian, Chao, et al.
Publicado: (2024)
por: Qian, Chao, et al.
Publicado: (2024)
A Precision-Scalable RISC-V DNN Processor with On-Device Learning Capability at the Extreme Edge
por: Huang, Longwei, et al.
Publicado: (2023)
por: Huang, Longwei, et al.
Publicado: (2023)
Challenges and Research Directions for Large Language Model Inference Hardware
por: Ma, Xiaoyu, et al.
Publicado: (2026)
por: Ma, Xiaoyu, et al.
Publicado: (2026)
Autocomp: A Powerful and Portable Code Optimizer for Tensor Accelerators
por: Hong, Charles, et al.
Publicado: (2025)
por: Hong, Charles, et al.
Publicado: (2025)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
por: Gimenes, Pedro, et al.
Publicado: (2025)
por: Gimenes, Pedro, et al.
Publicado: (2025)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
por: Cong, Rongqing, et al.
Publicado: (2024)
por: Cong, Rongqing, et al.
Publicado: (2024)
ChipExpert: The Open-Source Integrated-Circuit-Design-Specific Large Language Model
por: Xu, Ning, et al.
Publicado: (2024)
por: Xu, Ning, et al.
Publicado: (2024)
Precision-Scalable Microscaling Datapaths with Optimized Reduction Tree for Efficient NPU Integration
por: Cuyckens, Stef, et al.
Publicado: (2025)
por: Cuyckens, Stef, et al.
Publicado: (2025)
M$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
por: Liang, Yanbiao, et al.
Publicado: (2024)
por: Liang, Yanbiao, et al.
Publicado: (2024)
FP6-LLM: Efficiently Serving Large Language Models Through FP6-Centric Algorithm-System Co-Design
por: Xia, Haojun, et al.
Publicado: (2024)
por: Xia, Haojun, et al.
Publicado: (2024)
LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator
por: Li, Guoyu, et al.
Publicado: (2025)
por: Li, Guoyu, et al.
Publicado: (2025)
Co-Designing Binarized Transformer and Hardware Accelerator for Efficient End-to-End Edge Deployment
por: Ji, Yuhao, et al.
Publicado: (2024)
por: Ji, Yuhao, et al.
Publicado: (2024)
eXmY: A Data Type and Technique for Arbitrary Bit Precision Quantization
por: Agrawal, Aditya, et al.
Publicado: (2024)
por: Agrawal, Aditya, et al.
Publicado: (2024)
tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI
por: Nair, Harideep, et al.
Publicado: (2024)
por: Nair, Harideep, et al.
Publicado: (2024)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
por: Kim, Jiyoon, et al.
Publicado: (2025)
por: Kim, Jiyoon, et al.
Publicado: (2025)
Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
por: Chen, Hongzheng, et al.
Publicado: (2023)
por: Chen, Hongzheng, et al.
Publicado: (2023)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
por: Jeong, Geonhwa, et al.
Publicado: (2024)
por: Jeong, Geonhwa, et al.
Publicado: (2024)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
por: Zhang, Hang, et al.
Publicado: (2025)
por: Zhang, Hang, et al.
Publicado: (2025)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
por: Zhao, Shirui, et al.
Publicado: (2025)
por: Zhao, Shirui, et al.
Publicado: (2025)
Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization
por: Lee, Jungi, et al.
Publicado: (2024)
por: Lee, Jungi, et al.
Publicado: (2024)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
por: Lu, Jinming, et al.
Publicado: (2025)
por: Lu, Jinming, et al.
Publicado: (2025)
HiFloat4 Format for Language Model Inference
por: Luo, Yuanyong, et al.
Publicado: (2026)
por: Luo, Yuanyong, et al.
Publicado: (2026)
vTrain: A Simulation Framework for Evaluating Cost-effective and Compute-optimal Large Language Model Training
por: Bang, Jehyeon, et al.
Publicado: (2023)
por: Bang, Jehyeon, et al.
Publicado: (2023)
MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization
por: Ramachandran, Akshat, et al.
Publicado: (2024)
por: Ramachandran, Akshat, et al.
Publicado: (2024)
COGNATE: Acceleration of Sparse Tensor Programs on Emerging Hardware using Transfer Learning
por: Sudusinghe, Chamika, et al.
Publicado: (2025)
por: Sudusinghe, Chamika, et al.
Publicado: (2025)
AutoHLS: Learning to Accelerate Design Space Exploration for HLS Designs
por: Ahmed, Md Rubel, et al.
Publicado: (2024)
por: Ahmed, Md Rubel, et al.
Publicado: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
por: Qiao, Ye, et al.
Publicado: (2026)
por: Qiao, Ye, et al.
Publicado: (2026)
TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators
por: Meng, Chang, et al.
Publicado: (2026)
por: Meng, Chang, et al.
Publicado: (2026)
On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks
por: Huang, Wei, et al.
Publicado: (2023)
por: Huang, Wei, et al.
Publicado: (2023)
Ejemplares similares
-
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
por: Ma, Shaobo, et al.
Publicado: (2025) -
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
por: Wang, Aotao, et al.
Publicado: (2025) -
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
por: Liang, Yanbiao, et al.
Publicado: (2025) -
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
por: Shao, Haikuo, et al.
Publicado: (2024) -
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
por: Ji, Yuhao, et al.
Publicado: (2024)