APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Shaobo, Fang, Chao, Shao, Haikuo, Wang, Zhongfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024)
par: Ma, Shaobo, et autres
Publié: (2024)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025)
par: Liang, Yanbiao, et autres
Publié: (2025)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
par: Wang, Aotao, et autres
Publié: (2025)
par: Wang, Aotao, et autres
Publié: (2025)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
par: Shao, Haikuo, et autres
Publié: (2024)
par: Shao, Haikuo, et autres
Publié: (2024)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
par: Fang, Chao, et autres
Publié: (2024)
par: Fang, Chao, et autres
Publié: (2024)
Enable Lightweight and Precision-Scalable Posit/IEEE-754 Arithmetic in RISC-V Cores for Transprecision Computing
par: Li, Qiong, et autres
Publié: (2025)
par: Li, Qiong, et autres
Publié: (2025)
BETA: Binarized Energy-Efficient Transformer Accelerator at the Edge
par: Ji, Yuhao, et autres
Publié: (2024)
par: Ji, Yuhao, et autres
Publié: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
FlexLLM: Composable HLS Library for Flexible Hybrid LLM Accelerator Design
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
par: Wang, Miaoxin, et autres
Publié: (2024)
par: Wang, Miaoxin, et autres
Publié: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
par: Qiao, Ye, et autres
Publié: (2026)
par: Qiao, Ye, et autres
Publié: (2026)
LEGO: Spatial Accelerator Generation and Optimization for Tensor Applications
par: Lin, Yujun, et autres
Publié: (2025)
par: Lin, Yujun, et autres
Publié: (2025)
ElasticAI: Creating and Deploying Energy-Efficient Deep Learning Accelerator for Pervasive Computing
par: Qian, Chao, et autres
Publié: (2024)
par: Qian, Chao, et autres
Publié: (2024)
VUSA: Virtually Upscaled Systolic Array Architecture to Exploit Unstructured Sparsity in AI Acceleration
par: Helal, Shereef, et autres
Publié: (2025)
par: Helal, Shereef, et autres
Publié: (2025)
A Precision-Scalable RISC-V DNN Processor with On-Device Learning Capability at the Extreme Edge
par: Huang, Longwei, et autres
Publié: (2023)
par: Huang, Longwei, et autres
Publié: (2023)
Autocomp: A Powerful and Portable Code Optimizer for Tensor Accelerators
par: Hong, Charles, et autres
Publié: (2025)
par: Hong, Charles, et autres
Publié: (2025)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
par: Gimenes, Pedro, et autres
Publié: (2025)
par: Gimenes, Pedro, et autres
Publié: (2025)
LLM-Aided Compilation for Tensor Accelerators
par: Hong, Charles, et autres
Publié: (2024)
par: Hong, Charles, et autres
Publié: (2024)
The Role of Advanced Computer Architectures in Accelerating Artificial Intelligence Workloads
par: Amin, Shahid, et autres
Publié: (2025)
par: Amin, Shahid, et autres
Publié: (2025)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
par: Wu, Junyi, et autres
Publié: (2025)
par: Wu, Junyi, et autres
Publié: (2025)
M$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
par: Liang, Yanbiao, et autres
Publié: (2024)
par: Liang, Yanbiao, et autres
Publié: (2024)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
par: Kim, Jiyoon, et autres
Publié: (2025)
par: Kim, Jiyoon, et autres
Publié: (2025)
NeFT: Negative Feedback Training to Improve Robustness of Compute-In-Memory DNN Accelerators
par: Qin, Yifan, et autres
Publié: (2023)
par: Qin, Yifan, et autres
Publié: (2023)
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
par: Cai, Siyang, et autres
Publié: (2026)
par: Cai, Siyang, et autres
Publié: (2026)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
eXmY: A Data Type and Technique for Arbitrary Bit Precision Quantization
par: Agrawal, Aditya, et autres
Publié: (2024)
par: Agrawal, Aditya, et autres
Publié: (2024)
EXION: Exploiting Inter- and Intra-Iteration Output Sparsity for Diffusion Models
par: Heo, Jaehoon, et autres
Publié: (2025)
par: Heo, Jaehoon, et autres
Publié: (2025)
LLM-Enhanced Bayesian Optimization for Efficient Analog Layout Constraint Generation
par: Chen, Guojin, et autres
Publié: (2024)
par: Chen, Guojin, et autres
Publié: (2024)
QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture
par: Prakash, Shvetank, et autres
Publié: (2025)
par: Prakash, Shvetank, et autres
Publié: (2025)
LLM-DSE: Searching Accelerator Parameters with LLM Agents
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
HiVeGen -- Hierarchical LLM-based Verilog Generation for Scalable Chip Design
par: Tang, Jinwei, et autres
Publié: (2024)
par: Tang, Jinwei, et autres
Publié: (2024)
MG-Verilog: Multi-grained Dataset Towards Enhanced LLM-assisted Verilog Generation
par: Zhang, Yongan, et autres
Publié: (2024)
par: Zhang, Yongan, et autres
Publié: (2024)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
par: Jeong, Geonhwa, et autres
Publié: (2024)
par: Jeong, Geonhwa, et autres
Publié: (2024)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
Tensor-Compressed and Fully-Quantized Training of Neural PDE Solvers
par: Lu, Jinming, et autres
Publié: (2025)
par: Lu, Jinming, et autres
Publié: (2025)
NeuroSim V1.5: Improved Software Backbone for Benchmarking Compute-in-Memory Accelerators with Device and Circuit-level Non-idealities
par: Read, James, et autres
Publié: (2025)
par: Read, James, et autres
Publié: (2025)
VerilogDB: The Largest, Highest-Quality Dataset with a Preprocessing Framework for LLM-based RTL Generation
par: Calzada, Paul E., et autres
Publié: (2025)
par: Calzada, Paul E., et autres
Publié: (2025)
Make Every Move Count: LLM-based High-Quality RTL Code Generation Using MCTS
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
par: Ahmadzadeh, Mohsen, et autres
Publié: (2025)
Documents similaires
-
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
par: Ma, Shaobo, et autres
Publié: (2024) -
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025) -
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
par: Wang, Aotao, et autres
Publié: (2025) -
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
par: Shao, Haikuo, et autres
Publié: (2024) -
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
par: Fang, Chao, et autres
Publié: (2024)