Highly Optimized Kernels and Fine-Grained Codebooks for LLM Inference on Arm CPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gope, Dibakar, Mansell, David, Loh, Danny, Bratt, Ian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025)
Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
par: Chen, Hongzheng, et autres
Publié: (2023)
par: Chen, Hongzheng, et autres
Publié: (2023)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025)
par: Liang, Yanbiao, et autres
Publié: (2025)
PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection
par: Park, Hyoseok, et autres
Publié: (2026)
par: Park, Hyoseok, et autres
Publié: (2026)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
LLM-Enhanced Bayesian Optimization for Efficient Analog Layout Constraint Generation
par: Chen, Guojin, et autres
Publié: (2024)
par: Chen, Guojin, et autres
Publié: (2024)
The Graph's Apprentice: Teaching an LLM Low Level Knowledge for Circuit Quality Estimation
par: Moravej, Reza, et autres
Publié: (2024)
par: Moravej, Reza, et autres
Publié: (2024)
hdl2v: A Code Translation Dataset for Enhanced LLM Verilog Generation
par: Hong, Charles, et autres
Publié: (2025)
par: Hong, Charles, et autres
Publié: (2025)
VeriMind: Agentic LLM for Automated Verilog Generation with a Novel Evaluation Metric
par: Nadimi, Bardia, et autres
Publié: (2025)
par: Nadimi, Bardia, et autres
Publié: (2025)
Autocomp: A Powerful and Portable Code Optimizer for Tensor Accelerators
par: Hong, Charles, et autres
Publié: (2025)
par: Hong, Charles, et autres
Publié: (2025)
Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format
par: Fang, Chao, et autres
Publié: (2024)
par: Fang, Chao, et autres
Publié: (2024)
SymRTLO: Enhancing RTL Code Optimization with LLMs and Neuron-Inspired Symbolic Reasoning
par: Wang, Yiting, et autres
Publié: (2025)
par: Wang, Yiting, et autres
Publié: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
par: Yadav, Divakar Kumar, et autres
Publié: (2026)
Challenges and Research Directions for Large Language Model Inference Hardware
par: Ma, Xiaoyu, et autres
Publié: (2026)
par: Ma, Xiaoyu, et autres
Publié: (2026)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
HLSTransform: Energy-Efficient Llama 2 Inference on FPGAs Via High Level Synthesis
par: He, Andy, et autres
Publié: (2024)
par: He, Andy, et autres
Publié: (2024)
PolyLUT-Add: FPGA-based LUT Inference with Wide Inputs
par: Lou, Binglei, et autres
Publié: (2024)
par: Lou, Binglei, et autres
Publié: (2024)
Continuous-Flow Data-Rate-Aware CNN Inference on FPGA
par: Habermann, Tobias, et autres
Publié: (2026)
par: Habermann, Tobias, et autres
Publié: (2026)
Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling
par: Patwari, Rajeev, et autres
Publié: (2025)
par: Patwari, Rajeev, et autres
Publié: (2025)
Make Every Move Count: LLM-based High-Quality RTL Code Generation Using MCTS
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
CoopetitiveV: Leveraging LLM-powered Coopetitive Multi-Agent Prompting for High-quality Verilog Generation
par: Mi, Zhendong, et autres
Publié: (2024)
par: Mi, Zhendong, et autres
Publié: (2024)
Benchmarking Deep Learning Convolutions on Energy-constrained CPUs
par: Galvez, Enrique, et autres
Publié: (2025)
par: Galvez, Enrique, et autres
Publié: (2025)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
HiFloat4 Format for Language Model Inference
par: Luo, Yuanyong, et autres
Publié: (2026)
par: Luo, Yuanyong, et autres
Publié: (2026)
Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?
par: Bhandwaldar, Abhishek, et autres
Publié: (2026)
par: Bhandwaldar, Abhishek, et autres
Publié: (2026)
FlexLLM: Composable HLS Library for Flexible Hybrid LLM Accelerator Design
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
par: Ma, Shaobo, et autres
Publié: (2025)
par: Ma, Shaobo, et autres
Publié: (2025)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024)
par: Skliar, Andrii, et autres
Publié: (2024)
Runtime Tunable Tsetlin Machines for Edge Inference on eFPGAs
par: Rahman, Tousif, et autres
Publié: (2025)
par: Rahman, Tousif, et autres
Publié: (2025)
Towards Cheaper Inference in Deep Networks with Lower Bit-Width Accumulators
par: Blumenfeld, Yaniv, et autres
Publié: (2024)
par: Blumenfeld, Yaniv, et autres
Publié: (2024)
Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2026)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
par: Gimenes, Pedro, et autres
Publié: (2025)
par: Gimenes, Pedro, et autres
Publié: (2025)
LLM Inference Acceleration via Efficient Operation Fusion
par: Salmani, Mahsa, et autres
Publié: (2025)
par: Salmani, Mahsa, et autres
Publié: (2025)
Mitigating hallucinations and omissions in LLMs for invertible problems: An application to hardware logic design automation
par: Cassidy, Andrew S., et autres
Publié: (2025)
par: Cassidy, Andrew S., et autres
Publié: (2025)
Enabling New HDLs with Agents
par: Zakharov, Mark, et autres
Publié: (2024)
par: Zakharov, Mark, et autres
Publié: (2024)
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
par: Wang, Hanrui, et autres
Publié: (2020)
par: Wang, Hanrui, et autres
Publié: (2020)
Lorecast: Layout-Aware Performance and Power Forecasting from Natural Language
par: Wang, Runzhi, et autres
Publié: (2025)
par: Wang, Runzhi, et autres
Publié: (2025)
VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generation
par: Wang, Yiting, et autres
Publié: (2025)
par: Wang, Yiting, et autres
Publié: (2025)
Chameleon: a Heterogeneous and Disaggregated Accelerator System for Retrieval-Augmented Language Models
par: Jiang, Wenqi, et autres
Publié: (2023)
par: Jiang, Wenqi, et autres
Publié: (2023)
QiMeng-CodeV-SVA: Training Specialized LLMs for Hardware Assertion Generation via RTL-Grounded Bidirectional Data Synthesis
par: Wu, Yutong, et autres
Publié: (2026)
par: Wu, Yutong, et autres
Publié: (2026)
Documents similaires
-
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
par: AbouElhamayed, Ahmed F., et autres
Publié: (2025) -
Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
par: Chen, Hongzheng, et autres
Publié: (2023) -
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025) -
PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection
par: Park, Hyoseok, et autres
Publié: (2026) -
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)