HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Negi, Shubham, Roy, Kaushik |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HCiM: ADC-Less Hybrid Analog-Digital Compute in Memory Accelerator for Deep Learning Workloads
par: Negi, Shubham, et autres
Publié: (2024)
par: Negi, Shubham, et autres
Publié: (2024)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025)
par: Fang, Yunhua, et autres
Publié: (2025)
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
par: Ma, Songchen, et autres
Publié: (2026)
par: Ma, Songchen, et autres
Publié: (2026)
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
par: Kiyawat, Khyati, et autres
Publié: (2025)
par: Kiyawat, Khyati, et autres
Publié: (2025)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
par: Heo, Guseul, et autres
Publié: (2024)
par: Heo, Guseul, et autres
Publié: (2024)
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
par: Juneja, Rohan, et autres
Publié: (2025)
par: Juneja, Rohan, et autres
Publié: (2025)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
par: Zou, Guoqiang, et autres
Publié: (2025)
par: Zou, Guoqiang, et autres
Publié: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
par: Kim, Dong Eun, et autres
Publié: (2025)
par: Kim, Dong Eun, et autres
Publié: (2025)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
par: He, Zifan, et autres
Publié: (2025)
par: He, Zifan, et autres
Publié: (2025)
Heterogeneous SoC Integrating an Open-Source Recurrent SNN Accelerator for Neuromorphic Edge Computing on FPGA
par: Barocci, Michelangelo, et autres
Publié: (2026)
par: Barocci, Michelangelo, et autres
Publié: (2026)
ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM
par: Wang, Wenqiang, et autres
Publié: (2025)
par: Wang, Wenqiang, et autres
Publié: (2025)
SpiDR: A Reconfigurable Digital Compute-in-Memory Spiking Neural Network Accelerator for Event-based Perception
par: Sharma, Deepika, et autres
Publié: (2024)
par: Sharma, Deepika, et autres
Publié: (2024)
LLM-DSE: Searching Accelerator Parameters with LLM Agents
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
par: Jiang, Aojie, et autres
Publié: (2026)
par: Jiang, Aojie, et autres
Publié: (2026)
A Survey on Design Methodologies for Accelerating Deep Learning on Heterogeneous Architectures
par: Curzel, Serena, et autres
Publié: (2023)
par: Curzel, Serena, et autres
Publié: (2023)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
par: Kim, Dowon, et autres
Publié: (2025)
par: Kim, Dowon, et autres
Publié: (2025)
LLM Inference Acceleration via Efficient Operation Fusion
par: Salmani, Mahsa, et autres
Publié: (2025)
par: Salmani, Mahsa, et autres
Publié: (2025)
Leveraging Compute-in-Memory for Efficient Generative Model Inference in TPUs
par: Zhu, Zhantong, et autres
Publié: (2025)
par: Zhu, Zhantong, et autres
Publié: (2025)
A Configurable and Efficient Memory Hierarchy for Neural Network Hardware Accelerator
par: Bause, Oliver, et autres
Publié: (2024)
par: Bause, Oliver, et autres
Publié: (2024)
HTM-EAR: Importance-Preserving Tiered Memory with Hybrid Routing under Saturation
par: Singh, Shubham Kumar
Publié: (2026)
par: Singh, Shubham Kumar
Publié: (2026)
Pushing the Limits of BFP on Narrow Precision LLM Inference
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
MICSim: A Modular Simulator for Mixed-signal Compute-in-Memory based AI Accelerator
par: Wang, Cong, et autres
Publié: (2024)
par: Wang, Cong, et autres
Publié: (2024)
BF-IMNA: A Bit Fluid In-Memory Neural Architecture for Neural Network Acceleration
par: Rakka, Mariam, et autres
Publié: (2024)
par: Rakka, Mariam, et autres
Publié: (2024)
Embedded FPGA Acceleration of Brain-Like Neural Networks: Online Learning to Scalable Inference
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2025)
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2025)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
par: Chen, Chun-Ting, et autres
Publié: (2025)
par: Chen, Chun-Ting, et autres
Publié: (2025)
Comparative Characterization of KV Cache Management Strategies for LLM Inference
par: Mamo, Oteo, et autres
Publié: (2026)
par: Mamo, Oteo, et autres
Publié: (2026)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
par: Liang, Yanbiao, et autres
Publié: (2025)
par: Liang, Yanbiao, et autres
Publié: (2025)
AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices
par: Zirui, Ma, et autres
Publié: (2026)
par: Zirui, Ma, et autres
Publié: (2026)
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
par: Errabii, Sohaib, et autres
Publié: (2026)
par: Errabii, Sohaib, et autres
Publié: (2026)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
par: Chong, Yue Jiet, et autres
Publié: (2026)
par: Chong, Yue Jiet, et autres
Publié: (2026)
Exploration of Unary Arithmetic-Based Matrix Multiply Units for Low Precision DL Accelerators
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
Rethinking LLM Inference Bottlenecks: Insights from Latent Attention and Mixture-of-Experts
par: Yun, Sungmin, et autres
Publié: (2025)
par: Yun, Sungmin, et autres
Publié: (2025)
Accelerating Post-Quantum Cryptography via LLM-Driven Hardware-Software Co-Design
par: Liao, Yuchao, et autres
Publié: (2026)
par: Liao, Yuchao, et autres
Publié: (2026)
Shavette: Low Power Neural Network Acceleration via Algorithm-level Error Detection and Undervolting
par: Rinkinen, Mikael, et autres
Publié: (2024)
par: Rinkinen, Mikael, et autres
Publié: (2024)
When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference
par: Li, Pu, et autres
Publié: (2026)
par: Li, Pu, et autres
Publié: (2026)
PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System
par: Kwon, Hyucksung, et autres
Publié: (2024)
par: Kwon, Hyucksung, et autres
Publié: (2024)
FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs
par: Zeng, Shulin, et autres
Publié: (2024)
par: Zeng, Shulin, et autres
Publié: (2024)
Carbon-Efficient 3D DNN Acceleration: Optimizing Performance and Sustainability
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
A3D: Agentic AI flow for autonomous Accelerator Design
par: Nallathambi, Abinand, et autres
Publié: (2026)
par: Nallathambi, Abinand, et autres
Publié: (2026)
Documents similaires
-
HCiM: ADC-Less Hybrid Analog-Digital Compute in Memory Accelerator for Deep Learning Workloads
par: Negi, Shubham, et autres
Publié: (2024) -
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
par: Fang, Yunhua, et autres
Publié: (2025) -
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
par: Ma, Songchen, et autres
Publié: (2026) -
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
par: Kiyawat, Khyati, et autres
Publié: (2025) -
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
par: Heo, Guseul, et autres
Publié: (2024)