A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Aojie, Zhu, Kang, Zhang, Zhiheng, Su, Zhengxu, Liu, Juntao, Du, Yuan, Du, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
di: Hao, Mingbo, et al.
Pubblicazione: (2026)
di: Hao, Mingbo, et al.
Pubblicazione: (2026)
HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
di: Yu, Zhongkai, et al.
Pubblicazione: (2024)
di: Yu, Zhongkai, et al.
Pubblicazione: (2024)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
di: Xie, Rui, et al.
Pubblicazione: (2025)
di: Xie, Rui, et al.
Pubblicazione: (2025)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
di: Wang, Zhao, et al.
Pubblicazione: (2025)
di: Wang, Zhao, et al.
Pubblicazione: (2025)
Mapping Space Exploration for Multi-Chiplet Accelerators Targeting LLM Inference Serving Workloads
di: Li, Boyu, et al.
Pubblicazione: (2025)
di: Li, Boyu, et al.
Pubblicazione: (2025)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
di: Lin, Xipeng, et al.
Pubblicazione: (2024)
di: Lin, Xipeng, et al.
Pubblicazione: (2024)
CIMPool: Scalable Neural Network Acceleration for Compute-In-Memory using Weight Pools
di: Li, Shurui, et al.
Pubblicazione: (2025)
di: Li, Shurui, et al.
Pubblicazione: (2025)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
di: Yi, Zhiqiang, et al.
Pubblicazione: (2025)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
di: Li, Tenglong, et al.
Pubblicazione: (2024)
di: Li, Tenglong, et al.
Pubblicazione: (2024)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)
di: Li, Huize, et al.
Pubblicazione: (2026)
Hybrid SLC-MLC RRAM Mixed-Signal Processing-in-Memory Architecture for Transformer Acceleration via Gradient Redistribution
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
BF-IMNA: A Bit Fluid In-Memory Neural Architecture for Neural Network Acceleration
di: Rakka, Mariam, et al.
Pubblicazione: (2024)
di: Rakka, Mariam, et al.
Pubblicazione: (2024)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
di: Lin, Ye, et al.
Pubblicazione: (2026)
di: Lin, Ye, et al.
Pubblicazione: (2026)
Bancroft: Genomics Acceleration Beyond On-Device Memory
di: Lim, Se-Min, et al.
Pubblicazione: (2025)
di: Lim, Se-Min, et al.
Pubblicazione: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
High Utilization Energy-Aware Real-Time Inference Deep Convolutional Neural Network Accelerator
di: Lin, Kuan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Kuan-Ting, et al.
Pubblicazione: (2025)
Efficient Sparse Processing-in-Memory Architecture (ESPIM) for Machine Learning Inference
di: He, Mingxuan, et al.
Pubblicazione: (2024)
di: He, Mingxuan, et al.
Pubblicazione: (2024)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
Reconfigurable Stream Network Architecture
di: Wang, Chengyue, et al.
Pubblicazione: (2024)
di: Wang, Chengyue, et al.
Pubblicazione: (2024)
SOFA: A Compute-Memory Optimized Sparsity Accelerator via Cross-Stage Coordinated Tiling
di: Wang, Huizheng, et al.
Pubblicazione: (2024)
di: Wang, Huizheng, et al.
Pubblicazione: (2024)
Memory-efficient Sketch Acceleration for Handling Large Network Flows on FPGAs
di: Han, Zhaoyang, et al.
Pubblicazione: (2025)
di: Han, Zhaoyang, et al.
Pubblicazione: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
DRACO: Co-design for DSP-Efficient Rigid Body Dynamics Accelerator
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
di: Wang, Peipei, et al.
Pubblicazione: (2025)
di: Wang, Peipei, et al.
Pubblicazione: (2025)
ISAAC: Intelligent, Scalable, Agile, and Accelerated CPU Verification via LLM-aided FPGA Parallelism
di: Sun, Jialin, et al.
Pubblicazione: (2025)
di: Sun, Jialin, et al.
Pubblicazione: (2025)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
Adaptive Hybrid FFT: A Novel Pipeline and Memory-Based Architecture for Radix-$2^k$ FFT in Large Size Processing
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
di: Xuan, Zihao, et al.
Pubblicazione: (2026) -
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025) -
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025) -
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
di: Hao, Mingbo, et al.
Pubblicazione: (2026) -
HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
di: Negi, Shubham, et al.
Pubblicazione: (2025)