FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xuan, Zihao, Chen, Jia, Li, Yewen, Xuan, Wei, Chen, Hegan, Huo, Xiao, Tu, Fengbin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
von: Xue, Chenhao, et al.
Veröffentlicht: (2026)
von: Xue, Chenhao, et al.
Veröffentlicht: (2026)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
CompAir: Synergizing Complementary PIMs and In-Transit NoC Computation for Efficient LLM Acceleration
von: Li, Hongyi, et al.
Veröffentlicht: (2025)
von: Li, Hongyi, et al.
Veröffentlicht: (2025)
YOCO: A Hybrid In-Memory Computing Architecture with 8-bit Sub-PetaOps/W In-Situ Multiply Arithmetic for Large-Scale AI
von: Xuan, Zihao, et al.
Veröffentlicht: (2023)
von: Xuan, Zihao, et al.
Veröffentlicht: (2023)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
von: Lin, Xipeng, et al.
Veröffentlicht: (2024)
von: Lin, Xipeng, et al.
Veröffentlicht: (2024)
Theoretical Analysis of the Efficient-Memory Matrix Storage Method for Quantum Emulation Accelerators with Gate Fusion on FPGAs
von: Le, Tran Xuan Hieu, et al.
Veröffentlicht: (2024)
von: Le, Tran Xuan Hieu, et al.
Veröffentlicht: (2024)
Unicorn-CIM: Uncovering the Vulnerability and Improving the Resilience of High-Precision Compute-in-Memory
von: Li, Qiufeng, et al.
Veröffentlicht: (2025)
von: Li, Qiufeng, et al.
Veröffentlicht: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
GEM3D CIM General Purpose Matrix Computation Using 3D Integrated SRAM eDRAM Hybrid Compute In Memory on Memory Architecture
von: Chakraborty, Subhradip, et al.
Veröffentlicht: (2026)
von: Chakraborty, Subhradip, et al.
Veröffentlicht: (2026)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2025)
von: Xu, Weikai, et al.
Veröffentlicht: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
von: Wang, Huizheng, et al.
Veröffentlicht: (2025)
von: Wang, Huizheng, et al.
Veröffentlicht: (2025)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
FADiff: Fusion-Aware Differentiable Optimization for DNN Scheduling on Tensor Accelerators
von: Jia, Shuao, et al.
Veröffentlicht: (2025)
von: Jia, Shuao, et al.
Veröffentlicht: (2025)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
von: He, Xiaolin, et al.
Veröffentlicht: (2025)
von: He, Xiaolin, et al.
Veröffentlicht: (2025)
3DGauCIM: Accelerating Static/Dynamic 3D Gaussian Splatting via Digital CIM for High Frame Rate Real-Time Edge Rendering
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
SeDA: Secure and Efficient DNN Accelerators with Hardware/Software Synergy
von: Xuan, Wei, et al.
Veröffentlicht: (2025)
von: Xuan, Wei, et al.
Veröffentlicht: (2025)
LLM Inference Acceleration via Efficient Operation Fusion
von: Salmani, Mahsa, et al.
Veröffentlicht: (2025)
von: Salmani, Mahsa, et al.
Veröffentlicht: (2025)
CLSA-CIM: A Cross-Layer Scheduling Approach for Computing-in-Memory Architectures
von: Pelke, Rebecca, et al.
Veröffentlicht: (2024)
von: Pelke, Rebecca, et al.
Veröffentlicht: (2024)
Accelerating Sensor Fusion in Neuromorphic Computing: A Case Study on Loihi-2
von: Isik, Murat, et al.
Veröffentlicht: (2024)
von: Isik, Murat, et al.
Veröffentlicht: (2024)
Fast-OverlaPIM: A Fast Overlap-driven Mapping Framework for Processing In-Memory Neural Network Acceleration
von: Wang, Xuan, et al.
Veröffentlicht: (2024)
von: Wang, Xuan, et al.
Veröffentlicht: (2024)
CIM-MLC: A Multi-level Compilation Stack for Computing-In-Memory Accelerators
von: Qu, Songyun, et al.
Veröffentlicht: (2024)
von: Qu, Songyun, et al.
Veröffentlicht: (2024)
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
von: Shao, Kunming, et al.
Veröffentlicht: (2024)
von: Shao, Kunming, et al.
Veröffentlicht: (2024)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
von: Wolters, Christopher, et al.
Veröffentlicht: (2024)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
von: Kim, Dong Eun, et al.
Veröffentlicht: (2025)
von: Kim, Dong Eun, et al.
Veröffentlicht: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
von: Li, Huize, et al.
Veröffentlicht: (2026)
von: Li, Huize, et al.
Veröffentlicht: (2026)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2026)
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2026)
Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
von: Wu, Haoran, et al.
Veröffentlicht: (2025)
von: Wu, Haoran, et al.
Veröffentlicht: (2025)
LIMCA: LLM for Automating Analog In-Memory Computing Architecture Design Exploration
von: Vungarala, Deepak, et al.
Veröffentlicht: (2025)
von: Vungarala, Deepak, et al.
Veröffentlicht: (2025)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
von: Zheng, Jianing, et al.
Veröffentlicht: (2025)
von: Zheng, Jianing, et al.
Veröffentlicht: (2025)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
von: Qi, Yingjie, et al.
Veröffentlicht: (2025)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2025)
von: Chong, Yue Jiet, et al.
Veröffentlicht: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
von: Chen, Yanru, et al.
Veröffentlicht: (2025)
EdgeCIM: A Hardware-Software Co-Design for CIM-Based Acceleration of Small Language Models
von: Bazzi, Jinane, et al.
Veröffentlicht: (2026)
von: Bazzi, Jinane, et al.
Veröffentlicht: (2026)
In-Pipeline Integration of Digital In-Memory-Computing into RISC-V Vector Architecture to Accelerate Deep Learning
von: Spagnolo, Tommaso, et al.
Veröffentlicht: (2026)
von: Spagnolo, Tommaso, et al.
Veröffentlicht: (2026)
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
von: Liu, Yiqi, et al.
Veröffentlicht: (2026)
von: Liu, Yiqi, et al.
Veröffentlicht: (2026)
Acore-CIM: build accurate and reliable mixed-signal CIM cores with RISC-V controlled self-calibration
von: Numan, Omar, et al.
Veröffentlicht: (2025)
von: Numan, Omar, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
von: Guo, Yan-Cheng, et al.
Veröffentlicht: (2026) -
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
von: Xue, Chenhao, et al.
Veröffentlicht: (2026) -
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025) -
CompAir: Synergizing Complementary PIMs and In-Transit NoC Computation for Efficient LLM Acceleration
von: Li, Hongyi, et al.
Veröffentlicht: (2025) -
YOCO: A Hybrid In-Memory Computing Architecture with 8-bit Sub-PetaOps/W In-Situ Multiply Arithmetic for Large-Scale AI
von: Xuan, Zihao, et al.
Veröffentlicht: (2023)