Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Hanyuan, Yang, Xiaoxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
par: Chen, Peilin, et autres
Publié: (2025)
par: Chen, Peilin, et autres
Publié: (2025)
Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips
par: Chen, Peilin, et autres
Publié: (2025)
par: Chen, Peilin, et autres
Publié: (2025)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024)
par: Skliar, Andrii, et autres
Publié: (2024)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
par: Wolters, Christopher, et autres
Publié: (2024)
par: Wolters, Christopher, et autres
Publié: (2024)
In-Memory ADC-Based Nonlinear Activation Quantization for Efficient In-Memory Computing
par: Dong, Shuai, et autres
Publié: (2026)
par: Dong, Shuai, et autres
Publié: (2026)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
par: Hong, Jeongmin, et autres
Publié: (2024)
par: Hong, Jeongmin, et autres
Publié: (2024)
Exploring DRAM Cache Prefetching for Pooled Memory
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
par: Tirumalasetty, Chandrahas, et autres
Publié: (2024)
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
par: Choi, Yuseon, et autres
Publié: (2025)
par: Choi, Yuseon, et autres
Publié: (2025)
Improving the Representativeness of Simulation Intervals for the Cache Memory System
par: Bueno, Nicolas, et autres
Publié: (2024)
par: Bueno, Nicolas, et autres
Publié: (2024)
In-Memory Computing Architecture for Efficient Hardware Security
par: Ajmi, Hala, et autres
Publié: (2024)
par: Ajmi, Hala, et autres
Publié: (2024)
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
par: Andrulis, Tanner, et autres
Publié: (2024)
par: Andrulis, Tanner, et autres
Publié: (2024)
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
par: Dong, Jiale, et autres
Publié: (2025)
par: Dong, Jiale, et autres
Publié: (2025)
CMD: A Cache-assisted GPU Memory Deduplication Architecture
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
par: He, Xiaolin, et autres
Publié: (2025)
par: He, Xiaolin, et autres
Publié: (2025)
Functionality Locality, Mixture & Control = Logic = Memory
par: Peng, Xiangjun
Publié: (2024)
par: Peng, Xiangjun
Publié: (2024)
TDRAM: Tag-enhanced DRAM for Efficient Caching
par: Babaie, Maryam, et autres
Publié: (2024)
par: Babaie, Maryam, et autres
Publié: (2024)
In-place Switch: Reprogramming based SLC Cache Design for Hybrid 3D SSDs
par: Yang, Xufeng, et autres
Publié: (2024)
par: Yang, Xufeng, et autres
Publié: (2024)
Multi-Dimensional Vector ISA Extension for Mobile In-Cache Computing
par: Khadem, Alireza, et autres
Publié: (2025)
par: Khadem, Alireza, et autres
Publié: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
SOFA: A Compute-Memory Optimized Sparsity Accelerator via Cross-Stage Coordinated Tiling
par: Wang, Huizheng, et autres
Publié: (2024)
par: Wang, Huizheng, et autres
Publié: (2024)
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
par: Xu, Weikai, et autres
Publié: (2026)
par: Xu, Weikai, et autres
Publié: (2026)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
par: You, Dean, et autres
Publié: (2025)
par: You, Dean, et autres
Publié: (2025)
SSD Offloading for LLM Mixture-of-Experts Weights Considered Harmful in Energy Efficiency
par: Kyung, Kwanhee, et autres
Publié: (2025)
par: Kyung, Kwanhee, et autres
Publié: (2025)
Rhea: a Framework for Fast Design and Validation of RTL Cache-Coherent Memory Subsystems
par: Zoni, Davide, et autres
Publié: (2025)
par: Zoni, Davide, et autres
Publié: (2025)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
HPR-Mul: An Area and Energy-Efficient High-Precision Redundancy Multiplier by Approximate Computing
par: Vafaei, Jafar, et autres
Publié: (2024)
par: Vafaei, Jafar, et autres
Publié: (2024)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
par: Huang, Wei-Hsing, et autres
Publié: (2025)
par: Huang, Wei-Hsing, et autres
Publié: (2025)
PC2IM: An Efficient In-Memory Computing Accelerator for 3D Point Cloud
par: Wang, Dengfeng, et autres
Publié: (2026)
par: Wang, Dengfeng, et autres
Publié: (2026)
Enabling Efficient Hybrid Systolic Computation in Shared L1-Memory Manycore Clusters
par: Mazzola, Sergio, et autres
Publié: (2024)
par: Mazzola, Sergio, et autres
Publié: (2024)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
An Analytical and Empirical Investigation of Tag Partitioning for Energy-Efficient Reliable Cache
par: Cheshmikhani, Elham, et autres
Publié: (2025)
par: Cheshmikhani, Elham, et autres
Publié: (2025)
An O(m+n)-Space Spatiotemporal Denoising Filter with Cache-Like Memories for Dynamic Vision Sensors
par: Zhao, Qinghang, et autres
Publié: (2024)
par: Zhao, Qinghang, et autres
Publié: (2024)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
CINM (Cinnamon): A Compilation Infrastructure for Heterogeneous Compute In-Memory and Compute Near-Memory Paradigms
par: Khan, Asif Ali, et autres
Publié: (2022)
par: Khan, Asif Ali, et autres
Publié: (2022)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
3D-TrIM: A Memory-Efficient Spatial Computing Architecture for Convolution Workloads
par: Sestito, Cristian, et autres
Publié: (2025)
par: Sestito, Cristian, et autres
Publié: (2025)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
par: Lin, Xipeng, et autres
Publié: (2024)
par: Lin, Xipeng, et autres
Publié: (2024)
Documents similaires
-
Titanus: Enabling KV Cache Pruning and Quantization On-the-Fly for LLM Acceleration
par: Chen, Peilin, et autres
Publié: (2025) -
Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips
par: Chen, Peilin, et autres
Publié: (2025) -
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
par: Skliar, Andrii, et autres
Publié: (2024) -
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
par: Wolters, Christopher, et autres
Publié: (2024) -
In-Memory ADC-Based Nonlinear Activation Quantization for Efficient In-Memory Computing
par: Dong, Shuai, et autres
Publié: (2026)