TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pan, Yudong, He, Yintao, Han, Tianhua, Liu, Lian, Zhao, Shixin, Chen, Zhirong, Wang, Mengdi, Li, Cangyuan, Han, Yinhe, Wang, Ying |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
von: Liu, Lian, et al.
Veröffentlicht: (2025)
von: Liu, Lian, et al.
Veröffentlicht: (2025)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
von: Zhao, Shixin, et al.
Veröffentlicht: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
von: Liu, Lian, et al.
Veröffentlicht: (2026)
von: Liu, Lian, et al.
Veröffentlicht: (2026)
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
von: Liu, Yiqi, et al.
Veröffentlicht: (2026)
von: Liu, Yiqi, et al.
Veröffentlicht: (2026)
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
von: Cai, Siyang, et al.
Veröffentlicht: (2026)
von: Cai, Siyang, et al.
Veröffentlicht: (2026)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
von: Zhou, Zhuoshan, et al.
Veröffentlicht: (2026)
von: Zhou, Zhuoshan, et al.
Veröffentlicht: (2026)
CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution
von: Son, Muyoung, et al.
Veröffentlicht: (2026)
von: Son, Muyoung, et al.
Veröffentlicht: (2026)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
von: Ma, Haiyue, et al.
Veröffentlicht: (2025)
von: Ma, Haiyue, et al.
Veröffentlicht: (2025)
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
Natural language is not enough: Benchmarking multi-modal generative AI for Verilog generation
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
COMET: Towards Partical W4A4KV4 LLMs Serving
von: Liu, Lian, et al.
Veröffentlicht: (2024)
von: Liu, Lian, et al.
Veröffentlicht: (2024)
SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
von: Choi, Yuseon, et al.
Veröffentlicht: (2025)
ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning
von: Chen, Zhirong, et al.
Veröffentlicht: (2025)
von: Chen, Zhirong, et al.
Veröffentlicht: (2025)
Mozart: Modularized and Efficient MoE Training on 3.5D Wafer-Scale Chiplet Architectures
von: Luo, Shuqing, et al.
Veröffentlicht: (2026)
von: Luo, Shuqing, et al.
Veröffentlicht: (2026)
FlashMoE: Fast Distributed MoE in a Single Kernel
von: Aimuyo, Osayamen Jonathan, et al.
Veröffentlicht: (2025)
von: Aimuyo, Osayamen Jonathan, et al.
Veröffentlicht: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
von: Zhang, Qijun, et al.
Veröffentlicht: (2026)
von: Zhang, Qijun, et al.
Veröffentlicht: (2026)
Context-Aware Mixture-of-Experts Inference on CXL-Enabled GPU-NDP Systems
von: Fan, Zehao, et al.
Veröffentlicht: (2025)
von: Fan, Zehao, et al.
Veröffentlicht: (2025)
CLASS: A Controller-Centric Layout Synthesizer for Dynamic Quantum Circuits
von: Chen, Yu, et al.
Veröffentlicht: (2025)
von: Chen, Yu, et al.
Veröffentlicht: (2025)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
von: Wang, Xinyu, et al.
Veröffentlicht: (2024)
A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integration
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2025)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
Data is all you need: Finetuning LLMs for Chip Design via an Automated design-data augmentation framework
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
Confidential Computing on Heterogeneous CPU-GPU Systems: Survey and Future Directions
von: Wang, Qifan, et al.
Veröffentlicht: (2024)
von: Wang, Qifan, et al.
Veröffentlicht: (2024)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
von: Yu, Yanpeng, et al.
Veröffentlicht: (2025)
von: Yu, Yanpeng, et al.
Veröffentlicht: (2025)
GPU-Augmented OLAP Execution Engine: GPU Offloading
von: Chang, Ilsun
Veröffentlicht: (2025)
von: Chang, Ilsun
Veröffentlicht: (2025)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
von: Sun, Xiaotian, et al.
Veröffentlicht: (2024)
von: Sun, Xiaotian, et al.
Veröffentlicht: (2024)
Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference
von: Hwang, Ranggi, et al.
Veröffentlicht: (2023)
von: Hwang, Ranggi, et al.
Veröffentlicht: (2023)
Expert Streaming: Accelerating Low-Batch MoE Inference via Multi-chiplet Architecture and Dynamic Expert Trajectory Scheduling
von: Ma, Songchen, et al.
Veröffentlicht: (2026)
von: Ma, Songchen, et al.
Veröffentlicht: (2026)
PIMSYN: Synthesizing Processing-in-memory CNN Accelerators
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
von: Li, Wanqian, et al.
Veröffentlicht: (2024)
ChipGPT: How far are we from natural language hardware design
von: Chang, Kaiyan, et al.
Veröffentlicht: (2023)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2023)
GTA: a new General Tensor Accelerator with Better Area Efficiency and Data Reuse
von: Ai, Chenyang, et al.
Veröffentlicht: (2024)
von: Ai, Chenyang, et al.
Veröffentlicht: (2024)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
von: Wu, Qi, et al.
Veröffentlicht: (2026)
von: Wu, Qi, et al.
Veröffentlicht: (2026)
Stratum: System-Hardware Co-Design with Tiered Monolithic 3D-Stackable DRAM for Efficient MoE Serving
von: Pan, Yue, et al.
Veröffentlicht: (2025)
von: Pan, Yue, et al.
Veröffentlicht: (2025)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
von: Zou, Guoqiang, et al.
Veröffentlicht: (2025)
von: Zou, Guoqiang, et al.
Veröffentlicht: (2025)
A System Architecture for Low Latency Multiprogramming Quantum Computing
von: Zhao, Yilun, et al.
Veröffentlicht: (2026)
von: Zhao, Yilun, et al.
Veröffentlicht: (2026)
UbiMoE: A Ubiquitous Mixture-of-Experts Vision Transformer Accelerator With Hybrid Computation Pattern on FPGA
von: Dong, Jiale, et al.
Veröffentlicht: (2025)
von: Dong, Jiale, et al.
Veröffentlicht: (2025)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
von: Chung, Euijun, et al.
Veröffentlicht: (2026)
von: Chung, Euijun, et al.
Veröffentlicht: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
von: Liu, Mingju, et al.
Veröffentlicht: (2026)
von: Liu, Mingju, et al.
Veröffentlicht: (2026)
Anatomy of the gem5 Simulator: AtomicSimpleCPU, TimingSimpleCPU, O3CPU, and Their Interaction with the Ruby Memory System
von: Söderström, Johan, et al.
Veröffentlicht: (2025)
von: Söderström, Johan, et al.
Veröffentlicht: (2025)
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
von: Yu, Zhongkai, et al.
Veröffentlicht: (2025)
von: Yu, Zhongkai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
von: Liu, Lian, et al.
Veröffentlicht: (2025) -
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
von: Zhao, Shixin, et al.
Veröffentlicht: (2025) -
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
von: Liu, Lian, et al.
Veröffentlicht: (2026) -
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
von: Liu, Yiqi, et al.
Veröffentlicht: (2026) -
Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL
von: Cai, Siyang, et al.
Veröffentlicht: (2026)