FlashMoE: Fast Distributed MoE in a Single Kernel
Fuente:
arXiv
Salvato in:
| Autori principali: | Aimuyo, Osayamen Jonathan, Oh, Byungsoo, Singh, Rachee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving
di: Choi, Yuseon, et al.
Pubblicazione: (2026)
di: Choi, Yuseon, et al.
Pubblicazione: (2026)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
di: Pan, Yudong, et al.
Pubblicazione: (2026)
di: Pan, Yudong, et al.
Pubblicazione: (2026)
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
di: Zhu, Zeyu, et al.
Pubblicazione: (2024)
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
di: Kundu, Joyjit, et al.
Pubblicazione: (2024)
di: Kundu, Joyjit, et al.
Pubblicazione: (2024)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
di: Yang, Peiming, et al.
Pubblicazione: (2025)
di: Yang, Peiming, et al.
Pubblicazione: (2025)
Sequence-Aware Split Heuristic to Mitigate SM Underutilization in FlashAttention-3 Low-Head-Count Decoding
di: Font, Martí Llopart, et al.
Pubblicazione: (2026)
di: Font, Martí Llopart, et al.
Pubblicazione: (2026)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
di: Fan, Ruibo, et al.
Pubblicazione: (2026)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
di: Zhu, Yu, et al.
Pubblicazione: (2025)
di: Zhu, Yu, et al.
Pubblicazione: (2025)
Eliminating Hidden Serialization in Multi-Node Megakernel Communication
di: Oh, Byungsoo, et al.
Pubblicazione: (2026)
di: Oh, Byungsoo, et al.
Pubblicazione: (2026)
Efficient, VRAM-Constrained xLM Inference on Clients
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
di: Ukarande, Aditya, et al.
Pubblicazione: (2026)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
A Survey on Graph Neural Network Acceleration: Algorithms, Systems, and Customized Hardware
di: Zhang, Shichang, et al.
Pubblicazione: (2023)
di: Zhang, Shichang, et al.
Pubblicazione: (2023)
Llumnix: Dynamic Scheduling for Large Language Model Serving
di: Sun, Biao, et al.
Pubblicazione: (2024)
di: Sun, Biao, et al.
Pubblicazione: (2024)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
di: Ding, Jianru, et al.
Pubblicazione: (2026)
di: Ding, Jianru, et al.
Pubblicazione: (2026)
F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
di: Zhang, Hengrui, et al.
Pubblicazione: (2025)
Deep Reinforcement Learning based Online Scheduling Policy for Deep Neural Network Multi-Tenant Multi-Accelerator Systems
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
di: Blanco, Francesco G., et al.
Pubblicazione: (2024)
WWW: What, When, Where to Compute-in-Memory
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
di: Sharma, Tanvi, et al.
Pubblicazione: (2023)
MLPerf Power: Benchmarking the Energy Efficiency of Machine Learning Systems from Microwatts to Megawatts for Sustainable AI
di: Tschand, Arya, et al.
Pubblicazione: (2024)
di: Tschand, Arya, et al.
Pubblicazione: (2024)
LayerDAG: A Layerwise Autoregressive Diffusion Model for Directed Acyclic Graph Generation
di: Li, Mufei, et al.
Pubblicazione: (2024)
di: Li, Mufei, et al.
Pubblicazione: (2024)
AI and Memory Wall
di: Gholami, Amir, et al.
Pubblicazione: (2024)
di: Gholami, Amir, et al.
Pubblicazione: (2024)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
di: Russo, Enrico, et al.
Pubblicazione: (2026)
di: Russo, Enrico, et al.
Pubblicazione: (2026)
FedUHD: Unsupervised Federated Learning using Hyperdimensional Computing
di: Lee, You Hak, et al.
Pubblicazione: (2025)
di: Lee, You Hak, et al.
Pubblicazione: (2025)
Toward Cross-Layer Energy Optimizations in AI Systems
di: Chung, Jae-Won, et al.
Pubblicazione: (2024)
di: Chung, Jae-Won, et al.
Pubblicazione: (2024)
INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order Gradient Computations in Implicit Neural Representation Processing
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
di: Pal, Shagnik, et al.
Pubblicazione: (2025)
di: Pal, Shagnik, et al.
Pubblicazione: (2025)
A High Energy-Efficiency Multi-core Neuromorphic Architecture for Deep SNN Training
di: Li, Mingjing, et al.
Pubblicazione: (2024)
di: Li, Mingjing, et al.
Pubblicazione: (2024)
The Feasibility of Implementing Large-Scale Transformers on Multi-FPGA Platforms
di: Gao, Yu, et al.
Pubblicazione: (2024)
di: Gao, Yu, et al.
Pubblicazione: (2024)
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
di: Jobst, Matthias, et al.
Pubblicazione: (2025)
di: Jobst, Matthias, et al.
Pubblicazione: (2025)
Accelerating Transposed Convolutions on FPGA-based Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2025)
di: Haris, Jude, et al.
Pubblicazione: (2025)
JExplore: Design Space Exploration Tool for Nvidia Jetson Boards
di: Kutukcu, Basar, et al.
Pubblicazione: (2025)
di: Kutukcu, Basar, et al.
Pubblicazione: (2025)
Exploring Parallelism in FPGA-Based Accelerators for Machine Learning Applications
di: Centeno, Sed, et al.
Pubblicazione: (2025)
di: Centeno, Sed, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026) -
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026) -
ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving
di: Choi, Yuseon, et al.
Pubblicazione: (2026) -
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
di: Yu, Yanpeng, et al.
Pubblicazione: (2025) -
Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
di: Yu, Zhongkai, et al.
Pubblicazione: (2025)