HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Haochen, Zhong, Shuzhang, Zhang, Zhe, Li, Shuangchen, Niu, Dimin, Zheng, Hongzhong, Wang, Runsheng, Li, Meng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
von: Fu, Zizhuo, et al.
Veröffentlicht: (2025)
von: Fu, Zizhuo, et al.
Veröffentlicht: (2025)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
von: Chitty-Venkata, Krishna Teja, et al.
Veröffentlicht: (2025)
von: Chitty-Venkata, Krishna Teja, et al.
Veröffentlicht: (2025)
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
von: Xue, Leyang, et al.
Veröffentlicht: (2024)
von: Xue, Leyang, et al.
Veröffentlicht: (2024)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
von: Shen, Zixu, et al.
Veröffentlicht: (2025)
von: Shen, Zixu, et al.
Veröffentlicht: (2025)
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2024)
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2024)
HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2025)
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2025)
MoEITS: A Green AI approach for simplifying MoE-LLMs
von: Balderas, Luis, et al.
Veröffentlicht: (2026)
von: Balderas, Luis, et al.
Veröffentlicht: (2026)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
von: Chu, Kexin, et al.
Veröffentlicht: (2025)
von: Chu, Kexin, et al.
Veröffentlicht: (2025)
How Much Parallelism Is "Free"? A Principle of Near-Free Parallelism for Parallel Decoding
von: He, Minghua, et al.
Veröffentlicht: (2026)
von: He, Minghua, et al.
Veröffentlicht: (2026)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
von: Yao, Feiyu, et al.
Veröffentlicht: (2026)
von: Yao, Feiyu, et al.
Veröffentlicht: (2026)
EDAN: Towards Understanding Memory Parallelism and Latency Sensitivity in HPC
von: Shen, Siyuan, et al.
Veröffentlicht: (2025)
von: Shen, Siyuan, et al.
Veröffentlicht: (2025)
LaMoSys3.5D: Enabling 3.5D-IC-Based Large Language Model Inference Serving Systems via Hardware/Software Co-Design
von: Wang, Qipan, et al.
Veröffentlicht: (2025)
von: Wang, Qipan, et al.
Veröffentlicht: (2025)
DistZO2: High-Throughput and Memory-Efficient Zeroth-Order Fine-tuning LLMs with Distributed Parallel Computing
von: Wang, Liangyu, et al.
Veröffentlicht: (2025)
von: Wang, Liangyu, et al.
Veröffentlicht: (2025)
Towards Building Private LLMs: Exploring Multi-Node Expert Parallelism on Apple Silicon for Mixture-of-Experts Large Language Model
von: Chen, Mu-Chi, et al.
Veröffentlicht: (2025)
von: Chen, Mu-Chi, et al.
Veröffentlicht: (2025)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2024)
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2024)
Tuning Fast Memory Size based on Modeling of Page Migration for Tiered Memory
von: Chen, Shangye, et al.
Veröffentlicht: (2024)
von: Chen, Shangye, et al.
Veröffentlicht: (2024)
Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA
von: Mitra, Subhadip
Veröffentlicht: (2026)
von: Mitra, Subhadip
Veröffentlicht: (2026)
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory
von: Ren, Jie, et al.
Veröffentlicht: (2025)
von: Ren, Jie, et al.
Veröffentlicht: (2025)
Mixture of Experts with Mixture of Precisions for Tuning Quality of Service
von: Imani, HamidReza, et al.
Veröffentlicht: (2024)
von: Imani, HamidReza, et al.
Veröffentlicht: (2024)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
von: Chen, Xiaodong, et al.
Veröffentlicht: (2025)
von: Chen, Xiaodong, et al.
Veröffentlicht: (2025)
Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing
von: Wang, Yuxin, et al.
Veröffentlicht: (2023)
von: Wang, Yuxin, et al.
Veröffentlicht: (2023)
Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
von: Lacey, Dane C., et al.
Veröffentlicht: (2024)
von: Lacey, Dane C., et al.
Veröffentlicht: (2024)
A$^3$PIM: An Automated, Analytic and Accurate Processing-in-Memory Offloader
von: Jiang, Qingcai, et al.
Veröffentlicht: (2024)
von: Jiang, Qingcai, et al.
Veröffentlicht: (2024)
CoServe: Efficient Collaboration-of-Experts (CoE) Model Inference with Limited Memory
von: Suo, Jiashun, et al.
Veröffentlicht: (2025)
von: Suo, Jiashun, et al.
Veröffentlicht: (2025)
Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2026)
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2026)
Matryoshka: Optimization of Dynamic Diverse Quantum Chemistry Systems via Elastic Parallelism Transformation
von: Wang, Tuowei, et al.
Veröffentlicht: (2024)
von: Wang, Tuowei, et al.
Veröffentlicht: (2024)
Characterizing Machine Learning Force Fields as Emerging Molecular Dynamics Workloads on Graphics Processing Units
von: De Alwis, Udari, et al.
Veröffentlicht: (2026)
von: De Alwis, Udari, et al.
Veröffentlicht: (2026)
REAM: Merging Improves Pruning of Experts in LLMs
von: Jha, Saurav, et al.
Veröffentlicht: (2026)
von: Jha, Saurav, et al.
Veröffentlicht: (2026)
Heterogeneous Memory Pool Tuning
von: Vaverka, Filip, et al.
Veröffentlicht: (2025)
von: Vaverka, Filip, et al.
Veröffentlicht: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
von: Israel, Daniel, et al.
Veröffentlicht: (2025)
von: Israel, Daniel, et al.
Veröffentlicht: (2025)
Updates on the Low-Level Abstraction of Memory Access
von: Gruber, Bernhard Manfred
Veröffentlicht: (2023)
von: Gruber, Bernhard Manfred
Veröffentlicht: (2023)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
von: Fang, Yunhua, et al.
Veröffentlicht: (2025)
PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
von: Hourri, Younes, et al.
Veröffentlicht: (2025)
von: Hourri, Younes, et al.
Veröffentlicht: (2025)
AI Load Dynamics--A Power Electronics Perspective
von: Li, Yuzhuo, et al.
Veröffentlicht: (2025)
von: Li, Yuzhuo, et al.
Veröffentlicht: (2025)
Optimal Parallel Scheduling under Concave Speedup Functions
von: Li, Chengzhang, et al.
Veröffentlicht: (2025)
von: Li, Chengzhang, et al.
Veröffentlicht: (2025)
Robust Recursive Query Parallelism in Graph Database Management Systems
von: Chakraborty, Anurag, et al.
Veröffentlicht: (2025)
von: Chakraborty, Anurag, et al.
Veröffentlicht: (2025)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
von: Li, Lujun, et al.
Veröffentlicht: (2025)
von: Li, Lujun, et al.
Veröffentlicht: (2025)
Two-Timescale Dynamic Service Deployment and Task Scheduling with Spatiotemporal Collaboration in Mobile Edge Networks
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
Modeling Utilization to Identify Shared-Memory Atomic Bottlenecks
von: Dong, Rongcui, et al.
Veröffentlicht: (2025)
von: Dong, Rongcui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
von: Fu, Zizhuo, et al.
Veröffentlicht: (2025) -
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
von: Chitty-Venkata, Krishna Teja, et al.
Veröffentlicht: (2025) -
MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache
von: Xue, Leyang, et al.
Veröffentlicht: (2024) -
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
von: Shen, Zixu, et al.
Veröffentlicht: (2025) -
AdapMoE: Adaptive Sensitivity-based Expert Gating and Management for Efficient MoE Inference
von: Zhong, Shuzhang, et al.
Veröffentlicht: (2024)