Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Peijun, Yang, Ning, Tian, Baoliang, Wei, Jiayu, Zhang, Weihao, Zhang, Haijun, Lv, Pin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SSDTrain: An Activation Offloading Framework to SSDs for Faster Large Language Model Training
par: Wu, Kun, et autres
Publié: (2024)
par: Wu, Kun, et autres
Publié: (2024)
D-CODE: Data Colony Optimization for Dynamic Network Efficiency
par: Pandey, Tannu, et autres
Publié: (2024)
par: Pandey, Tannu, et autres
Publié: (2024)
A Frequency-based Parent Selection for Reducing the Effect of Evaluation Time Bias in Asynchronous Parallel Multi-objective Evolutionary Algorithms
par: Harada, Tomohiro
Publié: (2021)
par: Harada, Tomohiro
Publié: (2021)
Code generation and runtime techniques for enabling data-efficient deep learning training on GPUs
par: Wu, Kun
Publié: (2024)
par: Wu, Kun
Publié: (2024)
Neuromorphic Simulation of Drosophila Melanogaster Brain Connectome on Loihi 2
par: Wang, Felix, et autres
Publié: (2025)
par: Wang, Felix, et autres
Publié: (2025)
A Fresh Approach to Evaluate Performance in Distributed Parallel Genetic Algorithms
par: Harada, Tomohiro, et autres
Publié: (2021)
par: Harada, Tomohiro, et autres
Publié: (2021)
Evaluation and Efficiency Comparison of Evolutionary Algorithms for Service Placement Optimization in Fog Architectures
par: Guerrero, Carlos, et autres
Publié: (2025)
par: Guerrero, Carlos, et autres
Publié: (2025)
Reducing Data Bottlenecks in Distributed, Heterogeneous Neural Networks
par: Lin, Ruhai, et autres
Publié: (2024)
par: Lin, Ruhai, et autres
Publié: (2024)
Trackable Agent-based Evolution Models at Wafer Scale
par: Moreno, Matthew Andres, et autres
Publié: (2024)
par: Moreno, Matthew Andres, et autres
Publié: (2024)
Trackable Island-model Genetic Algorithms at Wafer Scale
par: Moreno, Matthew Andres, et autres
Publié: (2024)
par: Moreno, Matthew Andres, et autres
Publié: (2024)
Sparse Spiking Neural-like Membrane Systems on Graphics Processing Units
par: Hernández-Tello, Javier, et autres
Publié: (2024)
par: Hernández-Tello, Javier, et autres
Publié: (2024)
HydroFusion-LMF: Semi-Supervised Multi-Network Fusion with Large-Model Adaptation for Long-Term Daily Runoff Forecasting
par: Fan, Qianfei, et autres
Publié: (2025)
par: Fan, Qianfei, et autres
Publié: (2025)
Neuromorphic Computing: A Theoretical Framework for Time, Space, and Energy Scaling
par: Aimone, James B
Publié: (2025)
par: Aimone, James B
Publié: (2025)
HiAER-Spike: Hardware-Software Co-Design for Large-Scale Reconfigurable Event-Driven Neuromorphic Computing
par: Frank, Gwenevere, et autres
Publié: (2025)
par: Frank, Gwenevere, et autres
Publié: (2025)
Neuromorphic hardware for sustainable AI data centers
par: Vogginger, Bernhard, et autres
Publié: (2024)
par: Vogginger, Bernhard, et autres
Publié: (2024)
Federated Learning in Chemical Engineering: A Tutorial on a Framework for Privacy-Preserving Collaboration Across Distributed Data Sources
par: Dutta, Siddhant, et autres
Publié: (2024)
par: Dutta, Siddhant, et autres
Publié: (2024)
phys-MCP: A Control Plane for Heterogeneous Physical Neural Networks
par: Fischer, Stefan, et autres
Publié: (2026)
par: Fischer, Stefan, et autres
Publié: (2026)
GAP2WSS: A Genetic Algorithm based on the Pareto Principle for Web Service Selection
par: Khatoonabadi, SayedHassan, et autres
Publié: (2021)
par: Khatoonabadi, SayedHassan, et autres
Publié: (2021)
The AI Shadow War: SaaS vs. Edge Computing Architectures
par: Marpu, Rhea Pritham, et autres
Publié: (2025)
par: Marpu, Rhea Pritham, et autres
Publié: (2025)
A Reinforced Evolution-Based Approach to Multi-Resource Load Balancing
par: Sliwko, Leszek
Publié: (2025)
par: Sliwko, Leszek
Publié: (2025)
Wireless Sensor Networks as Parallel and Distributed Hardware Platform for Artificial Neural Networks
par: Serpen, Gursel
Publié: (2025)
par: Serpen, Gursel
Publié: (2025)
NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2026)
par: Hafiz, Muhammad Ihsan Al, et autres
Publié: (2026)
MAC-DO: An Efficient Output-Stationary GEMM Accelerator for CNNs Using DRAM Technology
par: Jeong, Minki, et autres
Publié: (2022)
par: Jeong, Minki, et autres
Publié: (2022)
Asynchronous Evolution of Deep Neural Network Architectures
par: Liang, Jason, et autres
Publié: (2023)
par: Liang, Jason, et autres
Publié: (2023)
Distributed genetic algorithm for application placement in the compute continuum leveraging infrastructure nodes for optimization
par: Guerrero, Carlos, et autres
Publié: (2024)
par: Guerrero, Carlos, et autres
Publié: (2024)
ParEVO: Synthesizing Code for Irregular Data: High-Performance Parallelism through Agentic Evolution
par: Yang, Liu, et autres
Publié: (2026)
par: Yang, Liu, et autres
Publié: (2026)
OpenRASE: Service Function Chain Emulation
par: Krishnamohan, Theviyanthan, et autres
Publié: (2025)
par: Krishnamohan, Theviyanthan, et autres
Publié: (2025)
Towards a Decentralised Application-Centric Orchestration Framework in the Cloud-Edge Continuum
par: Ullah, Amjad, et autres
Publié: (2025)
par: Ullah, Amjad, et autres
Publié: (2025)
Edge Intelligence with Spiking Neural Networks
par: Deng, Shuiguang, et autres
Publié: (2025)
par: Deng, Shuiguang, et autres
Publié: (2025)
Scalable Construction of Spiking Neural Networks using up to thousands of GPUs
par: Golosio, Bruno, et autres
Publié: (2025)
par: Golosio, Bruno, et autres
Publié: (2025)
Split Federated Learning Over Heterogeneous Edge Devices: Algorithm and Optimization
par: Sun, Yunrui, et autres
Publié: (2024)
par: Sun, Yunrui, et autres
Publié: (2024)
Comparison of Microservice Call Rate Predictions for Replication in the Cloud
par: Mehran, Narges, et autres
Publié: (2023)
par: Mehran, Narges, et autres
Publié: (2023)
Linear Reservoir: A Diagonalization-Based Optimization
par: de Coudenhove, Romain, et autres
Publié: (2026)
par: de Coudenhove, Romain, et autres
Publié: (2026)
Cyclic Data Parallelism for Efficient Parallelism of Deep Neural Networks
par: Fournier, Louis, et autres
Publié: (2024)
par: Fournier, Louis, et autres
Publié: (2024)
Online Continual Learning on Intel Loihi 2 via a Co-designed Spiking Neural Network
par: Hajizada, Elvin, et autres
Publié: (2025)
par: Hajizada, Elvin, et autres
Publié: (2025)
NeuraChip: Accelerating GNN Computations with a Hash-based Decoupled Spatial Accelerator
par: Shivdikar, Kaustubh, et autres
Publié: (2024)
par: Shivdikar, Kaustubh, et autres
Publié: (2024)
All-to-all reconfigurability with sparse and higher-order Ising machines
par: Nikhar, Srijan, et autres
Publié: (2023)
par: Nikhar, Srijan, et autres
Publié: (2023)
Man-Made Heuristics Are Dead. Long Live Code Generators!
par: Dwivedula, Rohit, et autres
Publié: (2025)
par: Dwivedula, Rohit, et autres
Publié: (2025)
When Federated Learning Meets Quantum Computing: Survey and Research Opportunities
par: Mathur, Aakar, et autres
Publié: (2025)
par: Mathur, Aakar, et autres
Publié: (2025)
Zeroing neural dynamics solving time-variant complex conjugate matrix equation $X(τ)F(τ)-A(τ)\overline{X}(τ)=C(τ)$
par: He, Jiakuang, et autres
Publié: (2024)
par: He, Jiakuang, et autres
Publié: (2024)
Documents similaires
-
SSDTrain: An Activation Offloading Framework to SSDs for Faster Large Language Model Training
par: Wu, Kun, et autres
Publié: (2024) -
D-CODE: Data Colony Optimization for Dynamic Network Efficiency
par: Pandey, Tannu, et autres
Publié: (2024) -
A Frequency-based Parent Selection for Reducing the Effect of Evaluation Time Bias in Asynchronous Parallel Multi-objective Evolutionary Algorithms
par: Harada, Tomohiro
Publié: (2021) -
Code generation and runtime techniques for enabling data-efficient deep learning training on GPUs
par: Wu, Kun
Publié: (2024) -
Neuromorphic Simulation of Drosophila Melanogaster Brain Connectome on Loihi 2
par: Wang, Felix, et autres
Publié: (2025)