ResMoE: Space-efficient Compression of Mixture of Experts LLMs via Residual Restoration
Fuente:
arXiv
Salvato in:
| Autori principali: | Ai, Mengting, Wei, Tianxin, Chen, Yifan, Zeng, Zhichen, Zhao, Ritchie, Varatkar, Girish, Rouhani, Bita Darvish, Tang, Xianfeng, Tong, Hanghang, He, Jingrui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MLP Fusion: Towards Efficient Fine-tuning of Dense and Mixture-of-Experts Language Models
di: Ai, Mengting, et al.
Pubblicazione: (2023)
di: Ai, Mengting, et al.
Pubblicazione: (2023)
Key, Value, Compress: A Systematic Exploration of KV Cache Compression Techniques
di: Javidnia, Neusha, et al.
Pubblicazione: (2025)
di: Javidnia, Neusha, et al.
Pubblicazione: (2025)
NIRVANA: Structured pruning reimagined for large language models compression
di: Ai, Mengting, et al.
Pubblicazione: (2025)
di: Ai, Mengting, et al.
Pubblicazione: (2025)
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
di: Yu, Yanpeng, et al.
Pubblicazione: (2025)
PyG-SSL: A Graph Self-Supervised Learning Toolkit
di: Zheng, Lecheng, et al.
Pubblicazione: (2024)
di: Zheng, Lecheng, et al.
Pubblicazione: (2024)
Saffron-1: Safety Inference Scaling
di: Qiu, Ruizhong, et al.
Pubblicazione: (2025)
di: Qiu, Ruizhong, et al.
Pubblicazione: (2025)
Matcha: Mitigating Graph Structure Shifts with Test-Time Adaptation
di: Bao, Wenxuan, et al.
Pubblicazione: (2024)
di: Bao, Wenxuan, et al.
Pubblicazione: (2024)
LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts
di: Elango, Venmugil, et al.
Pubblicazione: (2026)
di: Elango, Venmugil, et al.
Pubblicazione: (2026)
MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
di: Chen, Xiaodong, et al.
Pubblicazione: (2025)
di: Chen, Xiaodong, et al.
Pubblicazione: (2025)
Harnessing Consistency for Robust Test-Time LLM Ensemble
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
CATS: Mitigating Correlation Shift for Multivariate Time Series Classification
di: Lin, Xiao, et al.
Pubblicazione: (2025)
di: Lin, Xiao, et al.
Pubblicazione: (2025)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
di: Ning, Xuying, et al.
Pubblicazione: (2026)
di: Ning, Xuying, et al.
Pubblicazione: (2026)
Latte: Collaborative Test-Time Adaptation of Vision-Language Models in Federated Learning
di: Bao, Wenxuan, et al.
Pubblicazione: (2025)
di: Bao, Wenxuan, et al.
Pubblicazione: (2025)
WAPITI: A Watermark for Finetuned Open-Source LLMs
di: Chen, Lingjie, et al.
Pubblicazione: (2024)
di: Chen, Lingjie, et al.
Pubblicazione: (2024)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
di: Li, Lujun, et al.
Pubblicazione: (2025)
di: Li, Lujun, et al.
Pubblicazione: (2025)
RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression
di: Zhong, Zhengjia, et al.
Pubblicazione: (2026)
di: Zhong, Zhengjia, et al.
Pubblicazione: (2026)
Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding
di: Bhatia, Nidhi, et al.
Pubblicazione: (2025)
di: Bhatia, Nidhi, et al.
Pubblicazione: (2025)
EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation
di: Li, Ting-Wei, et al.
Pubblicazione: (2026)
di: Li, Ting-Wei, et al.
Pubblicazione: (2026)
Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
di: Cheng, Long, et al.
Pubblicazione: (2026)
di: Cheng, Long, et al.
Pubblicazione: (2026)
Compressing LLMs with MoP: Mixture of Pruners
di: Yamamoto, Bruno Lopes, et al.
Pubblicazione: (2026)
di: Yamamoto, Bruno Lopes, et al.
Pubblicazione: (2026)
Subspace Alignment for Vision-Language Model Test-time Adaptation
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
di: Zhao, Yanjun, et al.
Pubblicazione: (2026)
di: Zhao, Yanjun, et al.
Pubblicazione: (2026)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
di: Cui, Chengming, et al.
Pubblicazione: (2026)
di: Cui, Chengming, et al.
Pubblicazione: (2026)
Mixture of Sequence: Theme-Aware Mixture-of-Experts for Long-Sequence Recommendation
di: Lin, Xiao, et al.
Pubblicazione: (2026)
di: Lin, Xiao, et al.
Pubblicazione: (2026)
Flow Matching Meets Biology and Life Science: A Survey
di: Li, Zihao, et al.
Pubblicazione: (2025)
di: Li, Zihao, et al.
Pubblicazione: (2025)
SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding
di: Abramovich, Talor, et al.
Pubblicazione: (2026)
di: Abramovich, Talor, et al.
Pubblicazione: (2026)
APEX$^2$: Adaptive and Extreme Summarization for Personalized Knowledge Graphs
di: Li, Zihao, et al.
Pubblicazione: (2024)
di: Li, Zihao, et al.
Pubblicazione: (2024)
Exploiting the Experts: Unauthorized Compression in MoE-LLMs
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
di: Neogi, Pinaki Prasad Guha, et al.
Pubblicazione: (2025)
FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation
di: He, Xinrui, et al.
Pubblicazione: (2026)
di: He, Xinrui, et al.
Pubblicazione: (2026)
Gradient Compressed Sensing: A Query-Efficient Gradient Estimator for High-Dimensional Zeroth-Order Optimization
di: Qiu, Ruizhong, et al.
Pubblicazione: (2024)
di: Qiu, Ruizhong, et al.
Pubblicazione: (2024)
What Do LLMs Need to Understand Graphs: A Survey of Parametric Representation of Graphs
di: Fu, Dongqi, et al.
Pubblicazione: (2024)
di: Fu, Dongqi, et al.
Pubblicazione: (2024)
MoRE: Mixture of Residual Experts for Humanoid Lifelike Gaits Learning on Complex Terrains
di: Wang, Dewei, et al.
Pubblicazione: (2025)
di: Wang, Dewei, et al.
Pubblicazione: (2025)
Tensor Convolutional Network for Higher-Order Interaction Prediction in Sparse Tensors
di: Jang, Jun-Gi, et al.
Pubblicazione: (2025)
di: Jang, Jun-Gi, et al.
Pubblicazione: (2025)
ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification
di: Lin, Xiao, et al.
Pubblicazione: (2026)
di: Lin, Xiao, et al.
Pubblicazione: (2026)
Hierarchical LoRA MoE for Efficient CTR Model Scaling
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
di: Zeng, Zhichen, et al.
Pubblicazione: (2025)
Connecting Domains and Contrasting Samples: A Ladder for Domain Generalization
di: Wei, Tianxin, et al.
Pubblicazione: (2025)
di: Wei, Tianxin, et al.
Pubblicazione: (2025)
Breaking Silos: Adaptive Model Fusion Unlocks Better Time Series Forecasting
di: Liu, Zhining, et al.
Pubblicazione: (2025)
di: Liu, Zhining, et al.
Pubblicazione: (2025)
CLIMB: Class-imbalanced Learning Benchmark on Tabular Data
di: Liu, Zhining, et al.
Pubblicazione: (2025)
di: Liu, Zhining, et al.
Pubblicazione: (2025)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MLP Fusion: Towards Efficient Fine-tuning of Dense and Mixture-of-Experts Language Models
di: Ai, Mengting, et al.
Pubblicazione: (2023) -
Key, Value, Compress: A Systematic Exploration of KV Cache Compression Techniques
di: Javidnia, Neusha, et al.
Pubblicazione: (2025) -
NIRVANA: Structured pruning reimagined for large language models compression
di: Ai, Mengting, et al.
Pubblicazione: (2025) -
Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
di: Yu, Yanpeng, et al.
Pubblicazione: (2025) -
PyG-SSL: A Graph Self-Supervised Learning Toolkit
di: Zheng, Lecheng, et al.
Pubblicazione: (2024)