ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Jing, Gong, Ruihao, Zhang, Mingyang, He, Yefei, Cai, Jianfei, Zhuang, Bohan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)
von: Liu, Jing, et al.
Veröffentlicht: (2023)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024)
von: Liu, Akide, et al.
Veröffentlicht: (2024)
Channel Merging: Preserving Specialization for Merged Experts
von: Zhang, Mingyang, et al.
Veröffentlicht: (2024)
von: Zhang, Mingyang, et al.
Veröffentlicht: (2024)
SynapseRoute: An Auto-Route Switching Framework on Dual-State Large Language Model
von: Zhang, Wencheng, et al.
Veröffentlicht: (2025)
von: Zhang, Wencheng, et al.
Veröffentlicht: (2025)
R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
von: Chen, Zhuokun, et al.
Veröffentlicht: (2025)
von: Chen, Zhuokun, et al.
Veröffentlicht: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
von: He, Yefei, et al.
Veröffentlicht: (2024)
von: He, Yefei, et al.
Veröffentlicht: (2024)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
von: Chen, Zhuokun, et al.
Veröffentlicht: (2026)
von: Chen, Zhuokun, et al.
Veröffentlicht: (2026)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
von: Lu, Xudong, et al.
Veröffentlicht: (2024)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
Entropy Adaptive Decoding: Dynamic Model Switching for Efficient Inference
von: Simonds, Toby
Veröffentlicht: (2025)
von: Simonds, Toby
Veröffentlicht: (2025)
Train Small, Infer Large: Memory-Efficient LoRA Training for Large Language Models
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
von: Zhang, Jun, et al.
Veröffentlicht: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
von: He, Yefei, et al.
Veröffentlicht: (2024)
von: He, Yefei, et al.
Veröffentlicht: (2024)
Upcycling Large Language Models into Mixture of Experts
von: He, Ethan, et al.
Veröffentlicht: (2024)
von: He, Ethan, et al.
Veröffentlicht: (2024)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
von: He, Yang, et al.
Veröffentlicht: (2025)
von: He, Yang, et al.
Veröffentlicht: (2025)
SwitchLoRA: Switched Low-Rank Adaptation Can Learn Full-Rank Information
von: Zhou, Kaiye, et al.
Veröffentlicht: (2024)
von: Zhou, Kaiye, et al.
Veröffentlicht: (2024)
Echo: A Large Language Model with Temporal Episodic Memory
von: Liu, WenTao, et al.
Veröffentlicht: (2025)
von: Liu, WenTao, et al.
Veröffentlicht: (2025)
Efficient Stitchable Task Adaptation
von: He, Haoyu, et al.
Veröffentlicht: (2023)
von: He, Haoyu, et al.
Veröffentlicht: (2023)
ThinkTank-ME: A Multi-Expert Framework for Middle East Event Forecasting
von: Li, Haoxuan, et al.
Veröffentlicht: (2026)
von: Li, Haoxuan, et al.
Veröffentlicht: (2026)
Causal Inference for Human-Language Model Collaboration
von: Zhang, Bohan, et al.
Veröffentlicht: (2024)
von: Zhang, Bohan, et al.
Veröffentlicht: (2024)
Model Compression and Efficient Inference for Large Language Models: A Survey
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
LLM in a flash: Efficient Large Language Model Inference with Limited Memory
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2023)
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2023)
SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?
von: Zhuang, Haomin, et al.
Veröffentlicht: (2024)
von: Zhuang, Haomin, et al.
Veröffentlicht: (2024)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
von: Ojo, Jessica, et al.
Veröffentlicht: (2025)
von: Ojo, Jessica, et al.
Veröffentlicht: (2025)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
von: Pan, Rui, et al.
Veröffentlicht: (2024)
von: Pan, Rui, et al.
Veröffentlicht: (2024)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
von: Zhang, Songming, et al.
Veröffentlicht: (2026)
von: Zhang, Songming, et al.
Veröffentlicht: (2026)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
von: Zhao, Zhongyu, et al.
Veröffentlicht: (2024)
von: Zhao, Zhongyu, et al.
Veröffentlicht: (2024)
EfficientLLM: Efficiency in Large Language Models
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2025)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2025)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
von: Ding, Ning, et al.
Veröffentlicht: (2026)
von: Ding, Ning, et al.
Veröffentlicht: (2026)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
von: Xie, Peng, et al.
Veröffentlicht: (2025)
von: Xie, Peng, et al.
Veröffentlicht: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
von: Miao, Ruijie, et al.
Veröffentlicht: (2024)
von: Miao, Ruijie, et al.
Veröffentlicht: (2024)
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
von: Peng, Jingyu, et al.
Veröffentlicht: (2025)
von: Peng, Jingyu, et al.
Veröffentlicht: (2025)
MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models
von: Ha, Hyeonjeong, et al.
Veröffentlicht: (2026)
von: Ha, Hyeonjeong, et al.
Veröffentlicht: (2026)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
von: Cui, Yingqian, et al.
Veröffentlicht: (2025)
von: Cui, Yingqian, et al.
Veröffentlicht: (2025)
An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models
von: Bhatt, Gantavya, et al.
Veröffentlicht: (2024)
von: Bhatt, Gantavya, et al.
Veröffentlicht: (2024)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
von: Bianchi, Federico, et al.
Veröffentlicht: (2024)
von: Bianchi, Federico, et al.
Veröffentlicht: (2024)
Code-Switching In-Context Learning for Cross-Lingual Transfer of Large Language Models
von: Yoo, Haneul, et al.
Veröffentlicht: (2025)
von: Yoo, Haneul, et al.
Veröffentlicht: (2025)
Scaling Embeddings Outperforms Scaling Experts in Language Models
von: Liu, Hong, et al.
Veröffentlicht: (2026)
von: Liu, Hong, et al.
Veröffentlicht: (2026)
Code-Switching Curriculum Learning for Multilingual Transfer in LLMs
von: Yoo, Haneul, et al.
Veröffentlicht: (2024)
von: Yoo, Haneul, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023) -
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024) -
Channel Merging: Preserving Specialization for Merged Experts
von: Zhang, Mingyang, et al.
Veröffentlicht: (2024) -
SynapseRoute: An Auto-Route Switching Framework on Dual-State Large Language Model
von: Zhang, Wencheng, et al.
Veröffentlicht: (2025) -
R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
von: Chen, Zhuokun, et al.
Veröffentlicht: (2025)