C3PO: Critical-Layer, Core-Expert, Collaborative Pathway Optimization for Test-Time Expert Re-Mixing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhongyang, Li, Ziyue, Zhou, Tianyi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
R2-T2: Re-Routing in Test-Time for Multimodal Mixture-of-Experts
par: Li, Zhongyang, et autres
Publié: (2025)
par: Li, Zhongyang, et autres
Publié: (2025)
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
par: Li, Zhongyang, et autres
Publié: (2025)
par: Li, Zhongyang, et autres
Publié: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs
par: Li, Ziyue, et autres
Publié: (2025)
par: Li, Ziyue, et autres
Publié: (2025)
TimeExpert: Boosting Long Time Series Forecasting with Temporal Mix of Experts
par: Ma, Xiaowen, et autres
Publié: (2025)
par: Ma, Xiaowen, et autres
Publié: (2025)
Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test
par: Li, Ziyue, et autres
Publié: (2025)
par: Li, Ziyue, et autres
Publié: (2025)
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
RePO: Replay-Enhanced Policy Optimization
par: Li, Siheng, et autres
Publié: (2025)
par: Li, Siheng, et autres
Publié: (2025)
Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway
par: Zhou, Jian, et autres
Publié: (2025)
par: Zhou, Jian, et autres
Publié: (2025)
AdaMixT: Adaptive Weighted Mixture of Multi-Scale Expert Transformers for Time Series Forecasting
par: Zhang, Huanyao, et autres
Publié: (2025)
par: Zhang, Huanyao, et autres
Publié: (2025)
Retro-Expert: Collaborative Reasoning for Interpretable Retrosynthesis
par: Li, Xinyi, et autres
Publié: (2025)
par: Li, Xinyi, et autres
Publié: (2025)
Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
par: Han, Yixuan, et autres
Publié: (2025)
par: Han, Yixuan, et autres
Publié: (2025)
LAER-MoE: Load-Adaptive Expert Re-layout for Efficient Mixture-of-Experts Training
par: Liu, Xinyi, et autres
Publié: (2026)
par: Liu, Xinyi, et autres
Publié: (2026)
LeMoLE: LLM-Enhanced Mixture of Linear Experts for Time Series Forecasting
par: Zhang, Lingzheng, et autres
Publié: (2024)
par: Zhang, Lingzheng, et autres
Publié: (2024)
Hyperparameter Transfer with Mixture-of-Expert Layers
par: Jiang, Tianze, et autres
Publié: (2026)
par: Jiang, Tianze, et autres
Publié: (2026)
Personalized Federated Learning on Heterogeneous and Long-Tailed Data via Expert Collaborative Learning
par: Lv, Fengling, et autres
Publié: (2024)
par: Lv, Fengling, et autres
Publié: (2024)
Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking
par: Zhang, Dengming, et autres
Publié: (2025)
par: Zhang, Dengming, et autres
Publié: (2025)
Collaborative Expert LLMs Guided Multi-Objective Molecular Optimization
par: Yu, Jiajun, et autres
Publié: (2025)
par: Yu, Jiajun, et autres
Publié: (2025)
GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
par: Zheng, Chen, et autres
Publié: (2025)
par: Zheng, Chen, et autres
Publié: (2025)
ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing
par: Wang, Ziteng, et autres
Publié: (2024)
par: Wang, Ziteng, et autres
Publié: (2024)
Mixture Experts with Test-Time Self-Supervised Aggregation for Tabular Imbalanced Regression
par: Wang, Yung-Chien, et autres
Publié: (2025)
par: Wang, Yung-Chien, et autres
Publié: (2025)
Separation and Collaboration: Two-Level Routing Grouped Mixture-of-Experts for Multi-Domain Continual Learning
par: Zhou, Jialu, et autres
Publié: (2025)
par: Zhou, Jialu, et autres
Publié: (2025)
Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE
par: Chen, Yuanteng, et autres
Publié: (2026)
par: Chen, Yuanteng, et autres
Publié: (2026)
MoPEQ: Mixture of Mixed Precision Quantized Experts
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Adaptive Substructure-Aware Expert Model for Molecular Property Prediction
par: Jiang, Tianyi, et autres
Publié: (2025)
par: Jiang, Tianyi, et autres
Publié: (2025)
Task-Aware Mixture-of-Experts for Time Series Analysis
par: Wu, Xingjian, et autres
Publié: (2025)
par: Wu, Xingjian, et autres
Publié: (2025)
Learning More Generalized Experts by Merging Experts in Mixture-of-Experts
par: Park, Sejik
Publié: (2024)
par: Park, Sejik
Publié: (2024)
Addressing Imbalanced Domain-Incremental Learning through Dual-Balance Collaborative Experts
par: Li, Lan, et autres
Publié: (2025)
par: Li, Lan, et autres
Publié: (2025)
Unveiling Hidden Collaboration within Mixture-of-Experts in Large Language Models
par: Tang, Yuanbo, et autres
Publié: (2025)
par: Tang, Yuanbo, et autres
Publié: (2025)
Principled Bayesian Optimisation in Collaboration with Human Experts
par: Xu, Wenjie, et autres
Publié: (2024)
par: Xu, Wenjie, et autres
Publié: (2024)
Optimizing Mixture-of-Experts Inference Time Combining Model Deployment and Communication Scheduling
par: Li, Jialong, et autres
Publié: (2024)
par: Li, Jialong, et autres
Publié: (2024)
Robust Experts: the Effect of Adversarial Training on CNNs with Sparse Mixture-of-Experts Layers
par: Pavlitska, Svetlana, et autres
Publié: (2025)
par: Pavlitska, Svetlana, et autres
Publié: (2025)
EBaReT: Expert-guided Bag Reward Transformer for Auto Bidding
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
par: Wei, Jia, et autres
Publié: (2026)
par: Wei, Jia, et autres
Publié: (2026)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Many-Objective Multi-Solution Transport
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025)
par: Luo, Shuqing, et autres
Publié: (2025)
Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert Merging
par: Li, Lujun, et autres
Publié: (2025)
par: Li, Lujun, et autres
Publié: (2025)
OptPO: Optimal Rollout Allocation for Test-time Policy Optimization
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
ViTs: Teaching Machines to See Time Series Anomalies Like Human Experts
par: Wang, Zexin, et autres
Publié: (2025)
par: Wang, Zexin, et autres
Publié: (2025)
Documents similaires
-
R2-T2: Re-Routing in Test-Time for Multimodal Mixture-of-Experts
par: Li, Zhongyang, et autres
Publié: (2025) -
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
par: Li, Zhongyang, et autres
Publié: (2025) -
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024) -
Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs
par: Li, Ziyue, et autres
Publié: (2025) -
TimeExpert: Boosting Long Time Series Forecasting with Temporal Mix of Experts
par: Ma, Xiaowen, et autres
Publié: (2025)