On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Chongyang, Li, Mingsong, Lu, Haodong, Gong, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
par: Xu, Zukang, et autres
Publié: (2026)
par: Xu, Zukang, et autres
Publié: (2026)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
par: Li, Tenghui, et autres
Publié: (2024)
par: Li, Tenghui, et autres
Publié: (2024)
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
par: Chen, Yuanteng, et autres
Publié: (2025)
par: Chen, Yuanteng, et autres
Publié: (2025)
Reinforcement Learning with Promising Tokens for Large Language Models
par: Pang, Jing-Cheng, et autres
Publié: (2026)
par: Pang, Jing-Cheng, et autres
Publié: (2026)
Expert Divergence Learning for MoE-based Language Models
par: Li, Jiaang, et autres
Publié: (2026)
par: Li, Jiaang, et autres
Publié: (2026)
LocMoE: A Low-Overhead MoE for Large Language Model Training
par: Li, Jing, et autres
Publié: (2024)
par: Li, Jing, et autres
Publié: (2024)
GW-MoE: Resolving Uncertainty in MoE Router with Global Workspace Theory
par: Wu, Haoze, et autres
Publié: (2024)
par: Wu, Haoze, et autres
Publié: (2024)
Length-MAX Tokenizer for Language Models
par: Dong, Dong, et autres
Publié: (2025)
par: Dong, Dong, et autres
Publié: (2025)
Collaborative Compression for Large-Scale MoE Deployment on Edge
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
MoE-PHDS: One MoE checkpoint for flexible runtime sparsity
par: Hannah, Lauren. A, et autres
Publié: (2025)
par: Hannah, Lauren. A, et autres
Publié: (2025)
Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
par: Ganescu, Bianca-Mihaela, et autres
Publié: (2025)
par: Ganescu, Bianca-Mihaela, et autres
Publié: (2025)
FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge
par: Hu, Gang, et autres
Publié: (2025)
par: Hu, Gang, et autres
Publié: (2025)
Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling
par: Liao, Ning, et autres
Publié: (2025)
par: Liao, Ning, et autres
Publié: (2025)
ProToken: Token-Level Attribution for Federated Large Language Models
par: Gill, Waris, et autres
Publié: (2026)
par: Gill, Waris, et autres
Publié: (2026)
Token-Efficient Leverage Learning in Large Language Models
par: Zeng, Yuanhao, et autres
Publié: (2024)
par: Zeng, Yuanhao, et autres
Publié: (2024)
Continuity and Isolation Lead to Doubts or Dilemmas in Large Language Models
par: Pasten, Hector, et autres
Publié: (2025)
par: Pasten, Hector, et autres
Publié: (2025)
MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models
par: Jin, Lyudong, et autres
Publié: (2025)
par: Jin, Lyudong, et autres
Publié: (2025)
PWC-MoE: Privacy-Aware Wireless Collaborative Mixture of Experts
par: Su, Yang, et autres
Publié: (2025)
par: Su, Yang, et autres
Publié: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
par: Guo, Zhenyuan, et autres
Publié: (2026)
par: Guo, Zhenyuan, et autres
Publié: (2026)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
par: Wang, Siqi, et autres
Publié: (2024)
par: Wang, Siqi, et autres
Publié: (2024)
D$^{2}$MoE: Dual Routing and Dynamic Scheduling for Efficient On-Device MoE-based LLM Serving
par: Wang, Haodong, et autres
Publié: (2025)
par: Wang, Haodong, et autres
Publié: (2025)
SD-MoE: Spectral Decomposition for Effective Expert Specialization
par: Huang, Ruijun, et autres
Publié: (2026)
par: Huang, Ruijun, et autres
Publié: (2026)
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Practical FP4 Training for Large-Scale MoE Models on Hopper GPUs
par: Zhang, Wuyue, et autres
Publié: (2026)
par: Zhang, Wuyue, et autres
Publié: (2026)
Counterfactual Token Generation in Large Language Models
par: Chatzi, Ivi, et autres
Publié: (2024)
par: Chatzi, Ivi, et autres
Publié: (2024)
ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate
par: Lafuente-Mercado, Rodney
Publié: (2026)
par: Lafuente-Mercado, Rodney
Publié: (2026)
Training-Trajectory-Aware Token Selection
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Network-Aware Bilinear Tokenization for Brain Functional Connectivity Representation Learning
par: Milecki, Leo, et autres
Publié: (2026)
par: Milecki, Leo, et autres
Publié: (2026)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
par: Zhang, Zhongjian, et autres
Publié: (2026)
par: Zhang, Zhongjian, et autres
Publié: (2026)
Exploring Token Pruning in Vision State Space Models
par: Zhan, Zheng, et autres
Publié: (2024)
par: Zhan, Zheng, et autres
Publié: (2024)
DOT-MoE: Differentiable Optimal Transport for MoEfication
par: Bamba, Udbhav, et autres
Publié: (2026)
par: Bamba, Udbhav, et autres
Publié: (2026)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
par: Kong, Zhenglun, et autres
Publié: (2025)
par: Kong, Zhenglun, et autres
Publié: (2025)
Continuity and Ordinality Matter: Constraining Time Series Tokens for Effective Time Series Analysis with Large Language Models
par: Li, Musheng, et autres
Publié: (2026)
par: Li, Musheng, et autres
Publié: (2026)
Cognitive Load-Aware Inference: A Neuro-Symbolic Framework for Optimizing the Token Economy of Large Language Models
par: Zhang, Yilun
Publié: (2025)
par: Zhang, Yilun
Publié: (2025)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
par: Guo, Shuhan, et autres
Publié: (2024)
par: Guo, Shuhan, et autres
Publié: (2024)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
par: Zeng, Runjia, et autres
Publié: (2025)
par: Zeng, Runjia, et autres
Publié: (2025)
DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
par: Jin, Can, et autres
Publié: (2025)
par: Jin, Can, et autres
Publié: (2025)
Documents similaires
-
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
par: Xu, Zukang, et autres
Publié: (2026) -
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
par: Li, Tenghui, et autres
Publié: (2024) -
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
par: Chen, Yuanteng, et autres
Publié: (2025) -
Reinforcement Learning with Promising Tokens for Large Language Models
par: Pang, Jing-Cheng, et autres
Publié: (2026) -
Expert Divergence Learning for MoE-based Language Models
par: Li, Jiaang, et autres
Publié: (2026)