MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Leyang, Chen, Gongwei, Shao, Rui, Guan, Weili, Nie, Liqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoME: Mixture of Multimodal Experts for Cancer Survival Prediction
di: Xiong, Conghao, et al.
Pubblicazione: (2024)
di: Xiong, Conghao, et al.
Pubblicazione: (2024)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
di: Lyu, Yibo, et al.
Pubblicazione: (2025)
di: Lyu, Yibo, et al.
Pubblicazione: (2025)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation
di: Rezvani, Arghavan, et al.
Pubblicazione: (2025)
di: Rezvani, Arghavan, et al.
Pubblicazione: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
MoME: Estimating Psychological Traits from Gait with Multi-Stage Mixture of Movement Experts
di: Cǎtrunǎ, Andy, et al.
Pubblicazione: (2025)
di: Cǎtrunǎ, Andy, et al.
Pubblicazione: (2025)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
di: Lyu, Yibo, et al.
Pubblicazione: (2026)
di: Lyu, Yibo, et al.
Pubblicazione: (2026)
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
di: Chen, Yanda, et al.
Pubblicazione: (2025)
di: Chen, Yanda, et al.
Pubblicazione: (2025)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
MoVA: Adapting Mixture of Vision Experts to Multimodal Context
di: Zong, Zhuofan, et al.
Pubblicazione: (2024)
di: Zong, Zhuofan, et al.
Pubblicazione: (2024)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
di: Huang, Yushi, et al.
Pubblicazione: (2025)
di: Huang, Yushi, et al.
Pubblicazione: (2025)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
di: Luo, Yaxin, et al.
Pubblicazione: (2024)
di: Luo, Yaxin, et al.
Pubblicazione: (2024)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
di: Wu, Jialin, et al.
Pubblicazione: (2023)
di: Wu, Jialin, et al.
Pubblicazione: (2023)
LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning
di: Kowsher, Md, et al.
Pubblicazione: (2026)
di: Kowsher, Md, et al.
Pubblicazione: (2026)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
di: Li, Jiachen, et al.
Pubblicazione: (2024)
di: Li, Jiachen, et al.
Pubblicazione: (2024)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Aria: An Open Multimodal Native Mixture-of-Experts Model
di: Li, Dongxu, et al.
Pubblicazione: (2024)
di: Li, Dongxu, et al.
Pubblicazione: (2024)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question Answering
di: Huai, Tianyu, et al.
Pubblicazione: (2025)
di: Huai, Tianyu, et al.
Pubblicazione: (2025)
Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
di: Li, Zaijing, et al.
Pubblicazione: (2026)
di: Li, Zaijing, et al.
Pubblicazione: (2026)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
di: Shao, Rui, et al.
Pubblicazione: (2026)
di: Shao, Rui, et al.
Pubblicazione: (2026)
Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
di: Wang, Yuchen, et al.
Pubblicazione: (2025)
di: Wang, Yuchen, et al.
Pubblicazione: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
di: Lin, Bin, et al.
Pubblicazione: (2024)
di: Lin, Bin, et al.
Pubblicazione: (2024)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
di: Shi, Haoxiang, et al.
Pubblicazione: (2025)
di: Shi, Haoxiang, et al.
Pubblicazione: (2025)
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
di: Lee, Eunho, et al.
Pubblicazione: (2026)
di: Lee, Eunho, et al.
Pubblicazione: (2026)
Unified Multimodal Visual Tracking with Dual Mixture-of-Experts
di: Hong, Lingyi, et al.
Pubblicazione: (2026)
di: Hong, Lingyi, et al.
Pubblicazione: (2026)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
di: Xu, Haolei, et al.
Pubblicazione: (2026)
di: Xu, Haolei, et al.
Pubblicazione: (2026)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
di: Liu, Juntao, et al.
Pubblicazione: (2025)
di: Liu, Juntao, et al.
Pubblicazione: (2025)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
di: Shao, Rui, et al.
Pubblicazione: (2025)
di: Shao, Rui, et al.
Pubblicazione: (2025)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
I2MoE: Interpretable Multimodal Interaction-aware Mixture-of-Experts
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MoME: Mixture of Multimodal Experts for Cancer Survival Prediction
di: Xiong, Conghao, et al.
Pubblicazione: (2024) -
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
di: Lyu, Yibo, et al.
Pubblicazione: (2025) -
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025) -
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024) -
MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation
di: Rezvani, Arghavan, et al.
Pubblicazione: (2025)