LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yimu, Azadani, Mozhgan Nasr, Sedwards, Sean, Czarnecki, Krzysztof |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
por: Wang, Yimu, et al.
Publicado: (2025)
por: Wang, Yimu, et al.
Publicado: (2025)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
por: Azadani, Mozhgan Nasr, et al.
Publicado: (2025)
por: Azadani, Mozhgan Nasr, et al.
Publicado: (2025)
Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation
por: Wang, Yimu, et al.
Publicado: (2025)
por: Wang, Yimu, et al.
Publicado: (2025)
OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection
por: Chow, Adrian, et al.
Publicado: (2025)
por: Chow, Adrian, et al.
Publicado: (2025)
VADet: Multi-frame LiDAR 3D Object Detection using Variable Aggregation
por: Huang, Chengjie, et al.
Publicado: (2024)
por: Huang, Chengjie, et al.
Publicado: (2024)
SOAP: Cross-sensor Domain Adaptation for 3D Object Detection Using Stationary Object Aggregation Pseudo-labelling
por: Huang, Chengjie, et al.
Publicado: (2024)
por: Huang, Chengjie, et al.
Publicado: (2024)
How Hard Is Snow? A Paired Domain Adaptation Dataset for Clear and Snowy Weather: CADC+
por: Tang, Mei Qi, et al.
Publicado: (2025)
por: Tang, Mei Qi, et al.
Publicado: (2025)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
por: Huang, Yushi, et al.
Publicado: (2025)
por: Huang, Yushi, et al.
Publicado: (2025)
LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning
por: Kowsher, Md, et al.
Publicado: (2026)
por: Kowsher, Md, et al.
Publicado: (2026)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
por: Zhao, Zihui, et al.
Publicado: (2025)
por: Zhao, Zihui, et al.
Publicado: (2025)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
por: Deniz, Omer Faruk, et al.
Publicado: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
MFSeg: Efficient Multi-frame 3D Semantic Segmentation
por: Huang, Chengjie, et al.
Publicado: (2025)
por: Huang, Chengjie, et al.
Publicado: (2025)
MambaFormer: Token-Level Guided Routing Mixture-of-Experts for Accurate and Efficient Clinical Assistance
por: Khan, Hamad, et al.
Publicado: (2026)
por: Khan, Hamad, et al.
Publicado: (2026)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
por: Yuan, Qianhao, et al.
Publicado: (2025)
por: Yuan, Qianhao, et al.
Publicado: (2025)
Multi-level Mixture of Experts for Multimodal Entity Linking
por: Hu, Zhiwei, et al.
Publicado: (2025)
por: Hu, Zhiwei, et al.
Publicado: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
por: Chen, Siyi, et al.
Publicado: (2026)
por: Chen, Siyi, et al.
Publicado: (2026)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
por: Xu, Haolei, et al.
Publicado: (2026)
por: Xu, Haolei, et al.
Publicado: (2026)
Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI
por: Vepa, Arvind Murari, et al.
Publicado: (2025)
por: Vepa, Arvind Murari, et al.
Publicado: (2025)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
por: Jiang, Ruixiang, et al.
Publicado: (2024)
por: Jiang, Ruixiang, et al.
Publicado: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
por: Wu, Zhiyu, et al.
Publicado: (2024)
por: Wu, Zhiyu, et al.
Publicado: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
por: Dutt, Raman, et al.
Publicado: (2025)
por: Dutt, Raman, et al.
Publicado: (2025)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
por: Chen, Yingfa, et al.
Publicado: (2024)
por: Chen, Yingfa, et al.
Publicado: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
por: Huang, Yipo, et al.
Publicado: (2024)
por: Huang, Yipo, et al.
Publicado: (2024)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
por: Wu, Jialin, et al.
Publicado: (2023)
por: Wu, Jialin, et al.
Publicado: (2023)
Robust Multimodal Large Language Models Against Modality Conflict
por: Zhang, Zongmeng, et al.
Publicado: (2025)
por: Zhang, Zongmeng, et al.
Publicado: (2025)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
EvoMoE: Expert Evolution in Mixture of Experts for Multimodal Large Language Models
por: Jing, Linglin, et al.
Publicado: (2025)
por: Jing, Linglin, et al.
Publicado: (2025)
MINI-LLM: Memory-Efficient Structured Pruning for Large Language Models
por: Cheng, Hongrong, et al.
Publicado: (2024)
por: Cheng, Hongrong, et al.
Publicado: (2024)
Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts
por: Chen, Qizhou, et al.
Publicado: (2024)
por: Chen, Qizhou, et al.
Publicado: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
por: Liu, Xinxin, et al.
Publicado: (2026)
por: Liu, Xinxin, et al.
Publicado: (2026)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
ChatEXAONEPath: An Expert-level Multimodal Large Language Model for Histopathology Using Whole Slide Images
por: Kim, Sangwook, et al.
Publicado: (2025)
por: Kim, Sangwook, et al.
Publicado: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
Token Sequence Compression for Efficient Multimodal Computing
por: Omri, Yasmine, et al.
Publicado: (2025)
por: Omri, Yasmine, et al.
Publicado: (2025)
Ejemplares similares
-
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
por: Wang, Yimu, et al.
Publicado: (2025) -
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
por: Azadani, Mozhgan Nasr, et al.
Publicado: (2025) -
Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation
por: Wang, Yimu, et al.
Publicado: (2025) -
OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection
por: Chow, Adrian, et al.
Publicado: (2025) -
VADet: Multi-frame LiDAR 3D Object Detection using Variable Aggregation
por: Huang, Chengjie, et al.
Publicado: (2024)