VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Yinghao, Luo, Zhuoyan, Yu, Yiyao, Yu, Zhaojian, Yang, Yujiu, Zhang, Xiao-Ping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
por: Zheng, Youwei, et al.
Publicado: (2025)
por: Zheng, Youwei, et al.
Publicado: (2025)
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
por: Liu, Xiangyue, et al.
Publicado: (2026)
por: Liu, Xiangyue, et al.
Publicado: (2026)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
Monkey Jump : MoE-Style PEFT for Efficient Multi-Task Learning
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2026)
por: Prottasha, Nusrat Jahan, et al.
Publicado: (2026)
BIG-MoE: Bypass Isolated Gating MoE for Generalized Multimodal Face Anti-Spoofing
por: Ma, Yingjie, et al.
Publicado: (2024)
por: Ma, Yingjie, et al.
Publicado: (2024)
An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
MoE-FFD: Mixture of Experts for Generalized and Parameter-Efficient Face Forgery Detection
por: Kong, Chenqi, et al.
Publicado: (2024)
por: Kong, Chenqi, et al.
Publicado: (2024)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
por: Kong, Lingshun, et al.
Publicado: (2026)
por: Kong, Lingshun, et al.
Publicado: (2026)
Z1: Efficient Test-time Scaling with Code
por: Yu, Zhaojian, et al.
Publicado: (2025)
por: Yu, Zhaojian, et al.
Publicado: (2025)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
por: Qin, Guangshuo, et al.
Publicado: (2026)
por: Qin, Guangshuo, et al.
Publicado: (2026)
Scalable Image Tokenization with Index Backpropagation Quantization
por: Shi, Fengyuan, et al.
Publicado: (2024)
por: Shi, Fengyuan, et al.
Publicado: (2024)
SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
por: Bo, Zi-Hao, et al.
Publicado: (2026)
por: Bo, Zi-Hao, et al.
Publicado: (2026)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
por: Chen, Junyi, et al.
Publicado: (2023)
por: Chen, Junyi, et al.
Publicado: (2023)
UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression
por: Zhao, Yuan, et al.
Publicado: (2025)
por: Zhao, Yuan, et al.
Publicado: (2025)
OpenCarbonEval: A Unified Carbon Emission Estimation Framework in Large-Scale AI Models
por: Yu, Zhaojian, et al.
Publicado: (2024)
por: Yu, Zhaojian, et al.
Publicado: (2024)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
por: Wang, Xiaokun, et al.
Publicado: (2025)
por: Wang, Xiaokun, et al.
Publicado: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
por: Yang, Yu-Qi, et al.
Publicado: (2024)
por: Yang, Yu-Qi, et al.
Publicado: (2024)
IMA-MoE: An Interpretable Modality-Aware Mixture-of-Experts Framework for Characterizing the Neurobiological Signatures of Binge Eating Disorder
por: Zhao, Lin, et al.
Publicado: (2026)
por: Zhao, Lin, et al.
Publicado: (2026)
AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection
por: Lin, Hongwei, et al.
Publicado: (2026)
por: Lin, Hongwei, et al.
Publicado: (2026)
Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing
por: Min, Chengxi, et al.
Publicado: (2025)
por: Min, Chengxi, et al.
Publicado: (2025)
PhyG-MoE: A Physics-Guided Mixture-of-Experts Framework for Energy-Efficient GNSS Interference Recognition
por: Zeng, Zhihan, et al.
Publicado: (2026)
por: Zeng, Zhihan, et al.
Publicado: (2026)
More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment
por: Xie, Jun, et al.
Publicado: (2025)
por: Xie, Jun, et al.
Publicado: (2025)
Xiaomi MiMo-VL-Miloco Technical Report
por: Li, Jiaze, et al.
Publicado: (2025)
por: Li, Jiaze, et al.
Publicado: (2025)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
por: Zhao, Xinyuan, et al.
Publicado: (2026)
por: Zhao, Xinyuan, et al.
Publicado: (2026)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
por: Lu, Dongchen, et al.
Publicado: (2025)
por: Lu, Dongchen, et al.
Publicado: (2025)
LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE
por: Shang, Yu, et al.
Publicado: (2025)
por: Shang, Yu, et al.
Publicado: (2025)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
por: Shi, Yangming, et al.
Publicado: (2026)
por: Shi, Yangming, et al.
Publicado: (2026)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023)
por: Chen, Zhe, et al.
Publicado: (2023)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
por: Jin, Xin, et al.
Publicado: (2025)
por: Jin, Xin, et al.
Publicado: (2025)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026)
por: Xu, Boyue, et al.
Publicado: (2026)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
por: Wang, Wenjie, et al.
Publicado: (2026)
por: Wang, Wenjie, et al.
Publicado: (2026)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
por: Chen, Feilong, et al.
Publicado: (2025)
por: Chen, Feilong, et al.
Publicado: (2025)
Ejemplares similares
-
CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation
por: Luo, Zhuoyan, et al.
Publicado: (2024) -
MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding
por: Li, Yu, et al.
Publicado: (2025) -
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
por: Yang, Rui, et al.
Publicado: (2025) -
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
por: Zheng, Youwei, et al.
Publicado: (2025) -
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
por: Liu, Xiangyue, et al.
Publicado: (2026)