Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rang, Miao, Bi, Zhenni, Liu, Chuanjian, Tang, Yehui, Han, Kai, Wang, Yunhe |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Empirical Study of Scaling Law for OCR
par: Rang, Miao, et autres
Publié: (2023)
par: Rang, Miao, et autres
Publié: (2023)
Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
par: Rang, Miao, et autres
Publié: (2025)
par: Rang, Miao, et autres
Publié: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
GPT4Image: Large Pre-trained Models Help Vision Models Learn Better on Perception Task
par: Ding, Ning, et autres
Publié: (2023)
par: Ding, Ning, et autres
Publié: (2023)
GhostNetV3: Exploring the Training Strategies for Compact Models
par: Liu, Zhenhua, et autres
Publié: (2024)
par: Liu, Zhenhua, et autres
Publié: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
par: Han, Kai, et autres
Publié: (2024)
par: Han, Kai, et autres
Publié: (2024)
Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
par: Bi, Zhenni, et autres
Publié: (2024)
par: Bi, Zhenni, et autres
Publié: (2024)
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization
par: Guo, Jialong, et autres
Publié: (2024)
par: Guo, Jialong, et autres
Publié: (2024)
Gold-YOLO: Efficient Object Detector via Gather-and-Distribute Mechanism
par: Wang, Chengcheng, et autres
Publié: (2023)
par: Wang, Chengcheng, et autres
Publié: (2023)
Context-Guided Spatial Feature Reconstruction for Efficient Semantic Segmentation
par: Ni, Zhenliang, et autres
Publié: (2024)
par: Ni, Zhenliang, et autres
Publié: (2024)
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
par: Wang, Chengcheng, et autres
Publié: (2024)
par: Wang, Chengcheng, et autres
Publié: (2024)
TinySAM: Pushing the Envelope for Efficient Segment Anything Model
par: Shu, Han, et autres
Publié: (2023)
par: Shu, Han, et autres
Publié: (2023)
Data-efficient Large Vision Models through Sequential Autoregression
par: Guo, Jianyuan, et autres
Publié: (2024)
par: Guo, Jianyuan, et autres
Publié: (2024)
No Time to Waste: Squeeze Time into Channel for Mobile Video Understanding
par: Zhai, Yingjie, et autres
Publié: (2024)
par: Zhai, Yingjie, et autres
Publié: (2024)
Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models
par: Guo, Jianyuan, et autres
Publié: (2024)
par: Guo, Jianyuan, et autres
Publié: (2024)
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
par: Hao, Zhiwei, et autres
Publié: (2025)
par: Hao, Zhiwei, et autres
Publié: (2025)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
par: Ni, Yunsheng, et autres
Publié: (2024)
par: Ni, Yunsheng, et autres
Publié: (2024)
A Survey on Transformer Compression
par: Tang, Yehui, et autres
Publié: (2024)
par: Tang, Yehui, et autres
Publié: (2024)
Efficient Inference of Vision Instruction-Following Models with Elastic Cache
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
A Refer-and-Ground Multimodal Large Language Model for Biomedicine
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
par: Chen, Kaibing, et autres
Publié: (2024)
par: Chen, Kaibing, et autres
Publié: (2024)
CogVLM: Visual Expert for Pretrained Language Models
par: Wang, Weihan, et autres
Publié: (2023)
par: Wang, Weihan, et autres
Publié: (2023)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
TSCM: A Teacher-Student Model for Vision Place Recognition Using Cross-Metric Knowledge Distillation
par: Shen, Yehui, et autres
Publié: (2024)
par: Shen, Yehui, et autres
Publié: (2024)
Post-Training Quantization for Diffusion Transformer via Hierarchical Timestep Grouping
par: Ding, Ning, et autres
Publié: (2025)
par: Ding, Ning, et autres
Publié: (2025)
Myriad: Large Multimodal Model by Applying Vision Experts for Industrial Anomaly Detection
par: Li, Yuanze, et autres
Publié: (2023)
par: Li, Yuanze, et autres
Publié: (2023)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
par: Jia, Ding, et autres
Publié: (2024)
par: Jia, Ding, et autres
Publié: (2024)
Fair-MoE: Fairness-Oriented Mixture of Experts in Vision-Language Models
par: Wang, Peiran, et autres
Publié: (2025)
par: Wang, Peiran, et autres
Publié: (2025)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
par: Zhang, Jipeng, et autres
Publié: (2025)
par: Zhang, Jipeng, et autres
Publié: (2025)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
par: Zhao, Shiyu, et autres
Publié: (2024)
par: Zhao, Shiyu, et autres
Publié: (2024)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
par: Ni, Zhenliang, et autres
Publié: (2025)
par: Ni, Zhenliang, et autres
Publié: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
Documents similaires
-
An Empirical Study of Scaling Law for OCR
par: Rang, Miao, et autres
Publié: (2023) -
Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
par: Rang, Miao, et autres
Publié: (2025) -
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024) -
GPT4Image: Large Pre-trained Models Help Vision Models Learn Better on Perception Task
par: Ding, Ning, et autres
Publié: (2023) -
GhostNetV3: Exploring the Training Strategies for Compact Models
par: Liu, Zhenhua, et autres
Publié: (2024)