DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xiaotong, Zhang, Fan, Diao, Haiwen, Wang, Yueze, Wang, Xinlong, Duan, Ling-Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2024)
di: Chen, Zhuokun, et al.
Pubblicazione: (2024)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
Generative Multimodal Models are In-Context Learners
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024)
di: Wang, Xinran, et al.
Pubblicazione: (2024)
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
di: Yin, Shaofeng, et al.
Pubblicazione: (2026)
di: Yin, Shaofeng, et al.
Pubblicazione: (2026)
KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification
di: Zhu, Yue, et al.
Pubblicazione: (2025)
di: Zhu, Yue, et al.
Pubblicazione: (2025)
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
di: Wang, Sheng
Pubblicazione: (2025)
di: Wang, Sheng
Pubblicazione: (2025)
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception
di: Wang, Guanqun, et al.
Pubblicazione: (2024)
di: Wang, Guanqun, et al.
Pubblicazione: (2024)
Single-Input Multi-Output Model Merging: Leveraging Foundation Models for Dense Multi-Task Learning
di: Giraldo, Juan Garcia, et al.
Pubblicazione: (2025)
di: Giraldo, Juan Garcia, et al.
Pubblicazione: (2025)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
di: Xu, Haolei, et al.
Pubblicazione: (2026)
di: Xu, Haolei, et al.
Pubblicazione: (2026)
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
di: Fan, Weichen, et al.
Pubblicazione: (2025)
di: Fan, Weichen, et al.
Pubblicazione: (2025)
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
di: Liu, Hui, et al.
Pubblicazione: (2025)
di: Liu, Hui, et al.
Pubblicazione: (2025)
Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception
di: Wang, Junjie, et al.
Pubblicazione: (2025)
di: Wang, Junjie, et al.
Pubblicazione: (2025)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
di: He, Xin, et al.
Pubblicazione: (2025)
di: He, Xin, et al.
Pubblicazione: (2025)
EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion
di: Yang, Zichuan, et al.
Pubblicazione: (2025)
di: Yang, Zichuan, et al.
Pubblicazione: (2025)
ME-Mamba: Multi-Expert Mamba with Efficient Knowledge Capture and Fusion for Multimodal Survival Analysis
di: Zhang, Chengsheng, et al.
Pubblicazione: (2025)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2025)
MMIF-AMIN: Adaptive Loss-Driven Multi-Scale Invertible Dense Network for Multimodal Medical Image Fusion
di: Luo, Tao, et al.
Pubblicazione: (2025)
di: Luo, Tao, et al.
Pubblicazione: (2025)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
Multimodal Fusion SLAM with Fourier Attention
di: Zhou, Youjie, et al.
Pubblicazione: (2025)
di: Zhou, Youjie, et al.
Pubblicazione: (2025)
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging
di: Shao, Zibo, et al.
Pubblicazione: (2026)
di: Shao, Zibo, et al.
Pubblicazione: (2026)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
Evaluating Attribute Comprehension in Large Vision-Language Models
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
GROVER: Graph-guided Representation of Omics and Vision with Expert Regulation for Adaptive Spatial Multi-omics Fusion
di: Xiao, Yongjun, et al.
Pubblicazione: (2025)
di: Xiao, Yongjun, et al.
Pubblicazione: (2025)
Frequency-aware Feature Fusion for Dense Image Prediction
di: Chen, Linwei, et al.
Pubblicazione: (2024)
di: Chen, Linwei, et al.
Pubblicazione: (2024)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
di: Ou, Siqu, et al.
Pubblicazione: (2025)
di: Ou, Siqu, et al.
Pubblicazione: (2025)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
CapsFusion: Rethinking Image-Text Data at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2023)
di: Yu, Qiying, et al.
Pubblicazione: (2023)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
di: Ma, Longhui, et al.
Pubblicazione: (2026)
di: Ma, Longhui, et al.
Pubblicazione: (2026)
Autoregressive Video Generation without Vector Quantization
di: Deng, Haoge, et al.
Pubblicazione: (2024)
di: Deng, Haoge, et al.
Pubblicazione: (2024)
M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis
di: Dong, Rui, et al.
Pubblicazione: (2026)
di: Dong, Rui, et al.
Pubblicazione: (2026)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
di: Zhou, Zijie, et al.
Pubblicazione: (2026)
di: Zhou, Zijie, et al.
Pubblicazione: (2026)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2025) -
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025) -
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023) -
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2024)