MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Yue, Liu, Yangzhou, Chen, Zhe, Shi, Guangchen, Wang, Wenhai, Zhao, Danhuai, Lu, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024)
par: Liu, Yangzhou, et autres
Publié: (2024)
MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
par: Peng, Wujian, et autres
Publié: (2023)
par: Peng, Wujian, et autres
Publié: (2023)
Docopilot: Improving Multimodal Models for Document-Level Understanding
par: Duan, Yuchen, et autres
Publié: (2025)
par: Duan, Yuchen, et autres
Publié: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
ZFusion: An Effective Fuser of Camera and 4D Radar for 3D Object Perception in Autonomous Driving
par: Yang, Sheng, et autres
Publié: (2025)
par: Yang, Sheng, et autres
Publié: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025)
par: Shi, Cheng, et autres
Publié: (2025)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
par: Cao, Shuo, et autres
Publié: (2025)
par: Cao, Shuo, et autres
Publié: (2025)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
par: Zhao, Fufangchen, et autres
Publié: (2025)
par: Zhao, Fufangchen, et autres
Publié: (2025)
MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs
par: Du, Yipeng, et autres
Publié: (2025)
par: Du, Yipeng, et autres
Publié: (2025)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
par: Peng, Yi-Xing, et autres
Publié: (2025)
par: Peng, Yi-Xing, et autres
Publié: (2025)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
par: Li, Hongyu, et autres
Publié: (2025)
par: Li, Hongyu, et autres
Publié: (2025)
CorrMoE: Mixture of Experts with De-stylization Learning for Cross-Scene and Cross-Domain Correspondence Pruning
par: Xia, Peiwen, et autres
Publié: (2025)
par: Xia, Peiwen, et autres
Publié: (2025)
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
par: Maack, Lennart, et autres
Publié: (2026)
par: Maack, Lennart, et autres
Publié: (2026)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
par: Guo, Zhenhao, et autres
Publié: (2025)
par: Guo, Zhenhao, et autres
Publié: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
par: Cui, Yibo, et autres
Publié: (2025)
par: Cui, Yibo, et autres
Publié: (2025)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)
par: Duan, Yuchen, et autres
Publié: (2024)
Towards Understanding Multimodal Fine-Tuning: Spatial Features
par: Naghashyar, Lachin, et autres
Publié: (2026)
par: Naghashyar, Lachin, et autres
Publié: (2026)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
par: Ghosh, Dhruba, et autres
Publié: (2026)
par: Ghosh, Dhruba, et autres
Publié: (2026)
Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices
par: Lin, Junyan, et autres
Publié: (2025)
par: Lin, Junyan, et autres
Publié: (2025)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
par: Shi, Liang, et autres
Publié: (2024)
par: Shi, Liang, et autres
Publié: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
par: Duan, Yiqun, et autres
Publié: (2024)
par: Duan, Yiqun, et autres
Publié: (2024)
FILA: Fine-Grained Vision Language Models
par: Zhu, Shiding, et autres
Publié: (2024)
par: Zhu, Shiding, et autres
Publié: (2024)
Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
FG$^2$: Fine-Grained Cross-View Localization by Fine-Grained Feature Matching
par: Xia, Zimin, et autres
Publié: (2025)
par: Xia, Zimin, et autres
Publié: (2025)
SliceLens: Fine-Grained and Grounded Error Slice Discovery for Multi-Instance Vision Tasks
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
par: Kim, Namho, et autres
Publié: (2025)
par: Kim, Namho, et autres
Publié: (2025)
Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval
par: Lu, Xuan, et autres
Publié: (2026)
par: Lu, Xuan, et autres
Publié: (2026)
Documents similaires
-
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024) -
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024) -
MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
par: Wang, Ruoyu, et autres
Publié: (2024) -
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024) -
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
par: Peng, Wujian, et autres
Publié: (2023)