Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | She, Yifei, Wu, Huangxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
par: Chen, Jiuhai, et autres
Publié: (2024)
par: Chen, Jiuhai, et autres
Publié: (2024)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
par: Chen, Zhuokun, et autres
Publié: (2024)
par: Chen, Zhuokun, et autres
Publié: (2024)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
par: Ma, Longhui, et autres
Publié: (2026)
par: Ma, Longhui, et autres
Publié: (2026)
StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
par: Li, Bingyu, et autres
Publié: (2024)
par: Li, Bingyu, et autres
Publié: (2024)
Real-Time Fusion of Visual and Chart Data for Enhanced Maritime Vision
par: Kreis, Marten, et autres
Publié: (2025)
par: Kreis, Marten, et autres
Publié: (2025)
Progressive Feature Fusion Network for Enhancing Image Quality Assessment
par: Wu, Kaiqun, et autres
Publié: (2024)
par: Wu, Kaiqun, et autres
Publié: (2024)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
par: Li, Kevin, et autres
Publié: (2025)
par: Li, Kevin, et autres
Publié: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
par: Zhang, Jingrui, et autres
Publié: (2026)
par: Zhang, Jingrui, et autres
Publié: (2026)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
par: Awan, Mahrukh, et autres
Publié: (2024)
par: Awan, Mahrukh, et autres
Publié: (2024)
XiHeFusion: Harnessing Large Language Models for Science Communication in Nuclear Fusion
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models
par: Ghatkesar, Aarti, et autres
Publié: (2025)
par: Ghatkesar, Aarti, et autres
Publié: (2025)
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion
par: Liu, Pei, et autres
Publié: (2025)
par: Liu, Pei, et autres
Publié: (2025)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
par: Wu, Wenfang, et autres
Publié: (2025)
par: Wu, Wenfang, et autres
Publié: (2025)
Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation
par: Cho, Yubin, et autres
Publié: (2024)
par: Cho, Yubin, et autres
Publié: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
par: Li, Qifei, et autres
Publié: (2024)
par: Li, Qifei, et autres
Publié: (2024)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
par: Zhang, Yinghui, et autres
Publié: (2025)
par: Zhang, Yinghui, et autres
Publié: (2025)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
par: Hu, Juewen, et autres
Publié: (2025)
par: Hu, Juewen, et autres
Publié: (2025)
Multimodal Fusion SLAM with Fourier Attention
par: Zhou, Youjie, et autres
Publié: (2025)
par: Zhou, Youjie, et autres
Publié: (2025)
A Proxy Consistency Loss for Grounded Fusion of Earth Observation and Location Encoders
par: Wang, Zhongying, et autres
Publié: (2026)
par: Wang, Zhongying, et autres
Publié: (2026)
A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection
par: Sgaravatti, Carlo, et autres
Publié: (2025)
par: Sgaravatti, Carlo, et autres
Publié: (2025)
Application of Multimodal Fusion Deep Learning Model in Disease Recognition
par: Liu, Xiaoyi, et autres
Publié: (2024)
par: Liu, Xiaoyi, et autres
Publié: (2024)
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
par: Dang, Yunkai, et autres
Publié: (2026)
par: Dang, Yunkai, et autres
Publié: (2026)
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
par: Wang, Sheng
Publié: (2025)
par: Wang, Sheng
Publié: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
par: Bigverdi, Mahtab, et autres
Publié: (2024)
par: Bigverdi, Mahtab, et autres
Publié: (2024)
Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework
par: Zhang, Xuejian, et autres
Publié: (2026)
par: Zhang, Xuejian, et autres
Publié: (2026)
Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models
par: Alnaasan, Manar, et autres
Publié: (2025)
par: Alnaasan, Manar, et autres
Publié: (2025)
Explaining How Visual, Textual and Multimodal Encoders Share Concepts
par: Cornet, Clément, et autres
Publié: (2025)
par: Cornet, Clément, et autres
Publié: (2025)
Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion
par: Rawal, Ishaan Singh, et autres
Publié: (2023)
par: Rawal, Ishaan Singh, et autres
Publié: (2023)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
par: Villa, Andrés, et autres
Publié: (2025)
par: Villa, Andrés, et autres
Publié: (2025)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks
par: Guo, Yachan, et autres
Publié: (2026)
par: Guo, Yachan, et autres
Publié: (2026)
PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association
par: Hannan, Abdul, et autres
Publié: (2025)
par: Hannan, Abdul, et autres
Publié: (2025)
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
par: Yang, Shuonan, et autres
Publié: (2025)
par: Yang, Shuonan, et autres
Publié: (2025)
Multimodal and Multiview Deep Fusion for Autonomous Marine Navigation
par: Dagdilelis, Dimitrios, et autres
Publié: (2025)
par: Dagdilelis, Dimitrios, et autres
Publié: (2025)
Knowledge Fusion By Evolving Weights of Language Models
par: Du, Guodong, et autres
Publié: (2024)
par: Du, Guodong, et autres
Publié: (2024)
Multimodal Fusion with Pre-Trained Model Features in Affective Behaviour Analysis In-the-wild
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
par: Wang, Jiale, et autres
Publié: (2026)
par: Wang, Jiale, et autres
Publié: (2026)
MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval
par: Ju, Yeong-Joon, et autres
Publié: (2024)
par: Ju, Yeong-Joon, et autres
Publié: (2024)
Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion
par: Zhou, Meng, et autres
Publié: (2024)
par: Zhou, Meng, et autres
Publié: (2024)
Documents similaires
-
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
par: Chen, Jiuhai, et autres
Publié: (2024) -
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
par: Chen, Zhuokun, et autres
Publié: (2024) -
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
par: Ma, Longhui, et autres
Publié: (2026) -
StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
par: Li, Bingyu, et autres
Publié: (2024) -
Real-Time Fusion of Visual and Chart Data for Enhanced Maritime Vision
par: Kreis, Marten, et autres
Publié: (2025)