Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Junyan, Chen, Haoran, Fan, Yue, Fan, Yingqi, Jin, Xin, Su, Hui, Fu, Jinlan, Shen, Xiaoyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multimodal Language Models See Better When They Look Shallower
by: Chen, Haoran, et al.
Published: (2025)
by: Chen, Haoran, et al.
Published: (2025)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
by: Fan, Yingqi, et al.
Published: (2025)
by: Fan, Yingqi, et al.
Published: (2025)
LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encoding
by: Tong, Junlong, et al.
Published: (2025)
by: Tong, Junlong, et al.
Published: (2025)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
by: Fan, Yingqi, et al.
Published: (2026)
by: Fan, Yingqi, et al.
Published: (2026)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2024)
by: Lin, Junyan, et al.
Published: (2024)
SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling
by: Zhao, Anhao, et al.
Published: (2025)
by: Zhao, Anhao, et al.
Published: (2025)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
by: Zhao, Anhao, et al.
Published: (2026)
by: Zhao, Anhao, et al.
Published: (2026)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
by: Liu, Wenjie, et al.
Published: (2026)
by: Liu, Wenjie, et al.
Published: (2026)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
by: Fu, Jinlan, et al.
Published: (2025)
by: Fu, Jinlan, et al.
Published: (2025)
Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
by: Lin, Chenchen, et al.
Published: (2026)
by: Lin, Chenchen, et al.
Published: (2026)
BFA: Best-Feature-Aware Fusion for Multi-View Fine-grained Manipulation
by: Lan, Zihan, et al.
Published: (2025)
by: Lan, Zihan, et al.
Published: (2025)
Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism
by: Zhao, Anhao, et al.
Published: (2024)
by: Zhao, Anhao, et al.
Published: (2024)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2026)
by: Lin, Junyan, et al.
Published: (2026)
StreamingThinker: Large Language Models Can Think While Reading
by: Tong, Junlong, et al.
Published: (2025)
by: Tong, Junlong, et al.
Published: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
by: Chen, Qian, et al.
Published: (2026)
by: Chen, Qian, et al.
Published: (2026)
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
by: Zhu, Xuanyu, et al.
Published: (2026)
by: Zhu, Xuanyu, et al.
Published: (2026)
Multimodal Information Interaction for Medical Image Segmentation
by: Fan, Xinxin, et al.
Published: (2024)
by: Fan, Xinxin, et al.
Published: (2024)
CoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion
by: Liu, Jinyuan, et al.
Published: (2022)
by: Liu, Jinyuan, et al.
Published: (2022)
Multimodal Medical Image Fusion With UNet‐Based Multi‐Scale Transformer Networks
by: Qingwu Fu, et al.
Published: (2025)
by: Qingwu Fu, et al.
Published: (2025)
Visualizing High Entropy Alloy Spaces: Methods and Best Practices
by: Vela, Brent, et al.
Published: (2024)
by: Vela, Brent, et al.
Published: (2024)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
by: Li, Xu, et al.
Published: (2024)
by: Li, Xu, et al.
Published: (2024)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
by: Wu, Hao, et al.
Published: (2026)
by: Wu, Hao, et al.
Published: (2026)
Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion
by: Shen, Hui, et al.
Published: (2024)
by: Shen, Hui, et al.
Published: (2024)
Brief Report of Ocean Standards ,Metrology & Best Practices in China.
by: Jiang, Fan, et al.
Published: (2018)
by: Jiang, Fan, et al.
Published: (2018)
ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation
by: Lee, Chia-Ming, et al.
Published: (2026)
by: Lee, Chia-Ming, et al.
Published: (2026)
D2Fusion: Dual-domain Fusion with Feature Superposition for Deepfake Detection
by: Qiu, Xueqi, et al.
Published: (2025)
by: Qiu, Xueqi, et al.
Published: (2025)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
by: Shen, Lipeng, et al.
Published: (2024)
by: Shen, Lipeng, et al.
Published: (2024)
Sarah Frank-Wolfe: Methods for Constrained Optimization with Best Rates and Practical Features
by: Beznosikov, Aleksandr, et al.
Published: (2023)
by: Beznosikov, Aleksandr, et al.
Published: (2023)
Collaborative Knowledge Fusion: A Novel Approach for Multi-task Recommender Systems via LLMs
by: Zhao, Chuang, et al.
Published: (2024)
by: Zhao, Chuang, et al.
Published: (2024)
Best Practices for Experiments and Reports in Photocatalytic Methane Conversion
by: Yuheng Jiang, et al.
Published: (2024)
by: Yuheng Jiang, et al.
Published: (2024)
Best Practices for Experiments and Reports in Photocatalytic Methane Conversion
by: Yuheng Jiang, et al.
Published: (2024)
by: Yuheng Jiang, et al.
Published: (2024)
Cross-Enhanced Multimodal Fusion of Eye-Tracking and Facial Features for Alzheimer's Disease Diagnosis
by: Nie, Yujie, et al.
Published: (2025)
by: Nie, Yujie, et al.
Published: (2025)
CogDrive: Cognition-Driven Multimodal Prediction-Planning Fusion for Safe Autonomy
by: Huang, Heye, et al.
Published: (2025)
by: Huang, Heye, et al.
Published: (2025)
ME-Mamba: Multi-Expert Mamba with Efficient Knowledge Capture and Fusion for Multimodal Survival Analysis
by: Zhang, Chengsheng, et al.
Published: (2025)
by: Zhang, Chengsheng, et al.
Published: (2025)
Differentiation of Distinct Single Atoms via Multi-Defocus Fusion Method
by: Li, Yangfan, et al.
Published: (2025)
by: Li, Yangfan, et al.
Published: (2025)
General LLMs as Instructors for Domain-Specific LLMs: A Sequential Fusion Method to Integrate Extraction and Editing
by: Zhang, Xin, et al.
Published: (2024)
by: Zhang, Xin, et al.
Published: (2024)
Automated, Cross-Layer Root Cause Analysis of 5G Video-Conferencing Quality Degradation
by: Yi, Fan, et al.
Published: (2025)
by: Yi, Fan, et al.
Published: (2025)
A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition
by: Shen, Yaomin, et al.
Published: (2025)
by: Shen, Yaomin, et al.
Published: (2025)
Placing Theory into Practice: An Exploration of Library Services to Distance Learners at Jacksonville State University
by: Tang, Yingqi
Published: (2009)
by: Tang, Yingqi
Published: (2009)
IRDFusion: Iterative Relation-Map Difference guided Feature Fusion for Multispectral Object Detection
by: Shen, Jifeng, et al.
Published: (2025)
by: Shen, Jifeng, et al.
Published: (2025)
Similar Items
-
Multimodal Language Models See Better When They Look Shallower
by: Chen, Haoran, et al.
Published: (2025) -
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
by: Fan, Yingqi, et al.
Published: (2025) -
LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encoding
by: Tong, Junlong, et al.
Published: (2025) -
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
by: Fan, Yingqi, et al.
Published: (2026) -
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2024)