Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jingrui, Liang, Feng, Zhang, Yong, Wang, Wei, Zeng, Runhao, Hu, Xiping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
Distilled Large Language Model-Driven Dynamic Sparse Expert Activation Mechanism
di: Chen, Qinghui, et al.
Pubblicazione: (2026)
di: Chen, Qinghui, et al.
Pubblicazione: (2026)
Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
Preventing Shortcuts in Adapter Training via Providing the Shortcuts
di: Goyal, Anujraaj Argo, et al.
Pubblicazione: (2025)
di: Goyal, Anujraaj Argo, et al.
Pubblicazione: (2025)
Speculative Decoding Reimagined for Multimodal Large Language Models
di: Lin, Luxi, et al.
Pubblicazione: (2025)
di: Lin, Luxi, et al.
Pubblicazione: (2025)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
Temporal Action Detection Model Compression by Progressive Block Drop
di: Chen, Xiaoyong, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyong, et al.
Pubblicazione: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis
di: Liang, Kaidi, et al.
Pubblicazione: (2025)
di: Liang, Kaidi, et al.
Pubblicazione: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
di: She, Yifei, et al.
Pubblicazione: (2025)
di: She, Yifei, et al.
Pubblicazione: (2025)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
di: Jiang, Xi, et al.
Pubblicazione: (2024)
di: Jiang, Xi, et al.
Pubblicazione: (2024)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
di: Wang, Jiale, et al.
Pubblicazione: (2026)
di: Wang, Jiale, et al.
Pubblicazione: (2026)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
di: Xie, Xudong, et al.
Pubblicazione: (2024)
di: Xie, Xudong, et al.
Pubblicazione: (2024)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
di: Zhu, Zihao, et al.
Pubblicazione: (2023)
di: Zhu, Zihao, et al.
Pubblicazione: (2023)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
Exploring Perceptual Limitation of Multimodal Large Language Models
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
di: Yu, JiangYong, et al.
Pubblicazione: (2025)
di: Yu, JiangYong, et al.
Pubblicazione: (2025)
Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models
di: Alnaasan, Manar, et al.
Pubblicazione: (2025)
di: Alnaasan, Manar, et al.
Pubblicazione: (2025)
Contextual Object Detection with Multimodal Large Language Models
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
di: Mei, Guofeng, et al.
Pubblicazione: (2026)
di: Mei, Guofeng, et al.
Pubblicazione: (2026)
XiHeFusion: Harnessing Large Language Models for Science Communication in Nuclear Fusion
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models
di: Zhang, Zhen, et al.
Pubblicazione: (2026) -
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024) -
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
di: Chen, Jian, et al.
Pubblicazione: (2025) -
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
di: Li, Jiaqi, et al.
Pubblicazione: (2024) -
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
di: Zeng, Xingchen, et al.
Pubblicazione: (2024)