On the Out-Of-Distribution Generalization of Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xingxuan, Li, Jiansheng, Chu, Wenjing, Hai, Junjia, Xu, Renzhe, Yang, Yuqing, Guan, Shikai, Xu, Jiazheng, Cui, Peng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
di: Li, Jiansheng, et al.
Pubblicazione: (2025)
di: Li, Jiansheng, et al.
Pubblicazione: (2025)
Rethinking the Evaluation Protocol of Domain Generalization
di: Yu, Han, et al.
Pubblicazione: (2023)
di: Yu, Han, et al.
Pubblicazione: (2023)
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025)
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
di: Huang, K, et al.
Pubblicazione: (2024)
di: Huang, K, et al.
Pubblicazione: (2024)
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
di: Liu, Siqi, et al.
Pubblicazione: (2026)
di: Liu, Siqi, et al.
Pubblicazione: (2026)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
ITP: Instance-Aware Test Pruning for Out-of-Distribution Detection
di: Xu, Haonan, et al.
Pubblicazione: (2024)
di: Xu, Haonan, et al.
Pubblicazione: (2024)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
di: Xu, Hai-Ming, et al.
Pubblicazione: (2024)
di: Xu, Hai-Ming, et al.
Pubblicazione: (2024)
T2MBench: A Benchmark for Out-of-Distribution Text-to-Motion Generation
di: Yang, Bin, et al.
Pubblicazione: (2026)
di: Yang, Bin, et al.
Pubblicazione: (2026)
Greit-HRNet: Grouped Lightweight High-Resolution Network for Human Pose Estimation
di: Han, Junjia
Pubblicazione: (2024)
di: Han, Junjia
Pubblicazione: (2024)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
di: Lei, Lei, et al.
Pubblicazione: (2025)
di: Lei, Lei, et al.
Pubblicazione: (2025)
Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection
di: Lee, Pei-Kang, et al.
Pubblicazione: (2025)
di: Lee, Pei-Kang, et al.
Pubblicazione: (2025)
OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models
di: Lin, Ling, et al.
Pubblicazione: (2026)
di: Lin, Ling, et al.
Pubblicazione: (2026)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models
di: Yu, Gaotong, et al.
Pubblicazione: (2024)
di: Yu, Gaotong, et al.
Pubblicazione: (2024)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
di: Peng, Jihua, et al.
Pubblicazione: (2025)
di: Peng, Jihua, et al.
Pubblicazione: (2025)
Shaping Parameter Contribution Patterns for Out-of-Distribution Detection
di: Xu, Haonan, et al.
Pubblicazione: (2026)
di: Xu, Haonan, et al.
Pubblicazione: (2026)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
di: Shen, Leyang, et al.
Pubblicazione: (2024)
di: Shen, Leyang, et al.
Pubblicazione: (2024)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
di: Wang, Ziyue, et al.
Pubblicazione: (2024)
di: Wang, Ziyue, et al.
Pubblicazione: (2024)
BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model
di: Li, Yujie, et al.
Pubblicazione: (2025)
di: Li, Yujie, et al.
Pubblicazione: (2025)
Generating Out-Of-Distribution Scenarios Using Language Models
di: Aasi, Erfan, et al.
Pubblicazione: (2024)
di: Aasi, Erfan, et al.
Pubblicazione: (2024)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
Weight Averaging for Out-of-Distribution Generalization and Few-Shot Domain Adaptation
di: Xu, Shijian
Pubblicazione: (2025)
di: Xu, Shijian
Pubblicazione: (2025)
Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language Models
di: He, Zhixia, et al.
Pubblicazione: (2025)
di: He, Zhixia, et al.
Pubblicazione: (2025)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
di: Hu, Lulu, et al.
Pubblicazione: (2026)
di: Hu, Lulu, et al.
Pubblicazione: (2026)
DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
di: He, Yulin, et al.
Pubblicazione: (2026)
di: He, Yulin, et al.
Pubblicazione: (2026)
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
di: Xu, Dunyuan, et al.
Pubblicazione: (2025)
Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
di: Yang, Zhongyu, et al.
Pubblicazione: (2025)
di: Yang, Zhongyu, et al.
Pubblicazione: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
di: Yang, Shuai, et al.
Pubblicazione: (2024)
di: Yang, Shuai, et al.
Pubblicazione: (2024)
DreamOmni3: Scribble-based Editing and Generation
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
di: Wang, Guankun, et al.
Pubblicazione: (2025)
di: Wang, Guankun, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
Backdooring Vision-Language Models with Out-Of-Distribution Data
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
Large Language Model-Driven Distributed Integrated Multimodal Sensing and Semantic Communications
di: Peng, Yubo, et al.
Pubblicazione: (2025)
di: Peng, Yubo, et al.
Pubblicazione: (2025)
LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
di: Yao, Ruilin, et al.
Pubblicazione: (2025)
di: Yao, Ruilin, et al.
Pubblicazione: (2025)
LLM-AD: Large Language Model based Audio Description System
di: Chu, Peng, et al.
Pubblicazione: (2024)
di: Chu, Peng, et al.
Pubblicazione: (2024)
Advancing Out-of-Distribution Detection through Data Purification and Dynamic Activation Function Design
di: Ji, Yingrui, et al.
Pubblicazione: (2024)
di: Ji, Yingrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
di: Li, Jiansheng, et al.
Pubblicazione: (2025) -
Rethinking the Evaluation Protocol of Domain Generalization
di: Yu, Han, et al.
Pubblicazione: (2023) -
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
di: Xu, Haoran, et al.
Pubblicazione: (2026) -
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
di: Lin, Ci-Siang, et al.
Pubblicazione: (2025) -
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
di: Huang, K, et al.
Pubblicazione: (2024)