On the Out-Of-Distribution Generalization of Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xingxuan, Li, Jiansheng, Chu, Wenjing, Hai, Junjia, Xu, Renzhe, Yang, Yuqing, Guan, Shikai, Xu, Jiazheng, Cui, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
por: Li, Jiansheng, et al.
Publicado: (2025)
por: Li, Jiansheng, et al.
Publicado: (2025)
Rethinking the Evaluation Protocol of Domain Generalization
por: Yu, Han, et al.
Publicado: (2023)
por: Yu, Han, et al.
Publicado: (2023)
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
por: Xu, Haoran, et al.
Publicado: (2026)
por: Xu, Haoran, et al.
Publicado: (2026)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
por: Lin, Ci-Siang, et al.
Publicado: (2025)
por: Lin, Ci-Siang, et al.
Publicado: (2025)
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
por: Huang, K, et al.
Publicado: (2024)
por: Huang, K, et al.
Publicado: (2024)
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
por: Liu, Siqi, et al.
Publicado: (2026)
por: Liu, Siqi, et al.
Publicado: (2026)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
por: Zhang, YiFan, et al.
Publicado: (2024)
por: Zhang, YiFan, et al.
Publicado: (2024)
ITP: Instance-Aware Test Pruning for Out-of-Distribution Detection
por: Xu, Haonan, et al.
Publicado: (2024)
por: Xu, Haonan, et al.
Publicado: (2024)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
por: Xu, Hai-Ming, et al.
Publicado: (2024)
por: Xu, Hai-Ming, et al.
Publicado: (2024)
T2MBench: A Benchmark for Out-of-Distribution Text-to-Motion Generation
por: Yang, Bin, et al.
Publicado: (2026)
por: Yang, Bin, et al.
Publicado: (2026)
Greit-HRNet: Grouped Lightweight High-Resolution Network for Human Pose Estimation
por: Han, Junjia
Publicado: (2024)
por: Han, Junjia
Publicado: (2024)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
por: Lei, Lei, et al.
Publicado: (2025)
por: Lei, Lei, et al.
Publicado: (2025)
Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection
por: Lee, Pei-Kang, et al.
Publicado: (2025)
por: Lee, Pei-Kang, et al.
Publicado: (2025)
OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models
por: Lin, Ling, et al.
Publicado: (2026)
por: Lin, Ling, et al.
Publicado: (2026)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models
por: Yu, Gaotong, et al.
Publicado: (2024)
por: Yu, Gaotong, et al.
Publicado: (2024)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
por: Peng, Jihua, et al.
Publicado: (2025)
por: Peng, Jihua, et al.
Publicado: (2025)
Shaping Parameter Contribution Patterns for Out-of-Distribution Detection
por: Xu, Haonan, et al.
Publicado: (2026)
por: Xu, Haonan, et al.
Publicado: (2026)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024)
por: Shen, Leyang, et al.
Publicado: (2024)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
por: Wang, Ziyue, et al.
Publicado: (2024)
por: Wang, Ziyue, et al.
Publicado: (2024)
BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model
por: Li, Yujie, et al.
Publicado: (2025)
por: Li, Yujie, et al.
Publicado: (2025)
Generating Out-Of-Distribution Scenarios Using Language Models
por: Aasi, Erfan, et al.
Publicado: (2024)
por: Aasi, Erfan, et al.
Publicado: (2024)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
por: Huang, Yuhang, et al.
Publicado: (2024)
por: Huang, Yuhang, et al.
Publicado: (2024)
Weight Averaging for Out-of-Distribution Generalization and Few-Shot Domain Adaptation
por: Xu, Shijian
Publicado: (2025)
por: Xu, Shijian
Publicado: (2025)
Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language Models
por: He, Zhixia, et al.
Publicado: (2025)
por: He, Zhixia, et al.
Publicado: (2025)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
por: Hu, Lulu, et al.
Publicado: (2026)
por: Hu, Lulu, et al.
Publicado: (2026)
DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
por: He, Yulin, et al.
Publicado: (2026)
por: He, Yulin, et al.
Publicado: (2026)
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
por: Xu, Dunyuan, et al.
Publicado: (2025)
por: Xu, Dunyuan, et al.
Publicado: (2025)
Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
por: Yang, Zhongyu, et al.
Publicado: (2025)
por: Yang, Zhongyu, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
DreamOmni3: Scribble-based Editing and Generation
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
por: Wang, Guankun, et al.
Publicado: (2025)
por: Wang, Guankun, et al.
Publicado: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
por: Dongfang, Zihao, et al.
Publicado: (2025)
por: Dongfang, Zihao, et al.
Publicado: (2025)
Backdooring Vision-Language Models with Out-Of-Distribution Data
por: Lyu, Weimin, et al.
Publicado: (2024)
por: Lyu, Weimin, et al.
Publicado: (2024)
Large Language Model-Driven Distributed Integrated Multimodal Sensing and Semantic Communications
por: Peng, Yubo, et al.
Publicado: (2025)
por: Peng, Yubo, et al.
Publicado: (2025)
LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
por: Yao, Ruilin, et al.
Publicado: (2025)
por: Yao, Ruilin, et al.
Publicado: (2025)
LLM-AD: Large Language Model based Audio Description System
por: Chu, Peng, et al.
Publicado: (2024)
por: Chu, Peng, et al.
Publicado: (2024)
Advancing Out-of-Distribution Detection through Data Purification and Dynamic Activation Function Design
por: Ji, Yingrui, et al.
Publicado: (2024)
por: Ji, Yingrui, et al.
Publicado: (2024)
Ejemplares similares
-
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
por: Li, Jiansheng, et al.
Publicado: (2025) -
Rethinking the Evaluation Protocol of Domain Generalization
por: Yu, Han, et al.
Publicado: (2023) -
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
por: Xu, Haoran, et al.
Publicado: (2026) -
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
por: Lin, Ci-Siang, et al.
Publicado: (2025) -
Out-of-Distribution Detection Using Peer-Class Generated by Large Language Model
por: Huang, K, et al.
Publicado: (2024)