Promptception: How Sensitive Are Large Multimodal Models to Prompts?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ismithdeen, Mohamed Insaf, Khattak, Muhammad Uzair, Khan, Salman |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AIN: The Arabic INclusive Large Multimodal Model
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
WorldCache: Content-Aware Caching for Accelerated Video World Models
par: Nawaz, Umair, et autres
Publié: (2026)
par: Nawaz, Umair, et autres
Publié: (2026)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
par: Yoon, Hyungjun, et autres
Publié: (2024)
par: Yoon, Hyungjun, et autres
Publié: (2024)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
par: Salman, Shaeke, et autres
Publié: (2024)
par: Salman, Shaeke, et autres
Publié: (2024)
A Survey on Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
A Multimodal Memes Classification: A Survey and Open Research Issues
par: Afridi, Tariq Habib, et autres
Publié: (2020)
par: Afridi, Tariq Habib, et autres
Publié: (2020)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
par: Lee, Sua, et autres
Publié: (2025)
par: Lee, Sua, et autres
Publié: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
par: Wang, Hengyi, et autres
Publié: (2024)
par: Wang, Hengyi, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
A Concept-Based Explainability Framework for Large Multimodal Models
par: Parekh, Jayneel, et autres
Publié: (2024)
par: Parekh, Jayneel, et autres
Publié: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
Many-Shot In-Context Learning in Multimodal Foundation Models
par: Jiang, Yixing, et autres
Publié: (2024)
par: Jiang, Yixing, et autres
Publié: (2024)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
par: Aqeel, Muhammad, et autres
Publié: (2026)
par: Aqeel, Muhammad, et autres
Publié: (2026)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
par: Jiang, Ruixiang, et autres
Publié: (2024)
par: Jiang, Ruixiang, et autres
Publié: (2024)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
par: Ma, Chuofan, et autres
Publié: (2024)
par: Ma, Chuofan, et autres
Publié: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Adapting Large Multimodal Models to Distribution Shifts: The Role of In-Context Learning
par: Zhou, Guanglin, et autres
Publié: (2024)
par: Zhou, Guanglin, et autres
Publié: (2024)
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
par: Liu, Chenxi, et autres
Publié: (2025)
par: Liu, Chenxi, et autres
Publié: (2025)
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025)
par: Mei, Jingbiao, et autres
Publié: (2025)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
par: Srivastava, Varun, et autres
Publié: (2025)
par: Srivastava, Varun, et autres
Publié: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume
par: Lau, Gregory Kang Ruey, et autres
Publié: (2026)
par: Lau, Gregory Kang Ruey, et autres
Publié: (2026)
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models
par: Yiu, Eunice, et autres
Publié: (2024)
par: Yiu, Eunice, et autres
Publié: (2024)
SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions
par: Horawalavithana, Sameera, et autres
Publié: (2023)
par: Horawalavithana, Sameera, et autres
Publié: (2023)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
par: Deng, Shijian, et autres
Publié: (2024)
par: Deng, Shijian, et autres
Publié: (2024)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
par: Chen, Zijun, et autres
Publié: (2024)
par: Chen, Zijun, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Documents similaires
-
AIN: The Arabic INclusive Large Multimodal Model
par: Heakl, Ahmed, et autres
Publié: (2025) -
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023) -
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024) -
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025) -
WorldCache: Content-Aware Caching for Accelerated Video World Models
par: Nawaz, Umair, et autres
Publié: (2026)