Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yichi, Dong, Yinpeng, Zhang, Siyuan, Min, Tianzan, Su, Hang, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
par: Chen, Huanran, et autres
Publié: (2023)
par: Chen, Huanran, et autres
Publié: (2023)
Exploring Perceptual Limitation of Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2024)
par: Zhang, Jiarui, et autres
Publié: (2024)
Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
par: Wu, Lingxuan, et autres
Publié: (2024)
par: Wu, Lingxuan, et autres
Publié: (2024)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Prompt Your Brain: Scaffold Prompt Tuning for Efficient Adaptation of fMRI Pre-trained Model
par: Dong, Zijian, et autres
Publié: (2024)
par: Dong, Zijian, et autres
Publié: (2024)
A Comprehensive Survey of Continual Learning: Theory, Method and Application
par: Wang, Liyuan, et autres
Publié: (2023)
par: Wang, Liyuan, et autres
Publié: (2023)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
Visual Generation Without Guidance
par: Chen, Huayu, et autres
Publié: (2025)
par: Chen, Huayu, et autres
Publié: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
par: Yoon, Hyungjun, et autres
Publié: (2024)
par: Yoon, Hyungjun, et autres
Publié: (2024)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
par: Wei, Xingxing, et autres
Publié: (2024)
par: Wei, Xingxing, et autres
Publié: (2024)
Scaling Laws for Black box Adversarial Attacks
par: Liu, Chuan, et autres
Publié: (2024)
par: Liu, Chuan, et autres
Publié: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
Exploring Task-Level Optimal Prompts for Visual In-Context Learning
par: Zhu, Yan, et autres
Publié: (2025)
par: Zhu, Yan, et autres
Publié: (2025)
RCR-AF: Enhancing Model Generalization via Rademacher Complexity Reduction Activation Function
par: Yu, Yunrui, et autres
Publié: (2025)
par: Yu, Yunrui, et autres
Publié: (2025)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
par: Liu, Zhongye, et autres
Publié: (2024)
par: Liu, Zhongye, et autres
Publié: (2024)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
par: Alvar, Saeed Ranjbar, et autres
Publié: (2025)
par: Alvar, Saeed Ranjbar, et autres
Publié: (2025)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2024)
par: Zhang, Yabin, et autres
Publié: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
par: Gupta, Sunny, et autres
Publié: (2026)
par: Gupta, Sunny, et autres
Publié: (2026)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
par: Zhu, Zihao, et autres
Publié: (2023)
par: Zhu, Zihao, et autres
Publié: (2023)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
par: Kang, Caixin, et autres
Publié: (2023)
par: Kang, Caixin, et autres
Publié: (2023)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
par: Miao, Yanting, et autres
Publié: (2026)
par: Miao, Yanting, et autres
Publié: (2026)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
par: Ding, Meiwen, et autres
Publié: (2026)
par: Ding, Meiwen, et autres
Publié: (2026)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
par: Muhtar, Dilxat, et autres
Publié: (2024)
par: Muhtar, Dilxat, et autres
Publié: (2024)
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
par: Tang, Mingni, et autres
Publié: (2025)
par: Tang, Mingni, et autres
Publié: (2025)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
par: Zhu, Yanxu, et autres
Publié: (2025)
par: Zhu, Yanxu, et autres
Publié: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
par: Bigverdi, Mahtab, et autres
Publié: (2024)
par: Bigverdi, Mahtab, et autres
Publié: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
par: Chen, Xiaohui, et autres
Publié: (2024)
par: Chen, Xiaohui, et autres
Publié: (2024)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
par: Cao, Shengcao, et autres
Publié: (2024)
par: Cao, Shengcao, et autres
Publié: (2024)
Documents similaires
-
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024) -
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
par: Chen, Huanran, et autres
Publié: (2023) -
Exploring Perceptual Limitation of Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2024) -
Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
par: Wu, Lingxuan, et autres
Publié: (2024) -
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)