Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Xin, Ni, Haomiao, Zhang, Yunbei, Hamm, Jihun, Li, Zechen, Ding, Zhengming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback
por: Wang, Janet, et al.
Publicado: (2025)
por: Wang, Janet, et al.
Publicado: (2025)
Achieving Reliable and Fair Skin Lesion Diagnosis via Unsupervised Domain Adaptation
por: Wang, Janet, et al.
Publicado: (2023)
por: Wang, Janet, et al.
Publicado: (2023)
OT-VP: Optimal Transport-guided Visual Prompting for Test-Time Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2024)
por: Zhang, Yunbei, et al.
Publicado: (2024)
From Majority to Minority: A Diffusion-based Augmentation for Underrepresented Groups in Skin Lesion Analysis
por: Wang, Janet, et al.
Publicado: (2024)
por: Wang, Janet, et al.
Publicado: (2024)
Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2026)
por: Zhang, Yunbei, et al.
Publicado: (2026)
Enhancing Skin Disease Diagnosis: Interpretable Visual Concept Discovery with SAM
por: Hu, Xin, et al.
Publicado: (2024)
por: Hu, Xin, et al.
Publicado: (2024)
DPCore: Dynamic Prompt Coreset for Continual Test-Time Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2024)
por: Zhang, Yunbei, et al.
Publicado: (2024)
SoK: Can Synthetic Images Replace Real Data? A Survey of Utility and Privacy of Synthetic Image Generation
por: Chung, Yunsung, et al.
Publicado: (2025)
por: Chung, Yunsung, et al.
Publicado: (2025)
Adapting in the Dark: Efficient and Stable Test-Time Adaptation for Black-Box Models
por: Zhang, Yunbei, et al.
Publicado: (2026)
por: Zhang, Yunbei, et al.
Publicado: (2026)
Interactive Text-to-Image Retrieval with Large Language Models: A Plug-and-Play Approach
por: Lee, Saehyung, et al.
Publicado: (2024)
por: Lee, Saehyung, et al.
Publicado: (2024)
Visual Variational Autoencoder Prompt Tuning
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024)
por: Chen, Jiaxing, et al.
Publicado: (2024)
Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
por: Zhang, Yunbei, et al.
Publicado: (2026)
por: Zhang, Yunbei, et al.
Publicado: (2026)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
por: Xiong, Minhao, et al.
Publicado: (2025)
por: Xiong, Minhao, et al.
Publicado: (2025)
Plug-and-Play Posterior Sampling for Blind Inverse Problems
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
Visual Instance-aware Prompt Tuning
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
Prompt-based Adaptation in Large-scale Vision Models: A Survey
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
See Further When Clear: Curriculum Consistency Model
por: Liu, Yunpeng, et al.
Publicado: (2024)
por: Liu, Yunpeng, et al.
Publicado: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
por: Luo, Katie, et al.
Publicado: (2025)
por: Luo, Katie, et al.
Publicado: (2025)
VLMs Guided Interpretable Decision Making for Autonomous Driving
por: Hu, Xin, et al.
Publicado: (2025)
por: Hu, Xin, et al.
Publicado: (2025)
Seeing Cells Clearly: Evaluating Machine Vision Strategies for Microglia Centroid Detection in 3D Images
por: Zhang, Youjia
Publicado: (2025)
por: Zhang, Youjia
Publicado: (2025)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
CBNet: A Plug-and-Play Network for Segmentation-Based Scene Text Detection
por: Zhao, Xi, et al.
Publicado: (2022)
por: Zhao, Xi, et al.
Publicado: (2022)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
por: Peng, Shuai, et al.
Publicado: (2024)
por: Peng, Shuai, et al.
Publicado: (2024)
Plug-and-Play Diffusion Distillation
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment
por: Li, Yuan, et al.
Publicado: (2025)
por: Li, Yuan, et al.
Publicado: (2025)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
por: Liu, Yexin, et al.
Publicado: (2024)
por: Liu, Yexin, et al.
Publicado: (2024)
Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models
por: Huang, Gexin, et al.
Publicado: (2026)
por: Huang, Gexin, et al.
Publicado: (2026)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
por: Li, Senmao, et al.
Publicado: (2025)
por: Li, Senmao, et al.
Publicado: (2025)
Momentum Guidance: Plug-and-Play Guidance for Flow Models
por: Liao, Runlong, et al.
Publicado: (2026)
por: Liao, Runlong, et al.
Publicado: (2026)
Vision-Language Models Can't See the Obvious
por: Dahou, Yasser, et al.
Publicado: (2025)
por: Dahou, Yasser, et al.
Publicado: (2025)
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
por: Tao, Keda, et al.
Publicado: (2025)
por: Tao, Keda, et al.
Publicado: (2025)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
por: Sun, Jintao, et al.
Publicado: (2026)
por: Sun, Jintao, et al.
Publicado: (2026)
A Plug-and-Play Framework for Volumetric Light-Sheet Image Reconstruction
por: Gong, Yi, et al.
Publicado: (2025)
por: Gong, Yi, et al.
Publicado: (2025)
Ejemplares similares
-
Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback
por: Wang, Janet, et al.
Publicado: (2025) -
Achieving Reliable and Fair Skin Lesion Diagnosis via Unsupervised Domain Adaptation
por: Wang, Janet, et al.
Publicado: (2023) -
OT-VP: Optimal Transport-guided Visual Prompting for Test-Time Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2024) -
From Majority to Minority: A Diffusion-based Augmentation for Underrepresented Groups in Skin Lesion Analysis
por: Wang, Janet, et al.
Publicado: (2024) -
Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2026)