Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Ailin, Cao, Tri, Chen, Zhirui, Hooi, Bryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
di: Wang, Zihang, et al.
Pubblicazione: (2026)
di: Wang, Zihang, et al.
Pubblicazione: (2026)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models
di: Tsangko, Iosif, et al.
Pubblicazione: (2026)
di: Tsangko, Iosif, et al.
Pubblicazione: (2026)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
IRR: Image Review Ranking Framework for Evaluating Vision-Language Models
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
di: Poppi, Samuele, et al.
Pubblicazione: (2023)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
di: Han, Jiaming, et al.
Pubblicazione: (2025)
di: Han, Jiaming, et al.
Pubblicazione: (2025)
Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
Text-Only Data Synthesis for Vision Language Model Training
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Show Me the World in My Language: Establishing the First Baseline for Scene-Text to Scene-Text Translation
di: Vaidya, Shreyas, et al.
Pubblicazione: (2023)
di: Vaidya, Shreyas, et al.
Pubblicazione: (2023)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
di: Han, Wei, et al.
Pubblicazione: (2023)
di: Han, Wei, et al.
Pubblicazione: (2023)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
The Revolution of Multimodal Large Language Models: A Survey
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
di: Jiang, Chen, et al.
Pubblicazione: (2023)
di: Jiang, Chen, et al.
Pubblicazione: (2023)
KAN Text to Vision? The Exploration of Kolmogorov-Arnold Networks for Multi-Scale Sequence-Based Pose Animation from Sign Language Notation
di: Du, Guanyi, et al.
Pubblicazione: (2026)
di: Du, Guanyi, et al.
Pubblicazione: (2026)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
AToken: A Unified Tokenizer for Vision
di: Lu, Jiasen, et al.
Pubblicazione: (2025)
di: Lu, Jiasen, et al.
Pubblicazione: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
di: Song, Shezheng, et al.
Pubblicazione: (2023)
di: Song, Shezheng, et al.
Pubblicazione: (2023)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
di: Mattioli, Gabriele, et al.
Pubblicazione: (2026)
di: Mattioli, Gabriele, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024) -
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
di: Wu, Jiaying, et al.
Pubblicazione: (2025) -
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025) -
Causal Graphical Models for Vision-Language Compositional Understanding
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024) -
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
di: Wang, Zihang, et al.
Pubblicazione: (2026)