FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tong, Chaodong, Zhang, Qi, Li, Chen, Jiang, Lei, Liu, Yanbing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Faithfulness of Visual Thinking: Measurement and Enhancement
par: Liu, Zujing, et autres
Publié: (2025)
par: Liu, Zujing, et autres
Publié: (2025)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026)
par: Yang, Junqi, et autres
Publié: (2026)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
par: Tong, Lei, et autres
Publié: (2025)
par: Tong, Lei, et autres
Publié: (2025)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
SAM-Sode: Towards Faithful Explanations for Tiny Bacteria Detection
par: Tan, Wanying, et autres
Publié: (2026)
par: Tan, Wanying, et autres
Publié: (2026)
FaithFill: Faithful Inpainting for Object Completion Using a Single Reference Image
par: Mallick, Rupayan, et autres
Publié: (2024)
par: Mallick, Rupayan, et autres
Publié: (2024)
Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations
par: Ding, Sihao, et autres
Publié: (2025)
par: Ding, Sihao, et autres
Publié: (2025)
FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
par: Wang, Yuanzhi, et autres
Publié: (2026)
par: Wang, Yuanzhi, et autres
Publié: (2026)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
par: Özdemir, Övgü, et autres
Publié: (2024)
par: Özdemir, Övgü, et autres
Publié: (2024)
Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases
par: Zhu, Huanjia, et autres
Publié: (2025)
par: Zhu, Huanjia, et autres
Publié: (2025)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
FACE: Faithful Automatic Concept Extraction
par: Bhusal, Dipkamal, et autres
Publié: (2025)
par: Bhusal, Dipkamal, et autres
Publié: (2025)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
par: Li, Yantao, et autres
Publié: (2026)
par: Li, Yantao, et autres
Publié: (2026)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
Saliency Guided Longitudinal Medical Visual Question Answering
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Improving Interpretation Faithfulness for Vision Transformers
par: Hu, Lijie, et autres
Publié: (2023)
par: Hu, Lijie, et autres
Publié: (2023)
Stake the Points: Structure-Faithful Instance Unlearning
par: Hong, Kiseong, et autres
Publié: (2026)
par: Hong, Kiseong, et autres
Publié: (2026)
[Re] Improving Interpretation Faithfulness for Vision Transformers
par: Kurek, Izabela, et autres
Publié: (2025)
par: Kurek, Izabela, et autres
Publié: (2025)
Towards Faithful Reasoning in Comics for Small MLLMs
par: Feng, Chengcheng, et autres
Publié: (2026)
par: Feng, Chengcheng, et autres
Publié: (2026)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
par: Rahman, Md Ashikur, et autres
Publié: (2026)
par: Rahman, Md Ashikur, et autres
Publié: (2026)
Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing
par: Zhang, Weiyu, et autres
Publié: (2026)
par: Zhang, Weiyu, et autres
Publié: (2026)
Detecting and Understanding Hateful Contents in Memes Through Captioning and Visual Question-Answering
par: Anaissi, Ali, et autres
Publié: (2025)
par: Anaissi, Ali, et autres
Publié: (2025)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
par: Xi, Suyang, et autres
Publié: (2026)
par: Xi, Suyang, et autres
Publié: (2026)
Leveraging Static Relationships for Intra-Type and Inter-Type Message Passing in Video Question Answering
par: Liang, Lili, et autres
Publié: (2025)
par: Liang, Lili, et autres
Publié: (2025)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
par: Shourya, Aditya, et autres
Publié: (2025)
par: Shourya, Aditya, et autres
Publié: (2025)
A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering
par: Liu, Zhiyue, et autres
Publié: (2025)
par: Liu, Zhiyue, et autres
Publié: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2024)
par: Jia, Ziheng, et autres
Publié: (2024)
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering
par: Chen, Yuhan, et autres
Publié: (2024)
par: Chen, Yuhan, et autres
Publié: (2024)
Free Form Medical Visual Question Answering in Radiology
par: Narayanan, Abhishek, et autres
Publié: (2024)
par: Narayanan, Abhishek, et autres
Publié: (2024)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
par: Xu, Pusheng, et autres
Publié: (2025)
par: Xu, Pusheng, et autres
Publié: (2025)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images
par: Penzkofer, Anna, et autres
Publié: (2024)
par: Penzkofer, Anna, et autres
Publié: (2024)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
par: Liu, Ying, et autres
Publié: (2024)
par: Liu, Ying, et autres
Publié: (2024)
Documents similaires
-
On the Faithfulness of Visual Thinking: Measurement and Enhancement
par: Liu, Zujing, et autres
Publié: (2025) -
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026) -
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024) -
Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation
par: Tong, Lei, et autres
Publié: (2025) -
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)