Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Zhentao, Zhang, Can, Wu, Ziheng, Chen, Zhenghao, Zhan, Yufei, Li, Yifan, Zhang, Zhao, Wang, Xian, Qiu, Minghui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
par: Wu, Ziheng, et autres
Publié: (2025)
par: Wu, Ziheng, et autres
Publié: (2025)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
par: Yu, Jiachen, et autres
Publié: (2025)
par: Yu, Jiachen, et autres
Publié: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
par: Deng, Ailin, et autres
Publié: (2024)
par: Deng, Ailin, et autres
Publié: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
par: Guo, Pinxue, et autres
Publié: (2025)
par: Guo, Pinxue, et autres
Publié: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024)
par: Xing, Shangyu, et autres
Publié: (2024)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
par: Zhang, Xuesong, et autres
Publié: (2024)
par: Zhang, Xuesong, et autres
Publié: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
par: Li, Jiale, et autres
Publié: (2025)
par: Li, Jiale, et autres
Publié: (2025)
Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models
par: Zhou, Haoran, et autres
Publié: (2025)
par: Zhou, Haoran, et autres
Publié: (2025)
Hallucination of Multimodal Large Language Models: A Survey
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
par: Dai, Ziyun, et autres
Publié: (2025)
par: Dai, Ziyun, et autres
Publié: (2025)
Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
par: Li, Jinlin, et autres
Publié: (2025)
par: Li, Jinlin, et autres
Publié: (2025)
Seeing is not Believing: An Identity Hider for Human Vision Privacy Protection
par: Wang, Tao, et autres
Publié: (2023)
par: Wang, Tao, et autres
Publié: (2023)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
par: Zhang, Jinrui, et autres
Publié: (2024)
par: Zhang, Jinrui, et autres
Publié: (2024)
Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing
par: Jiang, Siyu, et autres
Publié: (2026)
par: Jiang, Siyu, et autres
Publié: (2026)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
LISA: A Layer-wise Integration and Suppression Approach for Hallucination Mitigation in Multimodal Large Language Models
par: Guo, Zhihui, et autres
Publié: (2025)
par: Guo, Zhihui, et autres
Publié: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding
par: Chen, Boqi, et autres
Publié: (2026)
par: Chen, Boqi, et autres
Publié: (2026)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
par: Sinha, Sanchit, et autres
Publié: (2026)
par: Sinha, Sanchit, et autres
Publié: (2026)
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
par: Zhang, Yuanhong, et autres
Publié: (2026)
par: Zhang, Yuanhong, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
par: Wu, Jiulong, et autres
Publié: (2025)
par: Wu, Jiulong, et autres
Publié: (2025)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
par: Chang, Yue, et autres
Publié: (2024)
par: Chang, Yue, et autres
Publié: (2024)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
par: Sun, Nan, et autres
Publié: (2025)
par: Sun, Nan, et autres
Publié: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models
par: Sun, Li, et autres
Publié: (2024)
par: Sun, Li, et autres
Publié: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models
par: Lin, Yangguang, et autres
Publié: (2026)
par: Lin, Yangguang, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Documents similaires
-
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
par: Li, Yifan, et autres
Publié: (2025) -
Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
par: Wu, Ziheng, et autres
Publié: (2025) -
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
par: Zhan, Yufei, et autres
Publié: (2025) -
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
par: Yu, Jiachen, et autres
Publié: (2025) -
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
par: Deng, Ailin, et autres
Publié: (2024)