Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zha, Junli, Wang, Jiahui, Lu, Xinkai, Wang, Jinbo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
por: Ullman, Tomer
Publicado: (2024)
por: Ullman, Tomer
Publicado: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
por: Shahgir, Haz Sameen, et al.
Publicado: (2024)
por: Shahgir, Haz Sameen, et al.
Publicado: (2024)
Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions
por: Wang, Xuesong, et al.
Publicado: (2026)
por: Wang, Xuesong, et al.
Publicado: (2026)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
por: Wang, Changpeng, et al.
Publicado: (2025)
por: Wang, Changpeng, et al.
Publicado: (2025)
The Art of Deception: Color Visual Illusions and Diffusion Models
por: Gomez-Villa, Alex, et al.
Publicado: (2024)
por: Gomez-Villa, Alex, et al.
Publicado: (2024)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
por: Sun, Xiaoxiao, et al.
Publicado: (2026)
por: Sun, Xiaoxiao, et al.
Publicado: (2026)
3D Visual Illusion Depth Estimation
por: Yao, Chengtang, et al.
Publicado: (2025)
por: Yao, Chengtang, et al.
Publicado: (2025)
Illusion3D: 3D Multiview Illusion with 2D Diffusion Priors
por: Feng, Yue, et al.
Publicado: (2024)
por: Feng, Yue, et al.
Publicado: (2024)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
por: Yang, Haobo, et al.
Publicado: (2025)
por: Yang, Haobo, et al.
Publicado: (2025)
Illusions in Humans and AI: How Visual Perception Aligns and Diverges
por: Yang, Jianyi, et al.
Publicado: (2025)
por: Yang, Jianyi, et al.
Publicado: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
por: Guan, Tianrui, et al.
Publicado: (2023)
por: Guan, Tianrui, et al.
Publicado: (2023)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
por: Rostamkhani, Mohammadmostafa, et al.
Publicado: (2024)
por: Rostamkhani, Mohammadmostafa, et al.
Publicado: (2024)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
por: Li, Sifan, et al.
Publicado: (2025)
por: Li, Sifan, et al.
Publicado: (2025)
Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models
por: Basoc, Nicoleta-Nina, et al.
Publicado: (2026)
por: Basoc, Nicoleta-Nina, et al.
Publicado: (2026)
Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models
por: Geng, Daniel, et al.
Publicado: (2023)
por: Geng, Daniel, et al.
Publicado: (2023)
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
por: Sheng, Lijun, et al.
Publicado: (2025)
por: Sheng, Lijun, et al.
Publicado: (2025)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
LanEvil: Benchmarking the Robustness of Lane Detection to Environmental Illusions
por: Zhang, Tianyuan, et al.
Publicado: (2024)
por: Zhang, Tianyuan, et al.
Publicado: (2024)
Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?
por: Shinozaki, Taiga, et al.
Publicado: (2025)
por: Shinozaki, Taiga, et al.
Publicado: (2025)
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
por: Mao, Lingjun, et al.
Publicado: (2024)
por: Mao, Lingjun, et al.
Publicado: (2024)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
Factorized Diffusion: Perceptual Illusions by Noise Decomposition
por: Geng, Daniel, et al.
Publicado: (2024)
por: Geng, Daniel, et al.
Publicado: (2024)
Unmasking Illusions: Understanding Human Perception of Audiovisual Deepfakes
por: Hashmi, Ammarah, et al.
Publicado: (2024)
por: Hashmi, Ammarah, et al.
Publicado: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
por: Shi, Chufan, et al.
Publicado: (2026)
por: Shi, Chufan, et al.
Publicado: (2026)
The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency
por: Wang, Dingyu, et al.
Publicado: (2025)
por: Wang, Dingyu, et al.
Publicado: (2025)
Stroke of Surprise: Progressive Semantic Illusions in Vector Sketching
por: Cheng, Huai-Hsun, et al.
Publicado: (2026)
por: Cheng, Huai-Hsun, et al.
Publicado: (2026)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
por: Ni, Shuo, et al.
Publicado: (2026)
por: Ni, Shuo, et al.
Publicado: (2026)
MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation
por: Liu, Ruiyao, et al.
Publicado: (2026)
por: Liu, Ruiyao, et al.
Publicado: (2026)
Overcoming False Illusions in Real-World Face Restoration with Multi-Modal Guided Diffusion Model
por: Tao, Keda, et al.
Publicado: (2024)
por: Tao, Keda, et al.
Publicado: (2024)
The Instinctive Bias: Spurious Images lead to Illusion in MLLMs
por: Han, Tianyang, et al.
Publicado: (2024)
por: Han, Tianyang, et al.
Publicado: (2024)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
por: Tu, Jinzhe, et al.
Publicado: (2026)
por: Tu, Jinzhe, et al.
Publicado: (2026)
PTDiffusion: Free Lunch for Generating Optical Illusion Hidden Pictures with Phase-Transferred Diffusion Model
por: Gao, Xiang, et al.
Publicado: (2025)
por: Gao, Xiang, et al.
Publicado: (2025)
Still Camouflage, Moving Illusion: View-Induced Trajectory Manipulation in Autonomous Driving
por: Ju, Shuo, et al.
Publicado: (2026)
por: Ju, Shuo, et al.
Publicado: (2026)
Uncovering Modality Discrepancy and Generalization Illusion for General-Purpose 3D Medical Segmentation
por: Zhang, Yichi, et al.
Publicado: (2026)
por: Zhang, Yichi, et al.
Publicado: (2026)
GenAI Mirage: The Impostor Bias and the Deepfake Detection Challenge in the Era of Artificial Illusions
por: Casu, Mirko, et al.
Publicado: (2023)
por: Casu, Mirko, et al.
Publicado: (2023)
Breaking the Illusion: Real-world Challenges for Adversarial Patches in Object Detection
por: Shack, Jakob, et al.
Publicado: (2024)
por: Shack, Jakob, et al.
Publicado: (2024)
Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
por: Qu, Yiting, et al.
Publicado: (2025)
por: Qu, Yiting, et al.
Publicado: (2025)
The Devil's Advocate: Shattering the Illusion of Unexploitable Data using Diffusion Models
por: Dolatabadi, Hadi M., et al.
Publicado: (2023)
por: Dolatabadi, Hadi M., et al.
Publicado: (2023)
Science-T2I: Addressing Scientific Illusions in Image Synthesis
por: Li, Jialuo, et al.
Publicado: (2025)
por: Li, Jialuo, et al.
Publicado: (2025)
Ejemplares similares
-
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
por: Ullman, Tomer
Publicado: (2024) -
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
por: Zhang, Yiming, et al.
Publicado: (2025) -
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
por: Shahgir, Haz Sameen, et al.
Publicado: (2024) -
Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions
por: Wang, Xuesong, et al.
Publicado: (2026) -
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
por: Wang, Changpeng, et al.
Publicado: (2025)