IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yiming, Zhang, Zicheng, Wei, Xinyi, Liu, Xiaohong, Zhai, Guangtao, Min, Xiongkuo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
von: Zha, Junli, et al.
Veröffentlicht: (2026)
von: Zha, Junli, et al.
Veröffentlicht: (2026)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
von: Wang, Ruiyi, et al.
Veröffentlicht: (2024)
von: Wang, Ruiyi, et al.
Veröffentlicht: (2024)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
von: Sun, Yinan, et al.
Veröffentlicht: (2025)
von: Sun, Yinan, et al.
Veröffentlicht: (2025)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
von: Fu, Kang, et al.
Veröffentlicht: (2025)
von: Fu, Kang, et al.
Veröffentlicht: (2025)
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
von: Ullman, Tomer
Veröffentlicht: (2024)
von: Ullman, Tomer
Veröffentlicht: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
von: Hou, Wenjin, et al.
Veröffentlicht: (2026)
von: Hou, Wenjin, et al.
Veröffentlicht: (2026)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
CMC-Bench: Towards a New Paradigm of Visual Signal Compression
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
von: Guan, Tianrui, et al.
Veröffentlicht: (2023)
von: Guan, Tianrui, et al.
Veröffentlicht: (2023)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
von: Zhu, Xiaorong, et al.
Veröffentlicht: (2025)
von: Zhu, Xiaorong, et al.
Veröffentlicht: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
von: Shahgir, Haz Sameen, et al.
Veröffentlicht: (2024)
von: Shahgir, Haz Sameen, et al.
Veröffentlicht: (2024)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
Explore the Hallucination on Low-level Perception for MLLMs
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
von: Kou, Tengchuan, et al.
Veröffentlicht: (2024)
von: Kou, Tengchuan, et al.
Veröffentlicht: (2024)
Towards Explainable Partial-AIGC Image Quality Assessment
von: Qian, Jiaying, et al.
Veröffentlicht: (2025)
von: Qian, Jiaying, et al.
Veröffentlicht: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2024)
von: Jia, Ziheng, et al.
Veröffentlicht: (2024)
Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions
von: Wang, Xuesong, et al.
Veröffentlicht: (2026)
von: Wang, Xuesong, et al.
Veröffentlicht: (2026)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
THQA: A Perceptual Quality Assessment Database for Talking Heads
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
von: Qian, Jiaying, et al.
Veröffentlicht: (2026)
von: Qian, Jiaying, et al.
Veröffentlicht: (2026)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
von: Rostamkhani, Mohammadmostafa, et al.
Veröffentlicht: (2024)
von: Rostamkhani, Mohammadmostafa, et al.
Veröffentlicht: (2024)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
von: Wang, Jiarui, et al.
Veröffentlicht: (2025)
von: Wang, Jiarui, et al.
Veröffentlicht: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
von: Zha, Junli, et al.
Veröffentlicht: (2026) -
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026) -
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024) -
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
von: Li, Yunhao, et al.
Veröffentlicht: (2026) -
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
von: Wang, Juntong, et al.
Veröffentlicht: (2025)