Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Haobo, Guo, Minghao, Yang, Dequan, Wang, Wenyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Human and AI Perceptual Differences in Image Classification Errors
by: Liu, Minghao, et al.
Published: (2023)
by: Liu, Minghao, et al.
Published: (2023)
Diffusion Model with Perceptual Loss
by: Lin, Shanchuan, et al.
Published: (2023)
by: Lin, Shanchuan, et al.
Published: (2023)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
by: Liu, Anjie, et al.
Published: (2026)
by: Liu, Anjie, et al.
Published: (2026)
IBiT: Utilizing Inductive Biases to Create a More Data Efficient Attention Mechanism
by: Giri, Adithya
Published: (2025)
by: Giri, Adithya
Published: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
by: Lin, Zichuan, et al.
Published: (2025)
by: Lin, Zichuan, et al.
Published: (2025)
Leveraging Local Structure for Improving Model Explanations: An Information Propagation Approach
by: Yang, Ruo, et al.
Published: (2024)
by: Yang, Ruo, et al.
Published: (2024)
Learning and Leveraging World Models in Visual Representation Learning
by: Garrido, Quentin, et al.
Published: (2024)
by: Garrido, Quentin, et al.
Published: (2024)
Exploring Perceptual Limitation of Multimodal Large Language Models
by: Zhang, Jiarui, et al.
Published: (2024)
by: Zhang, Jiarui, et al.
Published: (2024)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
by: Wang, Wenguan, et al.
Published: (2024)
by: Wang, Wenguan, et al.
Published: (2024)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
by: Mai, Zheda, et al.
Published: (2025)
by: Mai, Zheda, et al.
Published: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
by: Wang, Yubo, et al.
Published: (2024)
by: Wang, Yubo, et al.
Published: (2024)
Perceptual Quality-based Model Training under Annotator Label Uncertainty
by: Zhou, Chen, et al.
Published: (2024)
by: Zhou, Chen, et al.
Published: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
by: Azulay, Aharon, et al.
Published: (2026)
by: Azulay, Aharon, et al.
Published: (2026)
Science-T2I: Addressing Scientific Illusions in Image Synthesis
by: Li, Jialuo, et al.
Published: (2025)
by: Li, Jialuo, et al.
Published: (2025)
MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
by: Shi, Yang, et al.
Published: (2026)
by: Shi, Yang, et al.
Published: (2026)
Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
by: Jian, Yichang, et al.
Published: (2026)
by: Jian, Yichang, et al.
Published: (2026)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
by: Yang, Jiaxi, et al.
Published: (2026)
by: Yang, Jiaxi, et al.
Published: (2026)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
by: Guo, Danfeng, et al.
Published: (2024)
by: Guo, Danfeng, et al.
Published: (2024)
ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection
by: Lu, Hong, et al.
Published: (2025)
by: Lu, Hong, et al.
Published: (2025)
Can Biases in ImageNet Models Explain Generalization?
by: Gavrikov, Paul, et al.
Published: (2024)
by: Gavrikov, Paul, et al.
Published: (2024)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
by: Lian, Shijie, et al.
Published: (2025)
by: Lian, Shijie, et al.
Published: (2025)
Geometric-Guided Few-Shot Dental Landmark Detection with Human-Centric Foundation Model
by: Wang, Anbang, et al.
Published: (2025)
by: Wang, Anbang, et al.
Published: (2025)
Rethinking Post-Unlearning Behavior of Large Vision-Language Models
by: Kim, Minsung, et al.
Published: (2025)
by: Kim, Minsung, et al.
Published: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
by: Lee, Jewon, et al.
Published: (2025)
by: Lee, Jewon, et al.
Published: (2025)
AI-Generated Video Detection via Perceptual Straightening
by: Internò, Christian, et al.
Published: (2025)
by: Internò, Christian, et al.
Published: (2025)
AsyCo: An Asymmetric Dual-task Co-training Model for Partial-label Learning
by: Li, Beibei, et al.
Published: (2024)
by: Li, Beibei, et al.
Published: (2024)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
by: Li, Zhuowei, et al.
Published: (2025)
by: Li, Zhuowei, et al.
Published: (2025)
ViTime: Foundation Model for Time Series Forecasting Powered by Vision Intelligence
by: Yang, Luoxiao, et al.
Published: (2024)
by: Yang, Luoxiao, et al.
Published: (2024)
Adaptive Shared Experts with LoRA-Based Mixture of Experts for Multi-Task Learning
by: Yang, Minghao, et al.
Published: (2025)
by: Yang, Minghao, et al.
Published: (2025)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
by: Yan, Hao, et al.
Published: (2024)
by: Yan, Hao, et al.
Published: (2024)
Aether: Geometric-Aware Unified World Modeling
by: Aether Team, et al.
Published: (2025)
by: Aether Team, et al.
Published: (2025)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
by: Lee, Jihoon, et al.
Published: (2025)
by: Lee, Jihoon, et al.
Published: (2025)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
by: Gupta, Sunny, et al.
Published: (2026)
by: Gupta, Sunny, et al.
Published: (2026)
Leveraging Foundation Models for Causal Generative Modeling
by: Komanduri, Aneesh, et al.
Published: (2026)
by: Komanduri, Aneesh, et al.
Published: (2026)
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
by: Fang, Yixiong, et al.
Published: (2024)
by: Fang, Yixiong, et al.
Published: (2024)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
by: Yang, Senqiao, et al.
Published: (2024)
by: Yang, Senqiao, et al.
Published: (2024)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
by: Huang, Chi-Pin, et al.
Published: (2025)
by: Huang, Chi-Pin, et al.
Published: (2025)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
by: Yang, Bufang, et al.
Published: (2024)
by: Yang, Bufang, et al.
Published: (2024)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
by: Ding, Renhua, et al.
Published: (2024)
by: Ding, Renhua, et al.
Published: (2024)
FedDistill: Global Model Distillation for Local Model De-Biasing in Non-IID Federated Learning
by: Song, Changlin, et al.
Published: (2024)
by: Song, Changlin, et al.
Published: (2024)
Similar Items
-
Human and AI Perceptual Differences in Image Classification Errors
by: Liu, Minghao, et al.
Published: (2023) -
Diffusion Model with Perceptual Loss
by: Lin, Shanchuan, et al.
Published: (2023) -
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
by: Liu, Anjie, et al.
Published: (2026) -
IBiT: Utilizing Inductive Biases to Create a More Data Efficient Attention Mechanism
by: Giri, Adithya
Published: (2025) -
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
by: Lin, Zichuan, et al.
Published: (2025)