Probing Perceptual Constancy in Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Haoran, Wang, Bingyang, Yu, Suyang, Li, Yijiang, Gao, Qingying, Lyu, Haiyun, Huang, Lianyu, Hong, Zelong, Ge, Jiahui, Ma, Qianli, He, Hang, Zhou, Yifan, Guo, Lingzi, Mei, Lantao, Wang, Maijunxian, Luo, Dezhi, Deng, Hokin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Probing Mechanical Reasoning in Large Vision Language Models
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024)
por: Gao, Qingying, et al.
Publicado: (2024)
Vision Language Models Know Law of Conservation without Understanding More-or-Less
por: Luo, Dezhi, et al.
Publicado: (2024)
por: Luo, Dezhi, et al.
Publicado: (2024)
Egocentric Bias in Vision-Language Models
por: Wang, Maijunxian, et al.
Publicado: (2026)
por: Wang, Maijunxian, et al.
Publicado: (2026)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
por: Zhang, Zory, et al.
Publicado: (2025)
por: Zhang, Zory, et al.
Publicado: (2025)
Vision Language Models Cannot Reason About Physical Transformation
por: Luo, Dezhi, et al.
Publicado: (2026)
por: Luo, Dezhi, et al.
Publicado: (2026)
Increasing Computation Resolves Conflicts in Vision Language Models
por: Wang, Bingyang, et al.
Publicado: (2025)
por: Wang, Bingyang, et al.
Publicado: (2025)
Core Knowledge Deficits in Multi-Modal Language Models
por: Li, Yijiang, et al.
Publicado: (2024)
por: Li, Yijiang, et al.
Publicado: (2024)
Rethinking the Simulation vs. Rendering Dichotomy: No Free Lunch in Spatial World Modelling
por: Luo, Dezhi, et al.
Publicado: (2025)
por: Luo, Dezhi, et al.
Publicado: (2025)
The Philosophical Foundations of Growing AI Like A Child
por: Luo, Dezhi, et al.
Publicado: (2025)
por: Luo, Dezhi, et al.
Publicado: (2025)
The Quantified Body: Identity, Empowerment, and Control in Smart Wearables
por: Wang, Maijunxian
Publicado: (2025)
por: Wang, Maijunxian
Publicado: (2025)
From Understanding the World to Intervening in It: A Unified Multi-Scale Framework for Embodied Cognition
por: Wang, Maijunxian
Publicado: (2025)
por: Wang, Maijunxian
Publicado: (2025)
Perceptual Constancy Constrained Single Opinion Score Calibration for Image Quality Assessment
por: Wang, Lei, et al.
Publicado: (2024)
por: Wang, Lei, et al.
Publicado: (2024)
AGI as Second Being: The Structural-Generative Ontology of Intelligence
por: Wang, Maijunxian, et al.
Publicado: (2025)
por: Wang, Maijunxian, et al.
Publicado: (2025)
A Very Big Video Reasoning Suite
por: Wang, Maijunxian, et al.
Publicado: (2026)
por: Wang, Maijunxian, et al.
Publicado: (2026)
Boundedness of a class of multilinear operators and their iterated commutators on Morrey-Banach function spaces
por: Tan, Jiawei, et al.
Publicado: (2025)
por: Tan, Jiawei, et al.
Publicado: (2025)
SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
por: Zhang, Jianshu, et al.
Publicado: (2026)
por: Zhang, Jianshu, et al.
Publicado: (2026)
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
por: Deng, Hokin
Publicado: (2025)
por: Deng, Hokin
Publicado: (2025)
Vision-Language Model IP Protection via Prompt-based Learning
por: Wang, Lianyu, et al.
Publicado: (2025)
por: Wang, Lianyu, et al.
Publicado: (2025)
The chemistry of cell membranes
por: Lowell E. Hokin
Publicado: (1960)
por: Lowell E. Hokin
Publicado: (1960)
Use-dependent Biases as Optimal Action under Information Bottleneck
por: Deng, Hokin, et al.
Publicado: (2024)
por: Deng, Hokin, et al.
Publicado: (2024)
Multi-illuminant Color Constancy via Multi-scale Illuminant Estimation and Fusion
por: Luo, Hang, et al.
Publicado: (2025)
por: Luo, Hang, et al.
Publicado: (2025)
Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models
por: Ai, Qihang, et al.
Publicado: (2025)
por: Ai, Qihang, et al.
Publicado: (2025)
Approximate Nullspace Augmented Finetuning for Robust Vision Transformers
por: Liu, Haoyang, et al.
Publicado: (2024)
por: Liu, Haoyang, et al.
Publicado: (2024)
Nonconvex Nonsmooth Multicomposite Optimization and Its Applications to Recurrent Neural Networks
por: Jin, Lingzi, et al.
Publicado: (2025)
por: Jin, Lingzi, et al.
Publicado: (2025)
Motor boat "Constance"
Publicado: ()
Publicado: ()
Demystifying Video Reasoning
por: Wang, Ruisi, et al.
Publicado: (2026)
por: Wang, Ruisi, et al.
Publicado: (2026)
Can 3D Vision-Language Models Truly Understand Natural Language?
por: Deng, Weipeng, et al.
Publicado: (2024)
por: Deng, Weipeng, et al.
Publicado: (2024)
Mental-Gen: A Brain-Computer Interface-Based Interactive Method for Interior Space Generative Design
por: Liu, Yijiang, et al.
Publicado: (2024)
por: Liu, Yijiang, et al.
Publicado: (2024)
ARK: Answer-Centric Retriever Tuning via KG-augmented Curriculum Learning
por: Ding, Hang, et al.
Publicado: (2025)
por: Ding, Hang, et al.
Publicado: (2025)
Empowering Users in Digital Privacy Management through Interactive LLM-Based Agents
por: Sun, Bolun, et al.
Publicado: (2024)
por: Sun, Bolun, et al.
Publicado: (2024)
Constancy of Incubation for the Scarlet Tanager
por: Prescott, Kenneth W
Publicado: (1964)
por: Prescott, Kenneth W
Publicado: (1964)
Constancy of the index for gradient mappings
por: Guerra, André, et al.
Publicado: (2025)
por: Guerra, André, et al.
Publicado: (2025)
Point Cloud Color Constancy
por: Xing, Xiaoyan, et al.
Publicado: (2021)
por: Xing, Xiaoyan, et al.
Publicado: (2021)
Reopening of the Marienschlucht by Lake Constance
por: Achilles Häring
Publicado: (2024)
por: Achilles Häring
Publicado: (2024)
Unsupervised Domain Adaptation via Style-Aware Self-intermediate Domain
por: Wang, Lianyu, et al.
Publicado: (2022)
por: Wang, Lianyu, et al.
Publicado: (2022)
Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs
por: Wang, Lianyu, et al.
Publicado: (2026)
por: Wang, Lianyu, et al.
Publicado: (2026)
Say No to Freeloader: Protecting Intellectual Property of Your Deep Model
por: Wang, Lianyu, et al.
Publicado: (2024)
por: Wang, Lianyu, et al.
Publicado: (2024)
Numerical Analysis on the Quasi‐Static Mechanical Performance of Nacre‐Like PLA ‐Composites Prepared by Two‐Material Fused Filament Fabrication
por: Zelong Zhao, et al.
Publicado: (2026)
por: Zelong Zhao, et al.
Publicado: (2026)
Interpretable Clustering Ensemble
por: Lv, Hang, et al.
Publicado: (2025)
por: Lv, Hang, et al.
Publicado: (2025)
Ejemplares similares
-
Probing Mechanical Reasoning in Large Vision Language Models
por: Sun, Haoran, et al.
Publicado: (2024) -
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024) -
Vision Language Models Know Law of Conservation without Understanding More-or-Less
por: Luo, Dezhi, et al.
Publicado: (2024) -
Egocentric Bias in Vision-Language Models
por: Wang, Maijunxian, et al.
Publicado: (2026) -
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
por: Zhang, Zory, et al.
Publicado: (2025)