A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vaishnav, Mohit, Tammet, Tanel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
par: Vaishnav, Mohit, et autres
Publié: (2026)
par: Vaishnav, Mohit, et autres
Publié: (2026)
Beyond the Linear Separability Ceiling: Aligning Representations in VLMs
par: Vompa, Enrico, et autres
Publié: (2025)
par: Vompa, Enrico, et autres
Publié: (2025)
CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems
par: Tian, Yonglin, et autres
Publié: (2026)
par: Tian, Yonglin, et autres
Publié: (2026)
The Scaling Properties of Implicit Deductive Reasoning in Transformers
par: Vompa, Enrico, et autres
Publié: (2026)
par: Vompa, Enrico, et autres
Publié: (2026)
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
par: Ballout, Mohamad, et autres
Publié: (2025)
par: Ballout, Mohamad, et autres
Publié: (2025)
SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
par: Avogaro, Niccolo, et autres
Publié: (2026)
par: Avogaro, Niccolo, et autres
Publié: (2026)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Caption This, Reason That: VLMs Caught in the Middle
par: Weng, Zihan, et autres
Publié: (2025)
par: Weng, Zihan, et autres
Publié: (2025)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs
par: Eltahir, Mohamed, et autres
Publié: (2026)
par: Eltahir, Mohamed, et autres
Publié: (2026)
Treble Counterfactual VLMs: A Causal Approach to Hallucination
par: Li, Shawn, et autres
Publié: (2025)
par: Li, Shawn, et autres
Publié: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)
par: Ge, Yuyao, et autres
Publié: (2025)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
par: Li, Chenjun
Publié: (2026)
par: Li, Chenjun
Publié: (2026)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
par: Jian, Ai, et autres
Publié: (2025)
par: Jian, Ai, et autres
Publié: (2025)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
par: Pan, Zhenyu, et autres
Publié: (2025)
par: Pan, Zhenyu, et autres
Publié: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
par: Kang, Inha, et autres
Publié: (2025)
par: Kang, Inha, et autres
Publié: (2025)
GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation
par: Elmaaroufi, Karim, et autres
Publié: (2025)
par: Elmaaroufi, Karim, et autres
Publié: (2025)
Mixed Signals: Decoding VLMs' Reasoning and Underlying Bias in Vision-Language Conflict
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
par: Pezeshkpour, Pouya, et autres
Publié: (2025)
Test-Time Reasoning Through Visual Human Preferences with VLMs and Soft Rewards
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
par: Zhang, Ben, et autres
Publié: (2025)
par: Zhang, Ben, et autres
Publié: (2025)
On the Promise for Assurance of Differentiable Neurosymbolic Reasoning Paradigms
par: Richards, Luke E., et autres
Publié: (2025)
par: Richards, Luke E., et autres
Publié: (2025)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
par: Guo, Chaohong, et autres
Publié: (2025)
par: Guo, Chaohong, et autres
Publié: (2025)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
par: Mayer, Julius, et autres
Publié: (2025)
par: Mayer, Julius, et autres
Publié: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
par: Lu, Meng, et autres
Publié: (2025)
par: Lu, Meng, et autres
Publié: (2025)
Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving
par: Tang, Zecong, et autres
Publié: (2026)
par: Tang, Zecong, et autres
Publié: (2026)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
Can VLMs Reason Robustly? A Neuro-Symbolic Investigation
par: Chen, Weixin, et autres
Publié: (2026)
par: Chen, Weixin, et autres
Publié: (2026)
PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
par: Mak, Chak-Wing, et autres
Publié: (2026)
par: Mak, Chak-Wing, et autres
Publié: (2026)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
par: Liang, Yijun, et autres
Publié: (2025)
par: Liang, Yijun, et autres
Publié: (2025)
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
par: Goyal, Karan
Publié: (2026)
par: Goyal, Karan
Publié: (2026)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
par: Pan, Jiazhen, et autres
Publié: (2025)
par: Pan, Jiazhen, et autres
Publié: (2025)
Documents similaires
-
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
par: Vaishnav, Mohit, et autres
Publié: (2026) -
Beyond the Linear Separability Ceiling: Aligning Representations in VLMs
par: Vompa, Enrico, et autres
Publié: (2025) -
CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems
par: Tian, Yonglin, et autres
Publié: (2026) -
The Scaling Properties of Implicit Deductive Reasoning in Transformers
par: Vompa, Enrico, et autres
Publié: (2026) -
Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
par: Ballout, Mohamad, et autres
Publié: (2025)