Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yajing, Kong, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
di: Yang, Haobo, et al.
Pubblicazione: (2025)
di: Yang, Haobo, et al.
Pubblicazione: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
di: Zhu, Zhiyu, et al.
Pubblicazione: (2025)
di: Zhu, Zhiyu, et al.
Pubblicazione: (2025)
PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis
di: Xu, Jiao, et al.
Pubblicazione: (2026)
di: Xu, Jiao, et al.
Pubblicazione: (2026)
Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion
di: Kang, Xueyang, et al.
Pubblicazione: (2025)
di: Kang, Xueyang, et al.
Pubblicazione: (2025)
ATLAS: Adapter-Based Multi-Modal Continual Learning with a Two-Stage Learning Strategy
di: Li, Hong, et al.
Pubblicazione: (2024)
di: Li, Hong, et al.
Pubblicazione: (2024)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
di: Liu, Che, et al.
Pubblicazione: (2026)
di: Liu, Che, et al.
Pubblicazione: (2026)
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
di: He, Yongbo, et al.
Pubblicazione: (2026)
di: He, Yongbo, et al.
Pubblicazione: (2026)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
di: Jian, Yichang, et al.
Pubblicazione: (2026)
di: Jian, Yichang, et al.
Pubblicazione: (2026)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
di: Zhou, Jingqi, et al.
Pubblicazione: (2024)
di: Zhou, Jingqi, et al.
Pubblicazione: (2024)
Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution
di: Wang, Ying, et al.
Pubblicazione: (2023)
di: Wang, Ying, et al.
Pubblicazione: (2023)
Through the Theory of Mind's Eye: Reading Minds with Multimodal Video Large Language Models
di: Chen, Zhawnen, et al.
Pubblicazione: (2024)
di: Chen, Zhawnen, et al.
Pubblicazione: (2024)
A Two-Stage Multi-Modal MRI Framework for Lifespan Brain Age Prediction
di: Zhang, Dingyi, et al.
Pubblicazione: (2026)
di: Zhang, Dingyi, et al.
Pubblicazione: (2026)
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
di: Hu, Xia, et al.
Pubblicazione: (2026)
di: Hu, Xia, et al.
Pubblicazione: (2026)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
di: Liu, Anjie, et al.
Pubblicazione: (2026)
di: Liu, Anjie, et al.
Pubblicazione: (2026)
Perceptual Quality-based Model Training under Annotator Label Uncertainty
di: Zhou, Chen, et al.
Pubblicazione: (2024)
di: Zhou, Chen, et al.
Pubblicazione: (2024)
MVEB: Self-Supervised Learning with Multi-View Entropy Bottleneck
di: Wen, Liangjian, et al.
Pubblicazione: (2024)
di: Wen, Liangjian, et al.
Pubblicazione: (2024)
Beyond the First Read: AI-Assisted Perceptual Error Detection in Chest Radiography Accounting for Interobserver Variability
di: Vutukuri, Adhrith, et al.
Pubblicazione: (2025)
di: Vutukuri, Adhrith, et al.
Pubblicazione: (2025)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
MVP-CBM:Multi-layer Visual Preference-enhanced Concept Bottleneck Model for Explainable Medical Image Classification
di: Wang, Chunjiang, et al.
Pubblicazione: (2025)
di: Wang, Chunjiang, et al.
Pubblicazione: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
Beyond CNNs: Efficient Fine-Tuning of Multi-Modal LLMs for Object Detection on Low-Data Regimes
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
di: Fan, Xianzhe, et al.
Pubblicazione: (2025)
di: Fan, Xianzhe, et al.
Pubblicazione: (2025)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
Feature Learning with Multi-Stage Vision Transformers on Inter-Modality HER2 Status Scoring and Tumor Classification on Whole Slides
di: Oyelade, Olaide N., et al.
Pubblicazione: (2025)
di: Oyelade, Olaide N., et al.
Pubblicazione: (2025)
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis
di: Dong, Rui, et al.
Pubblicazione: (2026)
di: Dong, Rui, et al.
Pubblicazione: (2026)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
HSCP: A Two-Stage Spectral Clustering Framework for Resource-Constrained UAV Identification
di: Wang, Maoyu, et al.
Pubblicazione: (2025)
di: Wang, Maoyu, et al.
Pubblicazione: (2025)
G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
Two-Stage Random Alternation Framework for One-Shot Pansharpening
di: Chen, Haorui, et al.
Pubblicazione: (2025)
di: Chen, Haorui, et al.
Pubblicazione: (2025)
Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling
di: Fu, Xiaolong, et al.
Pubblicazione: (2025)
di: Fu, Xiaolong, et al.
Pubblicazione: (2025)
MVBoost: Boost 3D Reconstruction with Multi-View Refinement
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency
di: Wang, Dingyu, et al.
Pubblicazione: (2025)
di: Wang, Dingyu, et al.
Pubblicazione: (2025)
Latent Guidance in Diffusion Models for Perceptual Evaluations
di: Saini, Shreshth, et al.
Pubblicazione: (2025)
di: Saini, Shreshth, et al.
Pubblicazione: (2025)
Scaling-up Perceptual Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025) -
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
di: Yang, Haobo, et al.
Pubblicazione: (2025) -
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
di: Zhu, Zhiyu, et al.
Pubblicazione: (2025) -
PulseMind: A Multi-Modal Medical Model for Real-World Clinical Diagnosis
di: Xu, Jiao, et al.
Pubblicazione: (2026) -
Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion
di: Kang, Xueyang, et al.
Pubblicazione: (2025)