Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Jha, Saurav, Mirza, M. Jehanzeb, Lin, Wei, Yang, Shiqi, Chandar, Sarath |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
di: Jha, Saurav, et al.
Pubblicazione: (2024)
di: Jha, Saurav, et al.
Pubblicazione: (2024)
Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models
di: Nilaksh, et al.
Pubblicazione: (2026)
di: Nilaksh, et al.
Pubblicazione: (2026)
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
Into the Fog: Evaluating Robustness of Multiple Object Tracking
di: Kirillova, Nadezda, et al.
Pubblicazione: (2024)
di: Kirillova, Nadezda, et al.
Pubblicazione: (2024)
CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design
di: Govindarajan, Prashant, et al.
Pubblicazione: (2025)
di: Govindarajan, Prashant, et al.
Pubblicazione: (2025)
Can We Talk Models Into Seeing the World Differently?
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics
di: Jha, Saurav, et al.
Pubblicazione: (2025)
di: Jha, Saurav, et al.
Pubblicazione: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
di: Xue, Qiyao, et al.
Pubblicazione: (2025)
di: Xue, Qiyao, et al.
Pubblicazione: (2025)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
Enhancing Spatial Reasoning through Visual and Textual Thinking
di: Liang, Xun, et al.
Pubblicazione: (2025)
di: Liang, Xun, et al.
Pubblicazione: (2025)
SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images
di: Liu, Zishan, et al.
Pubblicazione: (2026)
di: Liu, Zishan, et al.
Pubblicazione: (2026)
VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
TTT-KD: Test-Time Training for 3D Semantic Segmentation through Knowledge Distillation from Foundation Models
di: Weijler, Lisa, et al.
Pubblicazione: (2024)
di: Weijler, Lisa, et al.
Pubblicazione: (2024)
CE-RS-SBCIT A Novel Channel Enhanced Hybrid CNN Transformer with Residual, Spatial, and Boundary-Aware Learning for Brain Tumor MRI Analysis
di: Zahoor, Mirza Mumtaz, et al.
Pubblicazione: (2025)
di: Zahoor, Mirza Mumtaz, et al.
Pubblicazione: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
di: Wu, Aodi, et al.
Pubblicazione: (2025)
di: Wu, Aodi, et al.
Pubblicazione: (2025)
SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
di: Avogaro, Niccolo, et al.
Pubblicazione: (2026)
di: Avogaro, Niccolo, et al.
Pubblicazione: (2026)
AGI Is Coming... Right After AI Learns to Play Wordle
di: Shekkizhar, Sarath, et al.
Pubblicazione: (2025)
di: Shekkizhar, Sarath, et al.
Pubblicazione: (2025)
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
di: Yuan, Tianyuan, et al.
Pubblicazione: (2026)
di: Yuan, Tianyuan, et al.
Pubblicazione: (2026)
Can Diffusion Models Disentangle? A Theoretical Perspective
di: Wang, Liming, et al.
Pubblicazione: (2025)
di: Wang, Liming, et al.
Pubblicazione: (2025)
Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
di: Byun, Ji Young, et al.
Pubblicazione: (2025)
di: Byun, Ji Young, et al.
Pubblicazione: (2025)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
di: Wang, Changpeng, et al.
Pubblicazione: (2026)
di: Wang, Changpeng, et al.
Pubblicazione: (2026)
Reimagination with Test-time Observation Interventions: Distractor-Robust World Model Predictions for Visual Model Predictive Control
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
Subspace Alignment for Vision-Language Model Test-time Adaptation
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
di: Zeng, Zhichen, et al.
Pubblicazione: (2026)
Pursuing Minimal Sufficiency in Spatial Reasoning
di: Guo, Yejie, et al.
Pubblicazione: (2025)
di: Guo, Yejie, et al.
Pubblicazione: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory
di: Wu, Ruiqi, et al.
Pubblicazione: (2026)
di: Wu, Ruiqi, et al.
Pubblicazione: (2026)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
di: Wu, Junfei, et al.
Pubblicazione: (2025)
di: Wu, Junfei, et al.
Pubblicazione: (2025)
LoopNav: Benchmarking Spatial Consistency in World Models
di: Lian, Kewei, et al.
Pubblicazione: (2025)
di: Lian, Kewei, et al.
Pubblicazione: (2025)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
Limits of Spatial Imagery Reasoning in Frontier LLM Models
di: Hayashi, Sergio Y., et al.
Pubblicazione: (2026)
di: Hayashi, Sergio Y., et al.
Pubblicazione: (2026)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
di: Ong, Brandon, et al.
Pubblicazione: (2025)
di: Ong, Brandon, et al.
Pubblicazione: (2025)
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
di: Jha, Saurav, et al.
Pubblicazione: (2024) -
Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models
di: Nilaksh, et al.
Pubblicazione: (2026) -
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2025) -
Into the Fog: Evaluating Robustness of Multiple Object Tracking
di: Kirillova, Nadezda, et al.
Pubblicazione: (2024) -
CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design
di: Govindarajan, Prashant, et al.
Pubblicazione: (2025)