SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Meng, Li, Xingyu, Liu, Xue, Reid, Ian, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input
par: Lv, Zhen, et autres
Publié: (2024)
par: Lv, Zhen, et autres
Publié: (2024)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
par: Tang, Haoran, et autres
Publié: (2025)
par: Tang, Haoran, et autres
Publié: (2025)
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
par: Li, Haoyuan, et autres
Publié: (2026)
par: Li, Haoyuan, et autres
Publié: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
Limits of Spatial Imagery Reasoning in Frontier LLM Models
par: Hayashi, Sergio Y., et autres
Publié: (2026)
par: Hayashi, Sergio Y., et autres
Publié: (2026)
Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation
par: Lee, Phillip Y., et autres
Publié: (2025)
par: Lee, Phillip Y., et autres
Publié: (2025)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
par: Zheng, Hongpei, et autres
Publié: (2025)
par: Zheng, Hongpei, et autres
Publié: (2025)
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
par: Cao, Meng, et autres
Publié: (2026)
par: Cao, Meng, et autres
Publié: (2026)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
par: Ma, Wufei, et autres
Publié: (2025)
par: Ma, Wufei, et autres
Publié: (2025)
SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning
par: Zhang, Yi, et autres
Publié: (2026)
par: Zhang, Yi, et autres
Publié: (2026)
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
par: Ouyang, Kun, et autres
Publié: (2025)
par: Ouyang, Kun, et autres
Publié: (2025)
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
SpatialLock: Precise Spatial Control in Text-to-Image Synthesis
par: Liu, Biao, et autres
Publié: (2025)
par: Liu, Biao, et autres
Publié: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
par: Long, Yancheng, et autres
Publié: (2026)
par: Long, Yancheng, et autres
Publié: (2026)
SatDreamer360: Multiview-Consistent Generation of Ground-Level Scenes from Satellite Imagery
par: Ze, Xianghui, et autres
Publié: (2025)
par: Ze, Xianghui, et autres
Publié: (2025)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
par: Li, Yian, et autres
Publié: (2026)
par: Li, Yian, et autres
Publié: (2026)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
par: Chen, Jiahua, et autres
Publié: (2026)
par: Chen, Jiahua, et autres
Publié: (2026)
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
par: Deng, Wei, et autres
Publié: (2026)
par: Deng, Wei, et autres
Publié: (2026)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
par: Guo, Jiajie, et autres
Publié: (2025)
par: Guo, Jiajie, et autres
Publié: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
par: Chen, Wei, et autres
Publié: (2026)
par: Chen, Wei, et autres
Publié: (2026)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
par: Zhan, Shaoxiong, et autres
Publié: (2026)
par: Zhan, Shaoxiong, et autres
Publié: (2026)
Vision-Language Memory for Spatial Reasoning
par: Liu, Zuntao, et autres
Publié: (2025)
par: Liu, Zuntao, et autres
Publié: (2025)
ExactDreamer: High-Fidelity Text-to-3D Content Creation via Exact Score Matching
par: Zhang, Yumin, et autres
Publié: (2024)
par: Zhang, Yumin, et autres
Publié: (2024)
Dreamer XL: Towards High-Resolution Text-to-3D Generation via Trajectory Score Matching
par: Miao, Xingyu, et autres
Publié: (2024)
par: Miao, Xingyu, et autres
Publié: (2024)
AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
par: Zhang, Jian, et autres
Publié: (2026)
par: Zhang, Jian, et autres
Publié: (2026)
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
Transferring Spatial Filters via Tangent Space Alignment in Motor Imagery BCIs
par: Gunasar, Tekin, et autres
Publié: (2025)
par: Gunasar, Tekin, et autres
Publié: (2025)
Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
par: Mirjalili, Vahid, et autres
Publié: (2025)
par: Mirjalili, Vahid, et autres
Publié: (2025)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
par: Ma, Wenxin, et autres
Publié: (2026)
par: Ma, Wenxin, et autres
Publié: (2026)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
par: Huang, Xinmiao, et autres
Publié: (2025)
par: Huang, Xinmiao, et autres
Publié: (2025)
Pursuing Minimal Sufficiency in Spatial Reasoning
par: Guo, Yejie, et autres
Publié: (2025)
par: Guo, Yejie, et autres
Publié: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
par: Xu, Runsen, et autres
Publié: (2025)
par: Xu, Runsen, et autres
Publié: (2025)
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation
par: Wang, Haoming, et autres
Publié: (2026)
par: Wang, Haoming, et autres
Publié: (2026)
Documents similaires
-
SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input
par: Lv, Zhen, et autres
Publié: (2024) -
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
par: Cao, Meng, et autres
Publié: (2025) -
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
par: Cao, Meng, et autres
Publié: (2025) -
Video Spatial Reasoning with Object-Centric 3D Rollout
par: Tang, Haoran, et autres
Publié: (2025) -
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
par: Li, Haoyuan, et autres
Publié: (2026)