Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Wei, Long, Yancheng, Liu, Mingqiao, Ding, Haojie, Yang, Yankai, Wei, Hongyang, Zhang, Yi-Fan, Wen, Bin, Yang, Fan, Gao, Tingting, Li, Han, Chen, Long |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
par: Long, Yancheng, et autres
Publié: (2026)
par: Long, Yancheng, et autres
Publié: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
par: Yang, Yankai, et autres
Publié: (2026)
par: Yang, Yankai, et autres
Publié: (2026)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
par: Hu, Yuhang, et autres
Publié: (2025)
par: Hu, Yuhang, et autres
Publié: (2025)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
par: Wei, Hongyang, et autres
Publié: (2026)
par: Wei, Hongyang, et autres
Publié: (2026)
Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI
par: Chang, Ching-Chun, et autres
Publié: (2025)
par: Chang, Ching-Chun, et autres
Publié: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM
par: Zha, Jirong, et autres
Publié: (2025)
par: Zha, Jirong, et autres
Publié: (2025)
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
par: Gao, Xiangjun, et autres
Publié: (2026)
par: Gao, Xiangjun, et autres
Publié: (2026)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
par: Ou, Siqu, et autres
Publié: (2025)
par: Ou, Siqu, et autres
Publié: (2025)
EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence
par: Wan, Jiaxu, et autres
Publié: (2025)
par: Wan, Jiaxu, et autres
Publié: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
par: Li, Yian, et autres
Publié: (2026)
par: Li, Yian, et autres
Publié: (2026)
Spatia: Video Generation with Updatable Spatial Memory
par: Zhao, Jinjing, et autres
Publié: (2025)
par: Zhao, Jinjing, et autres
Publié: (2025)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
par: Dai, Xuanlang, et autres
Publié: (2026)
par: Dai, Xuanlang, et autres
Publié: (2026)
Controllable Navigation Instruction Generation with Chain of Thought Prompting
par: Kong, Xianghao, et autres
Publié: (2024)
par: Kong, Xianghao, et autres
Publié: (2024)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
par: Li, Jiangyang, et autres
Publié: (2026)
par: Li, Jiangyang, et autres
Publié: (2026)
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image
par: Wang, Zefeng, et autres
Publié: (2024)
par: Wang, Zefeng, et autres
Publié: (2024)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
par: Chen, Jiahua, et autres
Publié: (2026)
par: Chen, Jiahua, et autres
Publié: (2026)
SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
par: Liu, Yuecheng, et autres
Publié: (2025)
par: Liu, Yuecheng, et autres
Publié: (2025)
EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection
par: Wang, Tianyu, et autres
Publié: (2026)
par: Wang, Tianyu, et autres
Publié: (2026)
Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
par: Zhao, Wangbo, et autres
Publié: (2025)
par: Zhao, Wangbo, et autres
Publié: (2025)
SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
par: Pham, Kien T., et autres
Publié: (2025)
par: Pham, Kien T., et autres
Publié: (2025)
Spatial Preference Rewarding for MLLMs Spatial Understanding
par: Qiu, Han, et autres
Publié: (2025)
par: Qiu, Han, et autres
Publié: (2025)
Markov Chain of Thought for Efficient Mathematical Reasoning
par: Yang, Wen, et autres
Publié: (2024)
par: Yang, Wen, et autres
Publié: (2024)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
From Semantics to Pixels: Coarse-to-Fine Masked Autoencoders for Hierarchical Visual Understanding
par: Xiang, Wenzhao, et autres
Publié: (2026)
par: Xiang, Wenzhao, et autres
Publié: (2026)
MVAR: Visual Autoregressive Modeling with Scale and Spatial Markovian Conditioning
par: Zhang, Jinhua, et autres
Publié: (2025)
par: Zhang, Jinhua, et autres
Publié: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
par: Qi, Zekun, et autres
Publié: (2025)
par: Qi, Zekun, et autres
Publié: (2025)
Documents similaires
-
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
par: Long, Yancheng, et autres
Publié: (2026) -
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
par: Yang, Yankai, et autres
Publié: (2026) -
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
par: Chen, Wei, et autres
Publié: (2024) -
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
par: Hu, Yuhang, et autres
Publié: (2025) -
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
par: Wei, Hongyang, et autres
Publié: (2026)