Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Shengchao, Chen, Yuxin, Ge, Yuying, Huang, Wei, Lin, Jiehong, Shan, Ying, Qi, Xiaojuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
par: Ma, Shijie, et autres
Publié: (2025)
par: Ma, Shijie, et autres
Publié: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
par: Deng, Weipeng, et autres
Publié: (2024)
par: Deng, Weipeng, et autres
Publié: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024)
par: Li, Yizhuo, et autres
Publié: (2024)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
par: Wei, Yuxi, et autres
Publié: (2026)
par: Wei, Yuxi, et autres
Publié: (2026)
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024)
par: Li, Bohao, et autres
Publié: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
SEED-Story: Multimodal Long Story Generation with Large Language Model
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
par: Deng, Wei, et autres
Publié: (2026)
par: Deng, Wei, et autres
Publié: (2026)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
par: Liu, Chenghao, et autres
Publié: (2025)
par: Liu, Chenghao, et autres
Publié: (2025)
SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose Estimation
par: Lin, Jiehong, et autres
Publié: (2023)
par: Lin, Jiehong, et autres
Publié: (2023)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
par: Ma, Chenyang, et autres
Publié: (2024)
par: Ma, Chenyang, et autres
Publié: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
par: Qiu, Lu, et autres
Publié: (2024)
par: Qiu, Lu, et autres
Publié: (2024)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
par: Huang, Xinmiao, et autres
Publié: (2025)
par: Huang, Xinmiao, et autres
Publié: (2025)
DO3D: Self-supervised Learning of Decomposed Object-aware 3D Motion and Depth from Monocular Videos
par: Wu, Xiuzhe, et autres
Publié: (2024)
par: Wu, Xiuzhe, et autres
Publié: (2024)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
par: Liang, Huizhi, et autres
Publié: (2026)
par: Liang, Huizhi, et autres
Publié: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
par: Song, Python, et autres
Publié: (2025)
par: Song, Python, et autres
Publié: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
SpatialBot: Precise Spatial Understanding with Vision Language Models
par: Cai, Wenxiao, et autres
Publié: (2024)
par: Cai, Wenxiao, et autres
Publié: (2024)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
par: Cheng, Cheng, et autres
Publié: (2023)
par: Cheng, Cheng, et autres
Publié: (2023)
Embodied Scene Understanding for Vision Language Models via MetaVQA
par: Wang, Weizhen, et autres
Publié: (2025)
par: Wang, Weizhen, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
par: Xie, Yuechen, et autres
Publié: (2026)
par: Xie, Yuechen, et autres
Publié: (2026)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
par: Xia, Zhongyu, et autres
Publié: (2026)
par: Xia, Zhongyu, et autres
Publié: (2026)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
Documents similaires
-
ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation
par: Zhou, Shengchao, et autres
Publié: (2025) -
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
par: Ma, Shijie, et autres
Publié: (2025) -
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025) -
Can 3D Vision-Language Models Truly Understand Natural Language?
par: Deng, Weipeng, et autres
Publié: (2024) -
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024)