Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gholami, Mohsen, Rezaei, Ahmad, Weimin, Zhou, Mao, Sitong, Zhou, Shunbo, Zhang, Yong, Akbari, Mohammad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CPPO: Contrastive Perception Policy Optimization for VLM Agents
par: Rezaei, Ahmad, et autres
Publié: (2026)
par: Rezaei, Ahmad, et autres
Publié: (2026)
CASP: Compression of Large Multimodal Models Based on Attention Sparsity
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
par: Wei, Dongxu, et autres
Publié: (2024)
par: Wei, Dongxu, et autres
Publié: (2024)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
par: Feng, Zhiyuan, et autres
Publié: (2025)
par: Feng, Zhiyuan, et autres
Publié: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
Dual-Attention Frequency Fusion at Multi-Scale for Joint Segmentation and Deformable Medical Image Registration
par: Zhou, Hongchao, et autres
Publié: (2024)
par: Zhou, Hongchao, et autres
Publié: (2024)
LaWa: Using Latent Space for In-Generation Image Watermarking
par: Rezaei, Ahmad, et autres
Publié: (2024)
par: Rezaei, Ahmad, et autres
Publié: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
par: Li, Chengzu, et autres
Publié: (2024)
par: Li, Chengzu, et autres
Publié: (2024)
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
par: Hou, Ruibing, et autres
Publié: (2026)
par: Hou, Ruibing, et autres
Publié: (2026)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
par: Zheng, Henry, et autres
Publié: (2025)
par: Zheng, Henry, et autres
Publié: (2025)
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
par: Huang, Junsheng, et autres
Publié: (2025)
par: Huang, Junsheng, et autres
Publié: (2025)
Deformable Image Registration with Multi-scale Feature Fusion from Shared Encoder, Auxiliary and Pyramid Decoders
par: Zhou, Hongchao, et autres
Publié: (2024)
par: Zhou, Hongchao, et autres
Publié: (2024)
MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction
par: Li, Bate, et autres
Publié: (2025)
par: Li, Bate, et autres
Publié: (2025)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
par: Ge, Mengmeng, et autres
Publié: (2026)
par: Ge, Mengmeng, et autres
Publié: (2026)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
par: Liu, Yuanyuan, et autres
Publié: (2025)
par: Liu, Yuanyuan, et autres
Publié: (2025)
Scale Disparity of Instances in Interactive Point Cloud Segmentation
par: Han, Chenrui, et autres
Publié: (2024)
par: Han, Chenrui, et autres
Publié: (2024)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
par: Liang, Dayong, et autres
Publié: (2025)
par: Liang, Dayong, et autres
Publié: (2025)
GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control
par: Hassan, Mariam, et autres
Publié: (2024)
par: Hassan, Mariam, et autres
Publié: (2024)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
par: Lee, Youngwan, et autres
Publié: (2026)
par: Lee, Youngwan, et autres
Publié: (2026)
PanopticSplatting: End-to-End Panoptic Gaussian Splatting
par: Xie, Yuxuan, et autres
Publié: (2025)
par: Xie, Yuxuan, et autres
Publié: (2025)
PanopticRecon: Leverage Open-vocabulary Instance Segmentation for Zero-shot Panoptic Reconstruction
par: Yu, Xuan, et autres
Publié: (2024)
par: Yu, Xuan, et autres
Publié: (2024)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
par: Ma, Wenxin, et autres
Publié: (2026)
par: Ma, Wenxin, et autres
Publié: (2026)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
par: Schäfer, Finn Rasmus, et autres
Publié: (2026)
par: Schäfer, Finn Rasmus, et autres
Publié: (2026)
EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
par: Zhou, Heng, et autres
Publié: (2026)
par: Zhou, Heng, et autres
Publié: (2026)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
par: Liang, Zhixuan, et autres
Publié: (2025)
par: Liang, Zhixuan, et autres
Publié: (2025)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
3D Scene Change Modeling With Consistent Multi-View Aggregation
par: Zhou, Zirui, et autres
Publié: (2025)
par: Zhou, Zirui, et autres
Publié: (2025)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
par: Zhan, Shaoxiong, et autres
Publié: (2026)
par: Zhan, Shaoxiong, et autres
Publié: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
par: Mirjalili, Vahid, et autres
Publié: (2025)
par: Mirjalili, Vahid, et autres
Publié: (2025)
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
par: Fu, Yuqian, et autres
Publié: (2024)
par: Fu, Yuqian, et autres
Publié: (2024)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
par: Li, Ling, et autres
Publié: (2024)
par: Li, Ling, et autres
Publié: (2024)
Pedestrian Intention Prediction via Vision-Language Foundation Models
par: Azarmi, Mohsen, et autres
Publié: (2025)
par: Azarmi, Mohsen, et autres
Publié: (2025)
EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding
par: Özsoy, Ege, et autres
Publié: (2025)
par: Özsoy, Ege, et autres
Publié: (2025)
Learning Multi-View Spatial Reasoning from Cross-View Relations
par: Jeong, Suchae, et autres
Publié: (2026)
par: Jeong, Suchae, et autres
Publié: (2026)
SPFFNet: Strip Perception and Feature Fusion Spatial Pyramid Pooling for Fabric Defect Detection
par: Zhao, Peizhe, et autres
Publié: (2025)
par: Zhao, Peizhe, et autres
Publié: (2025)
Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language Reasoning
par: Li, Rui, et autres
Publié: (2024)
par: Li, Rui, et autres
Publié: (2024)
Documents similaires
-
CPPO: Contrastive Perception Policy Optimization for VLM Agents
par: Rezaei, Ahmad, et autres
Publié: (2026) -
CASP: Compression of Large Multimodal Models Based on Attention Sparsity
par: Gholami, Mohsen, et autres
Publié: (2025) -
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
par: Wei, Dongxu, et autres
Publié: (2024) -
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
par: Feng, Zhiyuan, et autres
Publié: (2025) -
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)