Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Zhiyuan, Kang, Zhaolu, Wang, Qijie, Du, Zhiying, Yan, Jiongrui, Shi, Shubin, Yuan, Chengbo, Liang, Huizhi, Deng, Yu, Li, Qixiu, Yang, Rushuai, An, Arctanx, Zheng, Leqi, Wang, Weijie, Chen, Shawn, Xu, Sicheng, Liang, Yaobo, Yang, Jiaolong, Guo, Baining |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
by: Feng, ZhiYuan, et al.
Published: (2026)
by: Feng, ZhiYuan, et al.
Published: (2026)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
by: Liang, Huizhi, et al.
Published: (2026)
by: Liang, Huizhi, et al.
Published: (2026)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
by: Shen, Yichao, et al.
Published: (2025)
by: Shen, Yichao, et al.
Published: (2025)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
by: Li, Qixiu, et al.
Published: (2025)
by: Li, Qixiu, et al.
Published: (2025)
MobileManiBench: Simplifying Model Verification for Mobile Manipulation
by: Wang, Wenbo, et al.
Published: (2026)
by: Wang, Wenbo, et al.
Published: (2026)
Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
by: Zhang, Bowen, et al.
Published: (2025)
by: Zhang, Bowen, et al.
Published: (2025)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
by: Li, Qixiu, et al.
Published: (2024)
by: Li, Qixiu, et al.
Published: (2024)
HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
by: Du, Zhiying, et al.
Published: (2025)
by: Du, Zhiying, et al.
Published: (2025)
VASA-3D: Lifelike Audio-Driven Gaussian Head Avatars from a Single Image
by: Xu, Sicheng, et al.
Published: (2025)
by: Xu, Sicheng, et al.
Published: (2025)
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
by: Xu, Sicheng, et al.
Published: (2026)
by: Xu, Sicheng, et al.
Published: (2026)
Solid‐State Lithium Electrolytes: Characteristic of Floating Li Inside of Anion Framework
by: Shipeng Liang, et al.
Published: (2026)
by: Shipeng Liang, et al.
Published: (2026)
UniGraspTransformer: Simplified Policy Distillation for Scalable Dexterous Robotic Grasping
by: Wang, Wenbo, et al.
Published: (2024)
by: Wang, Wenbo, et al.
Published: (2024)
Cross-Temporal 3D Gaussian Splatting for Sparse-View Guided Scene Update
by: An, Zeyuan, et al.
Published: (2025)
by: An, Zeyuan, et al.
Published: (2025)
VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time
by: Xu, Sicheng, et al.
Published: (2024)
by: Xu, Sicheng, et al.
Published: (2024)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
by: Liang, Dayong, et al.
Published: (2025)
by: Liang, Dayong, et al.
Published: (2025)
Graph Your Way to Inspiration: Integrating Co-Author Graphs with Retrieval-Augmented Generation for Large Language Model Based Scientific Idea Generation
by: Xie, Pengzhen, et al.
Published: (2025)
by: Xie, Pengzhen, et al.
Published: (2025)
nicolay-r at SemEval-2024 Task 3: Using Flan-T5 for Reasoning Emotion Cause in Conversations with Chain-of-Thought on Emotion States
by: Rusnachenko, Nicolay, et al.
Published: (2024)
by: Rusnachenko, Nicolay, et al.
Published: (2024)
GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
by: Lu, Hannan, et al.
Published: (2024)
by: Lu, Hannan, et al.
Published: (2024)
Phase-Consistent Magnetic Spectral Learning for Multi-View Clustering
by: Lu, Mingdong, et al.
Published: (2026)
by: Lu, Mingdong, et al.
Published: (2026)
Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes
by: Wang, Yin, et al.
Published: (2026)
by: Wang, Yin, et al.
Published: (2026)
Self-Supervised Monocular 4D Scene Reconstruction for Egocentric Videos
by: Yuan, Chengbo, et al.
Published: (2024)
by: Yuan, Chengbo, et al.
Published: (2024)
MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision
by: Wang, Ruicheng, et al.
Published: (2024)
by: Wang, Ruicheng, et al.
Published: (2024)
PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems
by: Wang, Weijie, et al.
Published: (2026)
by: Wang, Weijie, et al.
Published: (2026)
RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
Chinchunmei at SemEval-2025 Task 11: Boosting the Large Language Model's Capability of Emotion Perception using Contrastive Learning
by: Li, Tian, et al.
Published: (2025)
by: Li, Tian, et al.
Published: (2025)
Review of Explainable Graph-Based Recommender Systems
by: Markchom, Thanet, et al.
Published: (2024)
by: Markchom, Thanet, et al.
Published: (2024)
NCL-BU at SemEval-2026 Task 3: Fine-tuning XLM-RoBERTa for Multilingual Dimensional Sentiment Regression
by: Wu, Tong, et al.
Published: (2026)
by: Wu, Tong, et al.
Published: (2026)
NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Rating
by: Wu, Tong, et al.
Published: (2026)
by: Wu, Tong, et al.
Published: (2026)
CRRG-CLIP: Automatic Generation of Chest Radiology Reports and Classification of Chest Radiographs
by: Xu, Jianfei, et al.
Published: (2024)
by: Xu, Jianfei, et al.
Published: (2024)
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
by: Bai, Yongjie, et al.
Published: (2025)
by: Bai, Yongjie, et al.
Published: (2025)
RGB-Only Gaussian Splatting SLAM for Unbounded Outdoor Scenes
by: Yu, Sicheng, et al.
Published: (2025)
by: Yu, Sicheng, et al.
Published: (2025)
GS: Generative Segmentation via Label Diffusion
by: Chen, Yuhao, et al.
Published: (2025)
by: Chen, Yuhao, et al.
Published: (2025)
See in Depth: Training-Free Surgical Scene Segmentation with Monocular Depth Priors
by: Yang, Kunyi, et al.
Published: (2025)
by: Yang, Kunyi, et al.
Published: (2025)
Direct Preference Optimization for LLM-Enhanced Recommendation Systems
by: Sun, Chao, et al.
Published: (2024)
by: Sun, Chao, et al.
Published: (2024)
Leveraging Queue Length and Attention Mechanisms for Enhanced Traffic Signal Control Optimization
by: Zhang, Liang, et al.
Published: (2021)
by: Zhang, Liang, et al.
Published: (2021)
SplatBright: Generalizable Low-Light Scene Reconstruction from Sparse Views via Physically-Guided Gaussian Enhancement
by: Wen, Yue, et al.
Published: (2025)
by: Wen, Yue, et al.
Published: (2025)
Interventional Causal Structure Discovery over Graphical Models with Convergence and Optimality Guarantees
by: Chengbo, Qiu, et al.
Published: (2024)
by: Chengbo, Qiu, et al.
Published: (2024)
Diffusion Models are Geometry Critics: Single Image 3D Editing Using Pre-Trained Diffusion Priors
by: Wang, Ruicheng, et al.
Published: (2024)
by: Wang, Ruicheng, et al.
Published: (2024)
Effects of public and private regulations on wholesale vendors' adoption of agrifood traceability to farms
by: Jiehong Zhou, et al.
Published: (2024)
by: Jiehong Zhou, et al.
Published: (2024)
Similar Items
-
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
by: Feng, ZhiYuan, et al.
Published: (2026) -
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
by: Liang, Huizhi, et al.
Published: (2026) -
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
by: Shen, Yichao, et al.
Published: (2025) -
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
by: Li, Qixiu, et al.
Published: (2025) -
MobileManiBench: Simplifying Model Verification for Mobile Manipulation
by: Wang, Wenbo, et al.
Published: (2026)