SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qu, Delin, Song, Haoming, Chen, Qizhi, Yao, Yuanqi, Ye, Xinyi, Ding, Yan, Wang, Zhigang, Gu, JiaYuan, Zhao, Bin, Wang, Dong, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
par: Gao, Xianqiang, et autres
Publié: (2026)
par: Gao, Xianqiang, et autres
Publié: (2026)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
par: Yao, Yuanqi, et autres
Publié: (2025)
par: Yao, Yuanqi, et autres
Publié: (2025)
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
par: Song, Haoming, et autres
Publié: (2025)
par: Song, Haoming, et autres
Publié: (2025)
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
par: Yan, Chi, et autres
Publié: (2023)
par: Yan, Chi, et autres
Publié: (2023)
Exploring the Potential of Encoder-free Architectures in 3D LMMs
par: Tang, Yiwen, et autres
Publié: (2025)
par: Tang, Yiwen, et autres
Publié: (2025)
FreeGaussian: Annotation-free Control of Articulated Objects via 3D Gaussian Splats with Flow Derivatives
par: Chen, Qizhi, et autres
Publié: (2024)
par: Chen, Qizhi, et autres
Publié: (2024)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
par: Liu, Junli, et autres
Publié: (2025)
par: Liu, Junli, et autres
Publié: (2025)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
par: Gao, Yunpeng, et autres
Publié: (2024)
par: Gao, Yunpeng, et autres
Publié: (2024)
LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control
par: Qu, Delin, et autres
Publié: (2024)
par: Qu, Delin, et autres
Publié: (2024)
EO-1: An Open Unified Embodied Foundation Model for General Robot Control
par: Qu, Delin, et autres
Publié: (2025)
par: Qu, Delin, et autres
Publié: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding
par: Gao, Xianqiang, et autres
Publié: (2024)
par: Gao, Xianqiang, et autres
Publié: (2024)
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation
par: Wang, Haoming, et autres
Publié: (2026)
par: Wang, Haoming, et autres
Publié: (2026)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
par: Wu, Pengyuan, et autres
Publié: (2026)
par: Wu, Pengyuan, et autres
Publié: (2026)
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
par: Feng, Yicheng, et autres
Publié: (2025)
par: Feng, Yicheng, et autres
Publié: (2025)
FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset
par: Zhaxizhuoma, et autres
Publié: (2024)
par: Zhaxizhuoma, et autres
Publié: (2024)
Implicit Event-RGBD Neural SLAM
par: Qu, Delin, et autres
Publié: (2023)
par: Qu, Delin, et autres
Publié: (2023)
FastUMI-100K: Advancing Data-driven Robotic Manipulation with a Large-scale UMI-style Dataset
par: Liu, Kehui, et autres
Publié: (2025)
par: Liu, Kehui, et autres
Publié: (2025)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
par: Pan, Xu, et autres
Publié: (2026)
par: Pan, Xu, et autres
Publié: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
par: Hu, Yutong, et autres
Publié: (2026)
par: Hu, Yutong, et autres
Publié: (2026)
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
par: Li, Fuhao, et autres
Publié: (2025)
par: Li, Fuhao, et autres
Publié: (2025)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026)
par: Jie, Haoxiang, et autres
Publié: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
Exploring Spatial Hybrid User Interface for Visual Sensemaking
par: Tong, Wai, et autres
Publié: (2025)
par: Tong, Wai, et autres
Publié: (2025)
Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding
par: Patratskiy, Maxim A., et autres
Publié: (2025)
par: Patratskiy, Maxim A., et autres
Publié: (2025)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
par: Lin, Minghui, et autres
Publié: (2025)
par: Lin, Minghui, et autres
Publié: (2025)
SurfPatch: Enabling Patch Matching for Exploratory Stream Surface Visualization
par: An, Delin, et autres
Publié: (2025)
par: An, Delin, et autres
Publié: (2025)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
par: Zhu, Juan, et autres
Publié: (2026)
par: Zhu, Juan, et autres
Publié: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
par: Tu, Ruisen, et autres
Publié: (2026)
par: Tu, Ruisen, et autres
Publié: (2026)
CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors
par: Li, Dachong, et autres
Publié: (2026)
par: Li, Dachong, et autres
Publié: (2026)
RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
par: Koo, Jiyeon, et autres
Publié: (2025)
par: Koo, Jiyeon, et autres
Publié: (2025)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
par: Wang, Yiru, et autres
Publié: (2026)
par: Wang, Yiru, et autres
Publié: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
par: Xu, Xiaoxu, et autres
Publié: (2026)
par: Xu, Xiaoxu, et autres
Publié: (2026)
Trajectory Conditioned Cross-embodiment Skill Transfer
par: Tang, YuHang, et autres
Publié: (2025)
par: Tang, YuHang, et autres
Publié: (2025)
Documents similaires
-
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
par: Gao, Xianqiang, et autres
Publié: (2026) -
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
par: Yao, Yuanqi, et autres
Publié: (2025) -
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
par: Song, Haoming, et autres
Publié: (2025) -
GS-SLAM: Dense Visual SLAM with 3D Gaussian Splatting
par: Yan, Chi, et autres
Publié: (2023) -
Exploring the Potential of Encoder-free Architectures in 3D LMMs
par: Tang, Yiwen, et autres
Publié: (2025)