SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tu, Ruisen, Shukla, Arth, Yoo, Sohyun, Li, Xuanlin, Li, Junxi, Xie, Jianwen, Su, Hao, Tu, Zhuowen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks
par: Shukla, Arth, et autres
Publié: (2024)
par: Shukla, Arth, et autres
Publié: (2024)
Seeing the Bigger Picture: 3D Latent Mapping for Mobile Manipulation Policy Learning
par: Kim, Sunghwan, et autres
Publié: (2025)
par: Kim, Sunghwan, et autres
Publié: (2025)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
par: Zhu, Juan, et autres
Publié: (2026)
par: Zhu, Juan, et autres
Publié: (2026)
AffordanceLLM: Grounding Affordance from Vision Language Models
par: Qian, Shengyi, et autres
Publié: (2024)
par: Qian, Shengyi, et autres
Publié: (2024)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
par: Sun, Jianli, et autres
Publié: (2026)
par: Sun, Jianli, et autres
Publié: (2026)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
par: Wei, Xiangyi, et autres
Publié: (2025)
par: Wei, Xiangyi, et autres
Publié: (2025)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
par: Peng, Xiongfeng, et autres
Publié: (2026)
par: Peng, Xiongfeng, et autres
Publié: (2026)
PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction
par: Zhang, Xiang, et autres
Publié: (2026)
par: Zhang, Xiang, et autres
Publié: (2026)
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
par: Li, Pengteng, et autres
Publié: (2026)
par: Li, Pengteng, et autres
Publié: (2026)
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
par: Miao, Cui, et autres
Publié: (2025)
par: Miao, Cui, et autres
Publié: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation
par: Huang, Yuzhe, et autres
Publié: (2026)
par: Huang, Yuzhe, et autres
Publié: (2026)
AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
par: Takagi, Yusuke, et autres
Publié: (2026)
par: Takagi, Yusuke, et autres
Publié: (2026)
Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning
par: Tao, Stone, et autres
Publié: (2024)
par: Tao, Stone, et autres
Publié: (2024)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
par: Yu, Wenda, et autres
Publié: (2026)
par: Yu, Wenda, et autres
Publié: (2026)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation
par: Yang, Zebin, et autres
Publié: (2026)
par: Yang, Zebin, et autres
Publié: (2026)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
par: Xie, Haozhe, et autres
Publié: (2026)
par: Xie, Haozhe, et autres
Publié: (2026)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026)
par: Shen, Boyang, et autres
Publié: (2026)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
par: Hu, Yucheng, et autres
Publié: (2026)
par: Hu, Yucheng, et autres
Publié: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
par: Xu, Xiaoxu, et autres
Publié: (2026)
par: Xu, Xiaoxu, et autres
Publié: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
par: Grover, Shresth, et autres
Publié: (2025)
par: Grover, Shresth, et autres
Publié: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
par: Deng, Shengliang, et autres
Publié: (2025)
par: Deng, Shengliang, et autres
Publié: (2025)
SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning
par: Pan, Xu, et autres
Publié: (2026)
par: Pan, Xu, et autres
Publié: (2026)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
par: Su, Taiyi, et autres
Publié: (2026)
par: Su, Taiyi, et autres
Publié: (2026)
CRL-VLA: Continual Vision-Language-Action Learning
par: Zeng, Qixin, et autres
Publié: (2026)
par: Zeng, Qixin, et autres
Publié: (2026)
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
par: Lin, Min, et autres
Publié: (2025)
par: Lin, Min, et autres
Publié: (2025)
CoFreeVLA: Collision-Free Dual-Arm Manipulation via Vision-Language-Action Model and Risk Estimation
par: Zhai, Xuanran, et autres
Publié: (2026)
par: Zhai, Xuanran, et autres
Publié: (2026)
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
par: Wang, Zhangyuan, et autres
Publié: (2025)
par: Wang, Zhangyuan, et autres
Publié: (2025)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
par: Li, Runhao, et autres
Publié: (2025)
par: Li, Runhao, et autres
Publié: (2025)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
par: Zhao, Ruiteng, et autres
Publié: (2026)
par: Zhao, Ruiteng, et autres
Publié: (2026)
PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation
par: Cao, Haofan, et autres
Publié: (2026)
par: Cao, Haofan, et autres
Publié: (2026)
RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
par: Koo, Jiyeon, et autres
Publié: (2025)
par: Koo, Jiyeon, et autres
Publié: (2025)
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
par: Huang, Helong, et autres
Publié: (2025)
par: Huang, Helong, et autres
Publié: (2025)
Documents similaires
-
ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks
par: Shukla, Arth, et autres
Publié: (2024) -
Seeing the Bigger Picture: 3D Latent Mapping for Mobile Manipulation Policy Learning
par: Kim, Sunghwan, et autres
Publié: (2025) -
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
par: Zhu, Juan, et autres
Publié: (2026) -
AffordanceLLM: Grounding Affordance from Vision Language Models
par: Qian, Shengyi, et autres
Publié: (2024) -
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
par: Sun, Jianli, et autres
Publié: (2026)