OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Heyu, Wang, Shanmu, Ma, Ruichun, Jiang, Shiqi, Ghasempour, Yasaman, Abari, Omid, Guo, Baining, Qiu, Lili |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026)
par: Jie, Haoxiang, et autres
Publié: (2026)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
par: Shen, Yichao, et autres
Publié: (2025)
par: Shen, Yichao, et autres
Publié: (2025)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
par: Gu, Chenyang, et autres
Publié: (2025)
par: Gu, Chenyang, et autres
Publié: (2025)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
par: Luo, Yuankai, et autres
Publié: (2026)
par: Luo, Yuankai, et autres
Publié: (2026)
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
par: Cai, Junhao, et autres
Publié: (2026)
par: Cai, Junhao, et autres
Publié: (2026)
Selective Perception for Robot: Task-Aware Attention in Multimodal VLA
par: Son, Young-Chae, et autres
Publié: (2026)
par: Son, Young-Chae, et autres
Publié: (2026)
VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation
par: Zhou, Hui, et autres
Publié: (2025)
par: Zhou, Hui, et autres
Publié: (2025)
PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation
par: Li, Yutai, et autres
Publié: (2026)
par: Li, Yutai, et autres
Publié: (2026)
DroneVLA: VLA based Aerial Manipulation
par: Mehboob, Fawad, et autres
Publié: (2026)
par: Mehboob, Fawad, et autres
Publié: (2026)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
par: Lu, Guanxing, et autres
Publié: (2025)
par: Lu, Guanxing, et autres
Publié: (2025)
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
par: Lin, Min, et autres
Publié: (2025)
par: Lin, Min, et autres
Publié: (2025)
GazeVLA: Learning Human Intention for Robotic Manipulation
par: Li, Chengyang, et autres
Publié: (2026)
par: Li, Chengyang, et autres
Publié: (2026)
TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation
par: Pu, Fanqi, et autres
Publié: (2026)
par: Pu, Fanqi, et autres
Publié: (2026)
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
par: Jiang, Haoran, et autres
Publié: (2025)
par: Jiang, Haoran, et autres
Publié: (2025)
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
par: Jiang, Yuming, et autres
Publié: (2025)
par: Jiang, Yuming, et autres
Publié: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
par: Wei, Xiangyi, et autres
Publié: (2025)
par: Wei, Xiangyi, et autres
Publié: (2025)
ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation
par: Ma, Chuanhao, et autres
Publié: (2026)
par: Ma, Chuanhao, et autres
Publié: (2026)
AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation
par: Gubernatorov, Konstantin, et autres
Publié: (2025)
par: Gubernatorov, Konstantin, et autres
Publié: (2025)
ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation
par: Wu, You, et autres
Publié: (2026)
par: Wu, You, et autres
Publié: (2026)
Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions
par: Fan, Cunxin, et autres
Publié: (2025)
par: Fan, Cunxin, et autres
Publié: (2025)
ProgVLA: Progress-Aware Robot Manipulation Skill Learning
par: Kim, Seungsu, et autres
Publié: (2026)
par: Kim, Seungsu, et autres
Publié: (2026)
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
par: Liu, Zhenyang, et autres
Publié: (2026)
par: Liu, Zhenyang, et autres
Publié: (2026)
How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
par: Jiang, Wenqi, et autres
Publié: (2026)
par: Jiang, Wenqi, et autres
Publié: (2026)
Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation
par: Wang, Fangyuan, et autres
Publié: (2026)
par: Wang, Fangyuan, et autres
Publié: (2026)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
par: Tu, Ruisen, et autres
Publié: (2026)
par: Tu, Ruisen, et autres
Publié: (2026)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
par: Li, Runhao, et autres
Publié: (2025)
par: Li, Runhao, et autres
Publié: (2025)
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
par: Liu, Isabella, et autres
Publié: (2026)
par: Liu, Isabella, et autres
Publié: (2026)
Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation
par: Chen, Haonan, et autres
Publié: (2025)
par: Chen, Haonan, et autres
Publié: (2025)
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
par: Li, Wei, et autres
Publié: (2026)
par: Li, Wei, et autres
Publié: (2026)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
VLA Model-Expert Collaboration for Bi-directional Manipulation Learning
par: Xiang, Tian-Yu, et autres
Publié: (2025)
par: Xiang, Tian-Yu, et autres
Publié: (2025)
Unified Noise Steering for Efficient Human-Guided VLA Adaptation
par: Lu, Junjie, et autres
Publié: (2026)
par: Lu, Junjie, et autres
Publié: (2026)
ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation
par: Yan, Hongyu, et autres
Publié: (2026)
par: Yan, Hongyu, et autres
Publié: (2026)
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation
par: Hanyu, Taisei, et autres
Publié: (2025)
par: Hanyu, Taisei, et autres
Publié: (2025)
A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM
par: Han, ByungOk, et autres
Publié: (2024)
par: Han, ByungOk, et autres
Publié: (2024)
LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics
par: Williams, Justin, et autres
Publié: (2026)
par: Williams, Justin, et autres
Publié: (2026)
Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation
par: Ye, Guo, et autres
Publié: (2025)
par: Ye, Guo, et autres
Publié: (2025)
Documents similaires
-
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
par: Hirose, Noriaki, et autres
Publié: (2025) -
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026) -
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
par: Shen, Yichao, et autres
Publié: (2025) -
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
par: Gu, Chenyang, et autres
Publié: (2025) -
SimVLA: A Simple VLA Baseline for Robotic Manipulation
par: Luo, Yuankai, et autres
Publié: (2026)