OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hirose, Noriaki, Glossop, Catherine, Shah, Dhruv, Levine, Sergey |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge
par: Hirose, Noriaki, et autres
Publié: (2026)
par: Hirose, Noriaki, et autres
Publié: (2026)
Learning to Drive Anywhere with Model-Based Reannotation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
LeLaN: Learning A Language-Conditioned Navigation Policy from In-the-Wild Videos
par: Hirose, Noriaki, et autres
Publié: (2024)
par: Hirose, Noriaki, et autres
Publié: (2024)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026)
par: Jie, Haoxiang, et autres
Publié: (2026)
CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
par: Glossop, Catherine, et autres
Publié: (2025)
par: Glossop, Catherine, et autres
Publié: (2025)
SELFI: Autonomous Self-Improvement with Reinforcement Learning for Social Navigation
par: Hirose, Noriaki, et autres
Publié: (2024)
par: Hirose, Noriaki, et autres
Publié: (2024)
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
par: Guo, Heyu, et autres
Publié: (2025)
par: Guo, Heyu, et autres
Publié: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
par: Shukor, Mustafa, et autres
Publié: (2025)
par: Shukor, Mustafa, et autres
Publié: (2025)
SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios
par: Gao, Tian, et autres
Publié: (2026)
par: Gao, Tian, et autres
Publié: (2026)
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025)
par: Pertsch, Karl, et autres
Publié: (2025)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
par: Xu, Charles, et autres
Publié: (2026)
par: Xu, Charles, et autres
Publié: (2026)
OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies
par: Song, Yunzhou, et autres
Publié: (2026)
par: Song, Yunzhou, et autres
Publié: (2026)
VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
par: Bi, Jianxin, et autres
Publié: (2025)
par: Bi, Jianxin, et autres
Publié: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
par: Huang, Jialei, et autres
Publié: (2025)
par: Huang, Jialei, et autres
Publié: (2025)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
par: Black, Kevin, et autres
Publié: (2024)
par: Black, Kevin, et autres
Publié: (2024)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
par: Jin, Ruofan, et autres
Publié: (2026)
par: Jin, Ruofan, et autres
Publié: (2026)
CRL-VLA: Continual Vision-Language-Action Learning
par: Zeng, Qixin, et autres
Publié: (2026)
par: Zeng, Qixin, et autres
Publié: (2026)
DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
OmniDexVLG: Learning Dexterous Grasp Generation from Vision Language Model-Guided Grasp Semantics, Taxonomy and Functional Affordance
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
par: Im, Hokyun, et autres
Publié: (2025)
par: Im, Hokyun, et autres
Publié: (2025)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
par: Xiong, Zheng, et autres
Publié: (2025)
par: Xiong, Zheng, et autres
Publié: (2025)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
par: Yin, Cheng, et autres
Publié: (2025)
par: Yin, Cheng, et autres
Publié: (2025)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
par: Feng, Yunhai, et autres
Publié: (2025)
par: Feng, Yunhai, et autres
Publié: (2025)
Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation
par: Yang, Jonathan, et autres
Publié: (2024)
par: Yang, Jonathan, et autres
Publié: (2024)
KALIE: Fine-Tuning Vision-Language Models for Open-World Manipulation without Robot Data
par: Tang, Grace, et autres
Publié: (2024)
par: Tang, Grace, et autres
Publié: (2024)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
par: Torne, Marcel, et autres
Publié: (2026)
par: Torne, Marcel, et autres
Publié: (2026)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025)
par: Driess, Danny, et autres
Publié: (2025)
DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
par: Lin, Sixu, et autres
Publié: (2026)
par: Lin, Sixu, et autres
Publié: (2026)
Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation
par: Kobayashi, Masato, et autres
Publié: (2025)
par: Kobayashi, Masato, et autres
Publié: (2025)
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
Reinforcement Learning with Action Chunking
par: Li, Qiyang, et autres
Publié: (2025)
par: Li, Qiyang, et autres
Publié: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
par: Chen, William, et autres
Publié: (2026)
par: Chen, William, et autres
Publié: (2026)
PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies
par: Jain, Arhan, et autres
Publié: (2025)
par: Jain, Arhan, et autres
Publié: (2025)
Tactile Modality Fusion for Vision-Language-Action Models
par: Morissette, Charlotte, et autres
Publié: (2026)
par: Morissette, Charlotte, et autres
Publié: (2026)
Documents similaires
-
AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge
par: Hirose, Noriaki, et autres
Publié: (2026) -
Learning to Drive Anywhere with Model-Based Reannotation
par: Hirose, Noriaki, et autres
Publié: (2025) -
LeLaN: Learning A Language-Conditioned Navigation Policy from In-the-Wild Videos
par: Hirose, Noriaki, et autres
Publié: (2024) -
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
par: Jie, Haoxiang, et autres
Publié: (2026) -
CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
par: Glossop, Catherine, et autres
Publié: (2025)