RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Jingzhou, Wen, Yifan, Bai, Yongjie, Song, Xinshuai, Liu, Yang, Lin, Liang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
par: Dai, Mingtong, et autres
Publié: (2025)
par: Dai, Mingtong, et autres
Publié: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026)
par: Zhong, Linqing, et autres
Publié: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
par: Wang, Yihao, et autres
Publié: (2025)
par: Wang, Yihao, et autres
Publié: (2025)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
par: Huang, Jialei, et autres
Publié: (2025)
par: Huang, Jialei, et autres
Publié: (2025)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026)
par: Liufu, Weijia, et autres
Publié: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
par: Zhu, Ziyue, et autres
Publié: (2026)
par: Zhu, Ziyue, et autres
Publié: (2026)
FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
par: Lin, Minghui, et autres
Publié: (2025)
par: Lin, Minghui, et autres
Publié: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations
par: Liu, Hanqing, et autres
Publié: (2025)
par: Liu, Hanqing, et autres
Publié: (2025)
OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
par: Lin, Fanqi, et autres
Publié: (2025)
par: Lin, Fanqi, et autres
Publié: (2025)
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
par: Abouzeid, Ali, et autres
Publié: (2025)
par: Abouzeid, Ali, et autres
Publié: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
par: Xu, Xiaoxu, et autres
Publié: (2026)
par: Xu, Xiaoxu, et autres
Publié: (2026)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
par: Deng, Shengliang, et autres
Publié: (2025)
par: Deng, Shengliang, et autres
Publié: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
par: Fan, Yiguo, et autres
Publié: (2025)
par: Fan, Yiguo, et autres
Publié: (2025)
STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations
par: Xie, Yuhan, et autres
Publié: (2026)
par: Xie, Yuhan, et autres
Publié: (2026)
TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
par: Zhang, Zongzheng, et autres
Publié: (2025)
par: Zhang, Zongzheng, et autres
Publié: (2025)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
par: Sun, Jianli, et autres
Publié: (2026)
par: Sun, Jianli, et autres
Publié: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)
par: Budzianowski, Paweł, et autres
Publié: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
par: Peng, Zhenghao "Mark", et autres
Publié: (2025)
ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
par: Jang, Huiwon, et autres
Publié: (2025)
par: Jang, Huiwon, et autres
Publié: (2025)
TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments
par: Huang, Zhiyu, et autres
Publié: (2026)
par: Huang, Zhiyu, et autres
Publié: (2026)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models
par: Heo, Hyeongjun, et autres
Publié: (2026)
par: Heo, Hyeongjun, et autres
Publié: (2026)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
par: Li, Jiashun, et autres
Publié: (2026)
par: Li, Jiashun, et autres
Publié: (2026)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
par: Xie, Haozhe, et autres
Publié: (2026)
par: Xie, Haozhe, et autres
Publié: (2026)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
par: Zhao, Han, et autres
Publié: (2025)
par: Zhao, Han, et autres
Publié: (2025)
Documents similaires
-
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
par: Dai, Mingtong, et autres
Publié: (2025) -
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
par: Song, Wenxuan, et autres
Publié: (2025) -
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025) -
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
par: Zhong, Linqing, et autres
Publié: (2026) -
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
par: Wang, Yihao, et autres
Publié: (2025)