STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Yuhan, Yan, Yuping, Zhao, Yunqi, Wang, Handing, Jin, Yaochu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
por: Yan, Yuping, et al.
Publicado: (2025)
por: Yan, Yuping, et al.
Publicado: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
por: Zhang, Hongyin, et al.
Publicado: (2025)
por: Zhang, Hongyin, et al.
Publicado: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
por: Deng, Shengliang, et al.
Publicado: (2025)
por: Deng, Shengliang, et al.
Publicado: (2025)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
por: Guo, Xinyu, et al.
Publicado: (2026)
por: Guo, Xinyu, et al.
Publicado: (2026)
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)
por: Zeng, Qixin, et al.
Publicado: (2026)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
por: Zhu, Ziyue, et al.
Publicado: (2026)
por: Zhu, Ziyue, et al.
Publicado: (2026)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
por: Li, Meng, et al.
Publicado: (2025)
por: Li, Meng, et al.
Publicado: (2025)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
por: Luo, Jingzhou, et al.
Publicado: (2026)
por: Luo, Jingzhou, et al.
Publicado: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
por: Budzianowski, Paweł, et al.
Publicado: (2025)
por: Budzianowski, Paweł, et al.
Publicado: (2025)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
por: Tu, Ruisen, et al.
Publicado: (2026)
por: Tu, Ruisen, et al.
Publicado: (2026)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
por: Li, Ye, et al.
Publicado: (2026)
por: Li, Ye, et al.
Publicado: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
por: Wang, Yihao, et al.
Publicado: (2025)
por: Wang, Yihao, et al.
Publicado: (2025)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
por: Zang, Hongzhi, et al.
Publicado: (2025)
por: Zang, Hongzhi, et al.
Publicado: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
por: Ye, Jinhui, et al.
Publicado: (2026)
por: Ye, Jinhui, et al.
Publicado: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
por: Shen, Boyang, et al.
Publicado: (2026)
por: Shen, Boyang, et al.
Publicado: (2026)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
por: Jie, Haoxiang, et al.
Publicado: (2026)
por: Jie, Haoxiang, et al.
Publicado: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
por: Jin, Ruofan, et al.
Publicado: (2026)
por: Jin, Ruofan, et al.
Publicado: (2026)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
por: Peng, Zhenghao "Mark", et al.
Publicado: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
por: Li, Boyu, et al.
Publicado: (2026)
por: Li, Boyu, et al.
Publicado: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
por: Wang, Zixuan, et al.
Publicado: (2026)
por: Wang, Zixuan, et al.
Publicado: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
por: Cen, Jun, et al.
Publicado: (2025)
por: Cen, Jun, et al.
Publicado: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
por: Kim, Moo Jin, et al.
Publicado: (2024)
por: Kim, Moo Jin, et al.
Publicado: (2024)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
por: Zhao, Han, et al.
Publicado: (2025)
por: Zhao, Han, et al.
Publicado: (2025)
TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
por: Zhang, Zongzheng, et al.
Publicado: (2025)
por: Zhang, Zongzheng, et al.
Publicado: (2025)
RoboNurse-VLA: Robotic Scrub Nurse System based on Vision-Language-Action Model
por: Li, Shunlei, et al.
Publicado: (2024)
por: Li, Shunlei, et al.
Publicado: (2024)
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
por: Zhao, Ruihan, et al.
Publicado: (2025)
por: Zhao, Ruihan, et al.
Publicado: (2025)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
por: Guo, Peizheng, et al.
Publicado: (2026)
por: Guo, Peizheng, et al.
Publicado: (2026)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
por: Zhu, Xiang, et al.
Publicado: (2026)
por: Zhu, Xiang, et al.
Publicado: (2026)
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
por: Peng, Xiongfeng, et al.
Publicado: (2026)
por: Peng, Xiongfeng, et al.
Publicado: (2026)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
por: Zhang, Kaidi, et al.
Publicado: (2026)
por: Zhang, Kaidi, et al.
Publicado: (2026)
AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models
por: Heo, Hyeongjun, et al.
Publicado: (2026)
por: Heo, Hyeongjun, et al.
Publicado: (2026)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Ejemplares similares
-
When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
por: Yan, Yuping, et al.
Publicado: (2025) -
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
por: Zhang, Hongyin, et al.
Publicado: (2025) -
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
por: Deng, Shengliang, et al.
Publicado: (2025) -
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
por: Guo, Xinyu, et al.
Publicado: (2026) -
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)