Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hancock, Asher J., Ren, Allen Z., Majumdar, Anirudha |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
par: Hancock, Asher J., et autres
Publié: (2025)
par: Hancock, Asher J., et autres
Publié: (2025)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025)
par: Driess, Danny, et autres
Publié: (2025)
Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
par: Majumdar, Anirudha
Publié: (2025)
par: Majumdar, Anirudha
Publié: (2025)
LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer
par: Zha, Lihan, et autres
Publié: (2026)
par: Zha, Lihan, et autres
Publié: (2026)
Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping
par: Snyder, David, et autres
Publié: (2025)
par: Snyder, David, et autres
Publié: (2025)
Thinking Forward and Backward: Effective Backward Planning with Large Language Models
par: Ren, Allen Z., et autres
Publié: (2024)
par: Ren, Allen Z., et autres
Publié: (2024)
Diffusion Policy Policy Optimization
par: Ren, Allen Z., et autres
Publié: (2024)
par: Ren, Allen Z., et autres
Publié: (2024)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
par: Torne, Marcel, et autres
Publié: (2026)
par: Torne, Marcel, et autres
Publié: (2026)
Explore until Confident: Efficient Exploration for Embodied Question Answering
par: Ren, Allen Z., et autres
Publié: (2024)
par: Ren, Allen Z., et autres
Publié: (2024)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025)
par: Pertsch, Karl, et autres
Publié: (2025)
Guiding Data Collection via Factored Scaling Curves
par: Zha, Lihan, et autres
Publié: (2025)
par: Zha, Lihan, et autres
Publié: (2025)
Confidence Calibration in Vision-Language-Action Models
par: Zollo, Thomas P, et autres
Publié: (2025)
par: Zollo, Thomas P, et autres
Publié: (2025)
Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
par: Zhang, Zhilong, et autres
Publié: (2026)
par: Zhang, Zhilong, et autres
Publié: (2026)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
par: Intelligence, Physical, et autres
Publié: (2025)
par: Intelligence, Physical, et autres
Publié: (2025)
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
par: Li, Runze, et autres
Publié: (2026)
par: Li, Runze, et autres
Publié: (2026)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
par: Zhang, Zezhou, et autres
Publié: (2026)
par: Zhang, Zezhou, et autres
Publié: (2026)
Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment
par: Wang, Libo
Publié: (2025)
par: Wang, Libo
Publié: (2025)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
par: Xu, Charles, et autres
Publié: (2026)
par: Xu, Charles, et autres
Publié: (2026)
Test-Time Training for Visual Foresight Vision-Language-Action Models
par: Park, Sangwu, et autres
Publié: (2026)
par: Park, Sangwu, et autres
Publié: (2026)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model
par: Lu, Yuanjie, et autres
Publié: (2026)
par: Lu, Yuanjie, et autres
Publié: (2026)
Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models
par: Francis-Meretzki, Shelly, et autres
Publié: (2026)
par: Francis-Meretzki, Shelly, et autres
Publié: (2026)
Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
par: Guan, Weifan, et autres
Publié: (2025)
par: Guan, Weifan, et autres
Publié: (2025)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
par: Shukor, Mustafa, et autres
Publié: (2025)
par: Shukor, Mustafa, et autres
Publié: (2025)
Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
par: Lyu, Mingyang, et autres
Publié: (2025)
par: Lyu, Mingyang, et autres
Publié: (2025)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
par: Black, Kevin, et autres
Publié: (2024)
par: Black, Kevin, et autres
Publié: (2024)
VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback
par: Bi, Jianxin, et autres
Publié: (2025)
par: Bi, Jianxin, et autres
Publié: (2025)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
par: Huang, Jialei, et autres
Publié: (2025)
par: Huang, Jialei, et autres
Publié: (2025)
Few-Shot Vision-Language Action-Incremental Policy Learning
par: Song, Mingchen, et autres
Publié: (2025)
par: Song, Mingchen, et autres
Publié: (2025)
Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning
par: Hu, Jiaheng, et autres
Publié: (2026)
par: Hu, Jiaheng, et autres
Publié: (2026)
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
par: Cai, Rui, et autres
Publié: (2026)
par: Cai, Rui, et autres
Publié: (2026)
From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models
par: Li, Zhuofan, et autres
Publié: (2026)
par: Li, Zhuofan, et autres
Publié: (2026)
Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
par: Robotics, Tommoro, et autres
Publié: (2026)
par: Robotics, Tommoro, et autres
Publié: (2026)
DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
Understanding Asynchronous Inference Methods for Vision-Language-Action Models
par: Agouzoul, Ayoub
Publié: (2026)
par: Agouzoul, Ayoub
Publié: (2026)
Bridging Language, Vision and Action: Multimodal VAEs in Robotic Manipulation Tasks
par: Sejnova, Gabriela, et autres
Publié: (2024)
par: Sejnova, Gabriela, et autres
Publié: (2024)
Continuous Reasoning for Vision-Language-Action
par: Wu, Yueh-Hua, et autres
Publié: (2026)
par: Wu, Yueh-Hua, et autres
Publié: (2026)
Documents similaires
-
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
par: Hancock, Asher J., et autres
Publié: (2025) -
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025) -
Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
par: Majumdar, Anirudha
Publié: (2025) -
LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer
par: Zha, Lihan, et autres
Publié: (2026) -
Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping
par: Snyder, David, et autres
Publié: (2025)