Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pugacheva, Daria, Moskalenko, Andrey, Shepelev, Denis, Kuznetsov, Andrey, Shakhuro, Vlad, Tutubalina, Elena |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space
par: Zinkovich, Viktoriia, et autres
Publié: (2025)
par: Zinkovich, Viktoriia, et autres
Publié: (2025)
RoboBenchMart: Benchmarking Robots in Retail Environment
par: Soshin, Konstantin, et autres
Publié: (2025)
par: Soshin, Konstantin, et autres
Publié: (2025)
BREPS: Bounding-Box Robustness Evaluation of Promptable Segmentation
par: Moskalenko, Andrey, et autres
Publié: (2026)
par: Moskalenko, Andrey, et autres
Publié: (2026)
RClicks: Realistic Click Simulation for Benchmarking Interactive Segmentation
par: Antonov, Anton, et autres
Publié: (2024)
par: Antonov, Anton, et autres
Publié: (2024)
TETRIS: Towards Exploring the Robustness of Interactive Segmentation
par: Moskalenko, Andrey, et autres
Publié: (2024)
par: Moskalenko, Andrey, et autres
Publié: (2024)
BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment
par: Sakhovskiy, Andrey, et autres
Publié: (2025)
par: Sakhovskiy, Andrey, et autres
Publié: (2025)
Mind and Motion Aligned: A Joint Evaluation IsaacSim Benchmark for Task Planning and Low-Level Policies in Mobile Manipulation
par: Kachaev, Nikita, et autres
Publié: (2025)
par: Kachaev, Nikita, et autres
Publié: (2025)
KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
par: Im, Hokyun, et autres
Publié: (2025)
par: Im, Hokyun, et autres
Publié: (2025)
Embodied Supervision: Haptic Display of Automation Command to Improve Supervisory Performance
par: Gilbert, Alia, et autres
Publié: (2024)
par: Gilbert, Alia, et autres
Publié: (2024)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
par: Li, Boyu, et autres
Publié: (2026)
par: Li, Boyu, et autres
Publié: (2026)
Vintix: Action Model via In-Context Reinforcement Learning
par: Polubarov, Andrey, et autres
Publié: (2025)
par: Polubarov, Andrey, et autres
Publié: (2025)
TrackVLA: Embodied Visual Tracking in the Wild
par: Wang, Shaoan, et autres
Publié: (2025)
par: Wang, Shaoan, et autres
Publié: (2025)
RynnEC: Bringing MLLMs into Embodied World
par: Dang, Ronghao, et autres
Publié: (2025)
par: Dang, Ronghao, et autres
Publié: (2025)
Concept: Dynamic Risk Assessment for AI-Controlled Robotic Systems
par: Grimmeisen, Philipp, et autres
Publié: (2024)
par: Grimmeisen, Philipp, et autres
Publié: (2024)
Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation
par: Wang, Fangyuan, et autres
Publié: (2026)
par: Wang, Fangyuan, et autres
Publié: (2026)
Anatomy of Unlearning: The Dual Impact of Fact Salience and Model Fine-Tuning
par: Borisiuk, Anna, et autres
Publié: (2026)
par: Borisiuk, Anna, et autres
Publié: (2026)
MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
par: Jang, Huiwon, et autres
Publié: (2025)
par: Jang, Huiwon, et autres
Publié: (2025)
DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
par: Zhang, Qiyao, et autres
Publié: (2026)
par: Zhang, Qiyao, et autres
Publié: (2026)
LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning
par: Liang, Wenlong, et autres
Publié: (2025)
par: Liang, Wenlong, et autres
Publié: (2025)
Gemini Robotics: Bringing AI into the Physical World
par: Gemini Robotics Team, et autres
Publié: (2025)
par: Gemini Robotics Team, et autres
Publié: (2025)
UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios
par: Gonzalez, Antonio Galiza Cerdeira, et autres
Publié: (2024)
par: Gonzalez, Antonio Galiza Cerdeira, et autres
Publié: (2024)
Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion
par: Li, Zhuo, et autres
Publié: (2025)
par: Li, Zhuo, et autres
Publié: (2025)
TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation
par: Zhou, Hanyu, et autres
Publié: (2026)
par: Zhou, Hanyu, et autres
Publié: (2026)
TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
par: Zheng, Ruijie, et autres
Publié: (2024)
par: Zheng, Ruijie, et autres
Publié: (2024)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
par: Chu, Zedong, et autres
Publié: (2026)
par: Chu, Zedong, et autres
Publié: (2026)
Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation
par: Zhang, Zhilong, et autres
Publié: (2026)
par: Zhang, Zhilong, et autres
Publié: (2026)
Modeling the Mental World for Embodied AI: A Comprehensive Review
par: Liu, Biyuan, et autres
Publié: (2025)
par: Liu, Biyuan, et autres
Publié: (2025)
VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model
par: Li, Wenhao, et autres
Publié: (2026)
par: Li, Wenhao, et autres
Publié: (2026)
Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
par: Ni, Fei, et autres
Publié: (2025)
par: Ni, Fei, et autres
Publié: (2025)
$π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation
par: Tucker, Johnathan, et autres
Publié: (2026)
par: Tucker, Johnathan, et autres
Publié: (2026)
HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing
par: Gubernatorov, Konstantin, et autres
Publié: (2026)
par: Gubernatorov, Konstantin, et autres
Publié: (2026)
SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation
par: Menga, Narsimha, et autres
Publié: (2026)
par: Menga, Narsimha, et autres
Publié: (2026)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
par: Liang, Zhixuan, et autres
Publié: (2025)
par: Liang, Zhixuan, et autres
Publié: (2025)
A Universal Large Language Model -- Drone Command and Control Interface
par: Ramos-Silva, Javier N., et autres
Publié: (2026)
par: Ramos-Silva, Javier N., et autres
Publié: (2026)
EmbodiedClaw: Conversational Workflow Execution for Embodied AI Development
par: Zhou, Xueyang, et autres
Publié: (2026)
par: Zhou, Xueyang, et autres
Publié: (2026)
Documents similaires
-
SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space
par: Zinkovich, Viktoriia, et autres
Publié: (2025) -
RoboBenchMart: Benchmarking Robots in Retail Environment
par: Soshin, Konstantin, et autres
Publié: (2025) -
BREPS: Bounding-Box Robustness Evaluation of Promptable Segmentation
par: Moskalenko, Andrey, et autres
Publié: (2026) -
RClicks: Realistic Click Simulation for Benchmarking Interactive Segmentation
par: Antonov, Anton, et autres
Publié: (2024) -
TETRIS: Towards Exploring the Robustness of Interactive Segmentation
par: Moskalenko, Andrey, et autres
Publié: (2024)