Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking
Fuente:
arXiv
Salvato in:
| Autori principali: | Emukpere, David, Deffayet, Romain, Renders, Jean-Michel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies
di: Longhini, Alberta, et al.
Pubblicazione: (2026)
di: Longhini, Alberta, et al.
Pubblicazione: (2026)
Disentangled Object-Centric Image Representation for Robotic Manipulation
di: Emukpere, David, et al.
Pubblicazione: (2025)
di: Emukpere, David, et al.
Pubblicazione: (2025)
SLIM: Skill Learning with Multiple Critics
di: Emukpere, David, et al.
Pubblicazione: (2024)
di: Emukpere, David, et al.
Pubblicazione: (2024)
ProgVLA: Progress-Aware Robot Manipulation Skill Learning
di: Kim, Seungsu, et al.
Pubblicazione: (2026)
di: Kim, Seungsu, et al.
Pubblicazione: (2026)
Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
di: Vo, Khoa, et al.
Pubblicazione: (2025)
di: Vo, Khoa, et al.
Pubblicazione: (2025)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
di: Jin, Xinchen, et al.
Pubblicazione: (2026)
di: Jin, Xinchen, et al.
Pubblicazione: (2026)
Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging
di: Yadav, Yajat, et al.
Pubblicazione: (2025)
di: Yadav, Yajat, et al.
Pubblicazione: (2025)
An Offline Metric for the Debiasedness of Click Models
di: Deffayet, Romain, et al.
Pubblicazione: (2023)
di: Deffayet, Romain, et al.
Pubblicazione: (2023)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
di: Wulff, Theodor, et al.
Pubblicazione: (2026)
di: Wulff, Theodor, et al.
Pubblicazione: (2026)
CHOICE: Coordinated Human-Object Interaction in Cluttered Environments for Pick-and-Place Actions
di: Lu, Jintao, et al.
Pubblicazione: (2024)
di: Lu, Jintao, et al.
Pubblicazione: (2024)
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
di: Srikanth, Siddharth, et al.
Pubblicazione: (2026)
di: Srikanth, Siddharth, et al.
Pubblicazione: (2026)
Learning to Pick: A Visuomotor Policy for Clustered Strawberry Picking
di: Fei, Zhenghao, et al.
Pubblicazione: (2025)
di: Fei, Zhenghao, et al.
Pubblicazione: (2025)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
di: Luo, Jingzhou, et al.
Pubblicazione: (2026)
Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation
di: Li, Shunlei, et al.
Pubblicazione: (2025)
di: Li, Shunlei, et al.
Pubblicazione: (2025)
Toward Embodiment Equivariant Vision-Language-Action Policy
di: Chen, Anzhe, et al.
Pubblicazione: (2025)
di: Chen, Anzhe, et al.
Pubblicazione: (2025)
Picking by Tilting: In-Hand Manipulation for Object Picking using Effector with Curved Form
di: Song, Yanshu, et al.
Pubblicazione: (2024)
di: Song, Yanshu, et al.
Pubblicazione: (2024)
Continually Evolving Skill Knowledge in Vision Language Action Model
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
Unbiased Learning to Rank Meets Reality: Lessons from Baidu's Large-Scale Search Dataset
di: Hager, Philipp, et al.
Pubblicazione: (2024)
di: Hager, Philipp, et al.
Pubblicazione: (2024)
Distributional Reinforcement Learning with Dual Expectile-Quantile Regression
di: Jullien, Sami, et al.
Pubblicazione: (2023)
di: Jullien, Sami, et al.
Pubblicazione: (2023)
FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
di: Reuss, Moritz, et al.
Pubblicazione: (2025)
di: Reuss, Moritz, et al.
Pubblicazione: (2025)
Demonstrating Multi-Suction Item Picking at Scale via Multi-Modal Learning of Pick Success
di: Wang, Che, et al.
Pubblicazione: (2025)
di: Wang, Che, et al.
Pubblicazione: (2025)
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
di: Zhao, Ruihan, et al.
Pubblicazione: (2025)
di: Zhao, Ruihan, et al.
Pubblicazione: (2025)
RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting
di: Xin, Yucheng, et al.
Pubblicazione: (2026)
di: Xin, Yucheng, et al.
Pubblicazione: (2026)
Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
di: Chen, William, et al.
Pubblicazione: (2026)
di: Chen, William, et al.
Pubblicazione: (2026)
Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models
di: Jin, Ruixing, et al.
Pubblicazione: (2026)
di: Jin, Ruixing, et al.
Pubblicazione: (2026)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
di: Tu, Ruisen, et al.
Pubblicazione: (2026)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Action Hallucination in Generative Vision-Language-Action Models
di: Soh, Harold, et al.
Pubblicazione: (2026)
di: Soh, Harold, et al.
Pubblicazione: (2026)
In the Wild Ungraspable Object Picking with Bimanual Nonprehensile Manipulation
di: Wu, Albert, et al.
Pubblicazione: (2024)
di: Wu, Albert, et al.
Pubblicazione: (2024)
LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies
di: Nahrendra, I Made Aswin, et al.
Pubblicazione: (2026)
di: Nahrendra, I Made Aswin, et al.
Pubblicazione: (2026)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
di: Guo, Peizheng, et al.
Pubblicazione: (2026)
di: Guo, Peizheng, et al.
Pubblicazione: (2026)
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
Few-Shot Vision-Language Action-Incremental Policy Learning
di: Song, Mingchen, et al.
Pubblicazione: (2025)
di: Song, Mingchen, et al.
Pubblicazione: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
Find Everything: A General Vision Language Model Approach to Multi-Object Search
di: Choi, Daniel, et al.
Pubblicazione: (2024)
di: Choi, Daniel, et al.
Pubblicazione: (2024)
SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
di: Fu, Yuxia, et al.
Pubblicazione: (2025)
di: Fu, Yuxia, et al.
Pubblicazione: (2025)
Robust Policy Learning via Offline Skill Diffusion
di: Kim, Woo Kyung, et al.
Pubblicazione: (2024)
di: Kim, Woo Kyung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies
di: Longhini, Alberta, et al.
Pubblicazione: (2026) -
Disentangled Object-Centric Image Representation for Robotic Manipulation
di: Emukpere, David, et al.
Pubblicazione: (2025) -
SLIM: Skill Learning with Multiple Critics
di: Emukpere, David, et al.
Pubblicazione: (2024) -
ProgVLA: Progress-Aware Robot Manipulation Skill Learning
di: Kim, Seungsu, et al.
Pubblicazione: (2026) -
Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
di: Vo, Khoa, et al.
Pubblicazione: (2025)