KALIE: Fine-Tuning Vision-Language Models for Open-World Manipulation without Robot Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Grace, Rajkumar, Swetha, Zhou, Yifei, Walke, Homer Rich, Levine, Sergey, Fang, Kuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting
par: Liu, Fangchen, et autres
Publié: (2024)
par: Liu, Fangchen, et autres
Publié: (2024)
Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
par: Doshi, Ria, et autres
Publié: (2024)
par: Doshi, Ria, et autres
Publié: (2024)
Evaluating Real-World Robot Manipulation Policies in Simulation
par: Li, Xuanlin, et autres
Publié: (2024)
par: Li, Xuanlin, et autres
Publié: (2024)
Autonomous Improvement of Instruction Following Skills via Foundation Models
par: Zhou, Zhiyuan, et autres
Publié: (2024)
par: Zhou, Zhiyuan, et autres
Publié: (2024)
Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control
par: Myers, Vivek, et autres
Publié: (2023)
par: Myers, Vivek, et autres
Publié: (2023)
BridgeData V2: A Dataset for Robot Learning at Scale
par: Walke, Homer, et autres
Publié: (2023)
par: Walke, Homer, et autres
Publié: (2023)
AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World
par: Zhou, Zhiyuan, et autres
Publié: (2025)
par: Zhou, Zhiyuan, et autres
Publié: (2025)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
par: Zheng, Chongyi, et autres
Publié: (2023)
par: Zheng, Chongyi, et autres
Publié: (2023)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025)
par: Driess, Danny, et autres
Publié: (2025)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
par: Feng, Yunhai, et autres
Publié: (2025)
par: Feng, Yunhai, et autres
Publié: (2025)
Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging
par: Yadav, Yajat, et autres
Publié: (2025)
par: Yadav, Yajat, et autres
Publié: (2025)
Octo: An Open-Source Generalist Robot Policy
par: Octo Model Team, et autres
Publié: (2024)
par: Octo Model Team, et autres
Publié: (2024)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
Temporal Representation Alignment: Successor Features Enable Emergent Compositionality in Robot Instruction Following
par: Myers, Vivek, et autres
Publié: (2025)
par: Myers, Vivek, et autres
Publié: (2025)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
par: Torne, Marcel, et autres
Publié: (2026)
par: Torne, Marcel, et autres
Publié: (2026)
Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models
par: Chen, Annie S., et autres
Publié: (2024)
par: Chen, Annie S., et autres
Publié: (2024)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
par: Intelligence, Physical, et autres
Publié: (2025)
par: Intelligence, Physical, et autres
Publié: (2025)
Fine Robotic Manipulation without Force/Torque Sensor
par: Shan, Shilin, et autres
Publié: (2023)
par: Shan, Shilin, et autres
Publié: (2023)
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning
par: Luo, Jianlan, et autres
Publié: (2024)
par: Luo, Jianlan, et autres
Publié: (2024)
Policy Adaptation via Language Optimization: Decomposing Tasks for Few-Shot Imitation
par: Myers, Vivek, et autres
Publié: (2024)
par: Myers, Vivek, et autres
Publié: (2024)
SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding
par: Fang, Kuan, et autres
Publié: (2025)
par: Fang, Kuan, et autres
Publié: (2025)
EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
par: Chopra, Samarth, et autres
Publié: (2025)
par: Chopra, Samarth, et autres
Publié: (2025)
Interpretable Robotic Manipulation from Language
par: Zheng, Boyuan, et autres
Publié: (2024)
par: Zheng, Boyuan, et autres
Publié: (2024)
Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation
par: Zhao, Zhenyu, et autres
Publié: (2025)
par: Zhao, Zhenyu, et autres
Publié: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
Prompting with the Future: Open-World Model Predictive Control with Interactive Digital Twins
par: Ning, Chuanruo, et autres
Publié: (2025)
par: Ning, Chuanruo, et autres
Publié: (2025)
FMB: a Functional Manipulation Benchmark for Generalizable Robotic Learning
par: Luo, Jianlan, et autres
Publié: (2024)
par: Luo, Jianlan, et autres
Publié: (2024)
Emergence of Human to Robot Transfer in Vision-Language-Action Models
par: Kareer, Simar, et autres
Publié: (2025)
par: Kareer, Simar, et autres
Publié: (2025)
DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
par: Jia, Emily Yue-Ting, et autres
Publié: (2026)
par: Jia, Emily Yue-Ting, et autres
Publié: (2026)
Task-oriented Robotic Manipulation with Vision Language Models
par: Guran, Nurhan Bulus, et autres
Publié: (2024)
par: Guran, Nurhan Bulus, et autres
Publié: (2024)
Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation
par: Lorang, Pierrick, et autres
Publié: (2026)
par: Lorang, Pierrick, et autres
Publié: (2026)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
par: Duan, Jiafei, et autres
Publié: (2024)
par: Duan, Jiafei, et autres
Publié: (2024)
EMMa: End-Effector Stability-Oriented Mobile Manipulation for Tracked Rescue Robots
par: Wang, Yifei, et autres
Publié: (2026)
par: Wang, Yifei, et autres
Publié: (2026)
CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
par: Glossop, Catherine, et autres
Publié: (2025)
par: Glossop, Catherine, et autres
Publié: (2025)
VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation
par: Zhao, Wentao, et autres
Publié: (2024)
par: Zhao, Wentao, et autres
Publié: (2024)
Online Robot Navigation and Manipulation with Distilled Vision-Language Models
par: Liu, Kangcheng
Publié: (2024)
par: Liu, Kangcheng
Publié: (2024)
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
par: Shi, Lucy Xiaoyang, et autres
Publié: (2025)
VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation
par: Zhou, Huayi, et autres
Publié: (2025)
par: Zhou, Huayi, et autres
Publié: (2025)
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
par: Wang, Zhijie, et autres
Publié: (2024)
par: Wang, Zhijie, et autres
Publié: (2024)
Documents similaires
-
MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting
par: Liu, Fangchen, et autres
Publié: (2024) -
Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
par: Doshi, Ria, et autres
Publié: (2024) -
Evaluating Real-World Robot Manipulation Policies in Simulation
par: Li, Xuanlin, et autres
Publié: (2024) -
Autonomous Improvement of Instruction Following Skills via Foundation Models
par: Zhou, Zhiyuan, et autres
Publié: (2024) -
Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control
par: Myers, Vivek, et autres
Publié: (2023)