EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Ruihan, Yu, Qinxi, Wu, Yecheng, Yan, Rui, Li, Borui, Cheng, An-Chieh, Zou, Xueyan, Fang, Yunhao, Cheng, Xuxin, Qiu, Ri-Zhao, Yin, Hongxu, Liu, Sifei, Han, Song, Lu, Yao, Wang, Xiaolong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
di: Liu, Isabella, et al.
Pubblicazione: (2026)
di: Liu, Isabella, et al.
Pubblicazione: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
di: Cai, Xiongyi, et al.
Pubblicazione: (2025)
di: Cai, Xiongyi, et al.
Pubblicazione: (2025)
Visual Whole-Body Control for Legged Loco-Manipulation
di: Liu, Minghuan, et al.
Pubblicazione: (2024)
di: Liu, Minghuan, et al.
Pubblicazione: (2024)
M3: 3D-Spatial MultiModal Memory
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
GraspSplats: Efficient Manipulation with 3D Feature Splatting
di: Ji, Mazeyu, et al.
Pubblicazione: (2024)
di: Ji, Mazeyu, et al.
Pubblicazione: (2024)
3D Aware Region Prompted Vision Language Model
di: Cheng, An-Chieh, et al.
Pubblicazione: (2025)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2025)
HMC: Learning Heterogeneous Meta-Control for Contact-Rich Loco-Manipulation
di: Wei, Lai, et al.
Pubblicazione: (2025)
di: Wei, Lai, et al.
Pubblicazione: (2025)
AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control
di: Li, Jialong, et al.
Pubblicazione: (2025)
di: Li, Jialong, et al.
Pubblicazione: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
EgoMimic: Scaling Imitation Learning via Egocentric Video
di: Kareer, Simar, et al.
Pubblicazione: (2024)
di: Kareer, Simar, et al.
Pubblicazione: (2024)
PARSE-Ego4D: Personal Action Recommendation Suggestions for Egocentric Videos
di: Abreu, Steven, et al.
Pubblicazione: (2024)
di: Abreu, Steven, et al.
Pubblicazione: (2024)
Expressive Whole-Body Control for Humanoid Robots
di: Cheng, Xuxin, et al.
Pubblicazione: (2024)
di: Cheng, Xuxin, et al.
Pubblicazione: (2024)
EgoPrompt: Prompt Learning for Egocentric Action Recognition
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
di: Lyu, Huaihai, et al.
Pubblicazione: (2025)
MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
di: Zhao, Ruihan, et al.
Pubblicazione: (2025)
di: Zhao, Ruihan, et al.
Pubblicazione: (2025)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
di: Yin, Cheng, et al.
Pubblicazione: (2025)
di: Yin, Cheng, et al.
Pubblicazione: (2025)
Open-TeleVision: Teleoperation with Immersive Active Visual Feedback
di: Cheng, Xuxin, et al.
Pubblicazione: (2024)
di: Cheng, Xuxin, et al.
Pubblicazione: (2024)
Ego-1K -- A Large-Scale Multiview Video Dataset for Egocentric Vision
di: Lee, Jae Yong, et al.
Pubblicazione: (2026)
di: Lee, Jae Yong, et al.
Pubblicazione: (2026)
Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
di: Cheng, Qinchuan, et al.
Pubblicazione: (2026)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
di: Nagrani, Arsha, et al.
Pubblicazione: (2026)
EgoVLM: Policy Optimization for Egocentric Video Understanding
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
di: Vinod, Ashwin, et al.
Pubblicazione: (2025)
EgoPoints: Advancing Point Tracking for Egocentric Videos
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
di: Darkhalil, Ahmad, et al.
Pubblicazione: (2024)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos
di: Ma, Junyi, et al.
Pubblicazione: (2025)
di: Ma, Junyi, et al.
Pubblicazione: (2025)
MultiEgo: A Multi-View Egocentric Video Dataset for 4D Scene Reconstruction
di: Li, Bate, et al.
Pubblicazione: (2025)
di: Li, Bate, et al.
Pubblicazione: (2025)
Helpful DoggyBot: Open-World Object Fetching using Legged Robots and Vision-Language Models
di: Wu, Qi, et al.
Pubblicazione: (2024)
di: Wu, Qi, et al.
Pubblicazione: (2024)
EgoOops: A Dataset for Mistake Action Detection from Egocentric Videos referring to Procedural Texts
di: Haneji, Yuto, et al.
Pubblicazione: (2024)
di: Haneji, Yuto, et al.
Pubblicazione: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
Human-Robot Copilot for Data-Efficient Imitation Learning
di: Yan, Rui, et al.
Pubblicazione: (2026)
di: Yan, Rui, et al.
Pubblicazione: (2026)
GPT4Ego: Unleashing the Potential of Pre-trained Models for Zero-Shot Egocentric Action Recognition
di: Dai, Guangzhao, et al.
Pubblicazione: (2024)
di: Dai, Guangzhao, et al.
Pubblicazione: (2024)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
EgoLCD: Egocentric Video Generation with Long Context Diffusion
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
di: Zhang, Liuzhou, et al.
Pubblicazione: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
di: Sun, Shitong, et al.
Pubblicazione: (2026)
di: Sun, Shitong, et al.
Pubblicazione: (2026)
Developing Vision-Language-Action Model from Egocentric Videos
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
di: Yoshida, Tomoya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
di: Liu, Isabella, et al.
Pubblicazione: (2026) -
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024) -
In-N-On: Scaling Egocentric Manipulation with in-the-wild and on-task Data
di: Cai, Xiongyi, et al.
Pubblicazione: (2025) -
Visual Whole-Body Control for Legged Loco-Manipulation
di: Liu, Minghuan, et al.
Pubblicazione: (2024)