Grounding Video Models to Actions through Goal Conditioned Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Yunhao, Du, Yilun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdaWorld: Learning Adaptable World Models with Latent Actions
par: Gao, Shenyuan, et autres
Publié: (2025)
par: Gao, Shenyuan, et autres
Publié: (2025)
Compositional Generative Modeling: A Single Model is Not All You Need
par: Du, Yilun, et autres
Publié: (2024)
par: Du, Yilun, et autres
Publié: (2024)
RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation
par: Jiang, Hanxiao, et autres
Publié: (2024)
par: Jiang, Hanxiao, et autres
Publié: (2024)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
par: Zhang, Zhengshen, et autres
Publié: (2025)
par: Zhang, Zhengshen, et autres
Publié: (2025)
Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals
par: Gillman, Nate, et autres
Publié: (2026)
par: Gillman, Nate, et autres
Publié: (2026)
Grounding Foundational Vision Models with 3D Human Poses for Robust Action Recognition
par: Babey, Nicholas, et autres
Publié: (2025)
par: Babey, Nicholas, et autres
Publié: (2025)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
par: Li, Qixiu, et autres
Publié: (2025)
par: Li, Qixiu, et autres
Publié: (2025)
VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs
par: Yuan, Haoran, et autres
Publié: (2026)
par: Yuan, Haoran, et autres
Publié: (2026)
mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
par: Pai, Jonas, et autres
Publié: (2025)
par: Pai, Jonas, et autres
Publié: (2025)
Potential Based Diffusion Motion Planning
par: Luo, Yunhao, et autres
Publié: (2024)
par: Luo, Yunhao, et autres
Publié: (2024)
VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models
par: Chen, Yiye, et autres
Publié: (2026)
par: Chen, Yiye, et autres
Publié: (2026)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
par: Wang, Beichen, et autres
Publié: (2024)
par: Wang, Beichen, et autres
Publié: (2024)
IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos
par: Liu, Yunong, et autres
Publié: (2024)
par: Liu, Yunong, et autres
Publié: (2024)
CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning
par: Ganai, Milan, et autres
Publié: (2026)
par: Ganai, Milan, et autres
Publié: (2026)
Know Where You're Uncertain When Planning with Multimodal Foundation Models: A Formal Framework
par: Bhatt, Neel P., et autres
Publié: (2024)
par: Bhatt, Neel P., et autres
Publié: (2024)
Hybrid Training for Vision-Language-Action Models
par: Mazzaglia, Pietro, et autres
Publié: (2025)
par: Mazzaglia, Pietro, et autres
Publié: (2025)
ViPRA: Video Prediction for Robot Actions
par: Routray, Sandeep, et autres
Publié: (2025)
par: Routray, Sandeep, et autres
Publié: (2025)
Whole-Body Conditioned Egocentric Video Prediction
par: Bai, Yutong, et autres
Publié: (2025)
par: Bai, Yutong, et autres
Publié: (2025)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
Interactive Post-Training for Vision-Language-Action Models
par: Tan, Shuhan, et autres
Publié: (2025)
par: Tan, Shuhan, et autres
Publié: (2025)
World Simulation with Video Foundation Models for Physical AI
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation
par: Li, Jinhan, et autres
Publié: (2024)
par: Li, Jinhan, et autres
Publié: (2024)
DINO-CVA: A Multimodal Goal-Conditioned Vision-to-Action Model for Autonomous Catheter Navigation
par: Fekri, Pedram, et autres
Publié: (2025)
par: Fekri, Pedram, et autres
Publié: (2025)
Grounding Intelligence in Movement
par: Segado, Melanie, et autres
Publié: (2025)
par: Segado, Melanie, et autres
Publié: (2025)
Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
par: Grover, Shresth, et autres
Publié: (2025)
par: Grover, Shresth, et autres
Publié: (2025)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
par: Cai, Shaofei, et autres
Publié: (2025)
par: Cai, Shaofei, et autres
Publié: (2025)
GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment
par: He, Haoyang, et autres
Publié: (2025)
par: He, Haoyang, et autres
Publié: (2025)
Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Learning Visual Feature-Based World Models via Residual Latent Action
par: Zhang, Xinyu, et autres
Publié: (2026)
par: Zhang, Xinyu, et autres
Publié: (2026)
Turning Video Models into Generalist Robot Policies
par: Li, Sizhe Lester, et autres
Publié: (2026)
par: Li, Sizhe Lester, et autres
Publié: (2026)
VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation
par: Bhatt, Neel P., et autres
Publié: (2025)
par: Bhatt, Neel P., et autres
Publié: (2025)
Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
par: Kawaharazuka, Kento, et autres
Publié: (2025)
par: Kawaharazuka, Kento, et autres
Publié: (2025)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
ICAT: Incident-Case-Grounded Adaptive Testing for Physical-Risk Prediction in Embodied World Models
par: Lai, Zhenglin, et autres
Publié: (2026)
par: Lai, Zhenglin, et autres
Publié: (2026)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
par: Li, Qixiu, et autres
Publié: (2024)
par: Li, Qixiu, et autres
Publié: (2024)
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
par: Feng, Yao, et autres
Publié: (2025)
par: Feng, Yao, et autres
Publié: (2025)
Documents similaires
-
AdaWorld: Learning Adaptable World Models with Latent Actions
par: Gao, Shenyuan, et autres
Publié: (2025) -
Compositional Generative Modeling: A Single Model is Not All You Need
par: Du, Yilun, et autres
Publié: (2024) -
RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation
par: Jiang, Hanxiao, et autres
Publié: (2024) -
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
par: Yang, Ruihan, et autres
Publié: (2025) -
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
par: Zhang, Zhengshen, et autres
Publié: (2025)