Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jain, Vidhi, Attarian, Maria, Joshi, Nikhil J, Wahid, Ayzaan, Driess, Danny, Vuong, Quan, Sanketi, Pannag R, Sermanet, Pierre, Welker, Stefan, Chan, Christine, Gilitschenski, Igor, Bisk, Yonatan, Dwibedi, Debidatta |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Improving Embodied Foundation Models
par: Ghasemipour, Seyed Kamyar Seyed, et autres
Publié: (2025)
par: Ghasemipour, Seyed Kamyar Seyed, et autres
Publié: (2025)
ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation
par: Jain, Vidhi, et autres
Publié: (2024)
par: Jain, Vidhi, et autres
Publié: (2024)
FlexCap: Describe Anything in Images in Controllable Detail
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
A Short Note on Evaluating RepNet for Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
RT-H: Action Hierarchies Using Language
par: Belkhale, Suneel, et autres
Publié: (2024)
par: Belkhale, Suneel, et autres
Publié: (2024)
GeoMatch++: Morphology Conditioned Geometry Matching for Multi-Embodiment Grasping
par: Wei, Yunze, et autres
Publié: (2024)
par: Wei, Yunze, et autres
Publié: (2024)
Robot Data Curation with Mutual Information Estimators
par: Hejna, Joey, et autres
Publié: (2025)
par: Hejna, Joey, et autres
Publié: (2025)
ALOHA Unleashed: A Simple Recipe for Robot Dexterity
par: Zhao, Tony Z., et autres
Publié: (2024)
par: Zhao, Tony Z., et autres
Publié: (2024)
AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
par: Ahn, Michael, et autres
Publié: (2024)
par: Ahn, Michael, et autres
Publié: (2024)
BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames
par: Mark, Max Sobol, et autres
Publié: (2026)
par: Mark, Max Sobol, et autres
Publié: (2026)
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
Learning Model Successors
par: Chang, Yingshan, et autres
Publié: (2025)
par: Chang, Yingshan, et autres
Publié: (2025)
Language Models Need Inductive Biases to Count Inductively
par: Chang, Yingshan, et autres
Publié: (2024)
par: Chang, Yingshan, et autres
Publié: (2024)
Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets
par: Chen, Kaiyuan, et autres
Publié: (2025)
par: Chen, Kaiyuan, et autres
Publié: (2025)
GaussianCut: Interactive segmentation via graph cut for 3D Gaussian Splatting
par: Jain, Umangi, et autres
Publié: (2024)
par: Jain, Umangi, et autres
Publié: (2024)
Gradient Localization Improves Lifelong Pretraining of Language Models
par: Fernandez, Jared, et autres
Publié: (2024)
par: Fernandez, Jared, et autres
Publié: (2024)
REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories
par: Thompson, Jacob, et autres
Publié: (2025)
par: Thompson, Jacob, et autres
Publié: (2025)
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025)
par: Pertsch, Karl, et autres
Publié: (2025)
MotIF: Motion Instruction Fine-tuning
par: Hwang, Minyoung, et autres
Publié: (2024)
par: Hwang, Minyoung, et autres
Publié: (2024)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
par: Korekata, Ryosuke, et autres
Publié: (2025)
par: Korekata, Ryosuke, et autres
Publié: (2025)
Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshes
par: Jain, Umangi, et autres
Publié: (2026)
par: Jain, Umangi, et autres
Publié: (2026)
Looking beyond the next token
par: Thankaraj, Abitha, et autres
Publié: (2025)
par: Thankaraj, Abitha, et autres
Publié: (2025)
Tools Fail: Detecting Silent Errors in Faulty Tools
par: Sun, Jimin, et autres
Publié: (2024)
par: Sun, Jimin, et autres
Publié: (2024)
Update-Free On-Policy Steering via Verifiers
par: Attarian, Maria, et autres
Publié: (2026)
par: Attarian, Maria, et autres
Publié: (2026)
Test-Time Graph Search for Goal-Conditioned Reinforcement Learning
par: Opryshko, Evgenii, et autres
Publié: (2025)
par: Opryshko, Evgenii, et autres
Publié: (2025)
RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation
par: Kim, Seungchan, et autres
Publié: (2025)
par: Kim, Seungchan, et autres
Publié: (2025)
CHEMICAL CONTROL OVER THE SYNTHESIS OF DEFECT-FREE AND HETEROMETAL-DOPED METAL OXIDE NANOPARTICLES BY THE SINGLE-SOURCE PRECURSOR APPROACH
par: M. Driess
Publié: (2005)
par: M. Driess
Publié: (2005)
Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling
par: Zheng, Shuhong, et autres
Publié: (2025)
par: Zheng, Shuhong, et autres
Publié: (2025)
TESPEC: Temporally-Enhanced Self-Supervised Pretraining for Event Cameras
par: Mohammadi, Mohammad, et autres
Publié: (2025)
par: Mohammadi, Mohammad, et autres
Publié: (2025)
EventSplat: 3D Gaussian Splatting from Moving Event Cameras for Real-time Rendering
par: Yura, Toshiya, et autres
Publié: (2024)
par: Yura, Toshiya, et autres
Publié: (2024)
RANDPOL: Parameter-Efficient End-to-End Quadruped Locomotion via Randomized Policy Learning
par: Liu, Zhuochen, et autres
Publié: (2025)
par: Liu, Zhuochen, et autres
Publié: (2025)
PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs
par: Nasiriany, Soroush, et autres
Publié: (2024)
par: Nasiriany, Soroush, et autres
Publié: (2024)
MOSAIC: Learning Unified Multi-Sensory Object Property Representations for Robot Learning via Interactive Perception
par: Tatiya, Gyan, et autres
Publié: (2023)
par: Tatiya, Gyan, et autres
Publié: (2023)
VISREAS: Complex Visual Reasoning with Unanswerable Questions
par: Akter, Syeda Nahida, et autres
Publié: (2024)
par: Akter, Syeda Nahida, et autres
Publié: (2024)
Reasoning about the Unseen for Efficient Outdoor Object Navigation
par: Xie, Quanting, et autres
Publié: (2023)
par: Xie, Quanting, et autres
Publié: (2023)
CTRL-D: Controllable Dynamic 3D Scene Editing with Personalized 2D Diffusion
par: He, Kai, et autres
Publié: (2024)
par: He, Kai, et autres
Publié: (2024)
Learning Diverse Robot Striking Motions with Diffusion Models and Kinematically Constrained Gradient Guidance
par: Lee, Kin Man, et autres
Publié: (2024)
par: Lee, Kin Man, et autres
Publié: (2024)
Vision Language Models are In-Context Value Learners
par: Ma, Yecheng Jason, et autres
Publié: (2024)
par: Ma, Yecheng Jason, et autres
Publié: (2024)
Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation
par: Bharadhwaj, Homanga, et autres
Publié: (2024)
par: Bharadhwaj, Homanga, et autres
Publié: (2024)
BlackBoxToBlueprint: Extracting Interpretable Logic from Legacy Systems using Reinforcement Learning and Counterfactual Analysis
par: Rathore, Vidhi
Publié: (2025)
par: Rathore, Vidhi
Publié: (2025)
Documents similaires
-
Self-Improving Embodied Foundation Models
par: Ghasemipour, Seyed Kamyar Seyed, et autres
Publié: (2025) -
ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation
par: Jain, Vidhi, et autres
Publié: (2024) -
FlexCap: Describe Anything in Images in Controllable Detail
par: Dwibedi, Debidatta, et autres
Publié: (2024) -
A Short Note on Evaluating RepNet for Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024) -
RT-H: Action Hierarchies Using Language
par: Belkhale, Suneel, et autres
Publié: (2024)