Toward Aligning Human and Robot Actions via Multi-Modal Demonstration Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zahid, Azizul, Fan, Jie, Wang, Farong, Dy, Ashton, Swaminathan, Sai, Liu, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery
par: Xiao, Nan, et autres
Publié: (2026)
par: Xiao, Nan, et autres
Publié: (2026)
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
par: Jiang, Yuming, et autres
Publié: (2025)
par: Jiang, Yuming, et autres
Publié: (2025)
GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation, Demonstration, and Imitation
par: Wang, Zifan, et autres
Publié: (2024)
par: Wang, Zifan, et autres
Publié: (2024)
RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation
par: Xiao, Zhanqi, et autres
Publié: (2026)
par: Xiao, Zhanqi, et autres
Publié: (2026)
MEM: Multi-Modal Elevation Mapping for Robotics and Learning
par: Erni, Gian, et autres
Publié: (2023)
par: Erni, Gian, et autres
Publié: (2023)
Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation
par: Xing, Hao, et autres
Publié: (2025)
par: Xing, Hao, et autres
Publié: (2025)
OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer
par: Wang, Kuanning, et autres
Publié: (2026)
par: Wang, Kuanning, et autres
Publié: (2026)
ActiveUMI: Robotic Manipulation with Active Perception from Robot-Free Human Demonstrations
par: Zeng, Qiyuan, et autres
Publié: (2025)
par: Zeng, Qiyuan, et autres
Publié: (2025)
Surface-Constrained Offline Warping with Contact-Aware Online Pose Projection for Safe Robotic Trajectory Execution
par: Wang, Farong, et autres
Publié: (2026)
par: Wang, Farong, et autres
Publié: (2026)
A Distributed Multi-Modal Sensing Approach for Human Activity Recognition in Real-Time Human-Robot Collaboration
par: Belcamino, Valerio, et autres
Publié: (2026)
par: Belcamino, Valerio, et autres
Publié: (2026)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
par: Yin, Zhenhan, et autres
Publié: (2025)
par: Yin, Zhenhan, et autres
Publié: (2025)
Continual Learning for Autonomous Robots: A Prototype-based Approach
par: Hajizada, Elvin, et autres
Publié: (2024)
par: Hajizada, Elvin, et autres
Publié: (2024)
Rodrigues Network for Learning Robot Actions
par: Zhang, Jialiang, et autres
Publié: (2025)
par: Zhang, Jialiang, et autres
Publié: (2025)
Recognizing Actions from Robotic View for Natural Human-Robot Interaction
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
iLearnRobot: An Interactive Learning-Based Multi-Modal Robot with Continuous Improvement
par: Wang, Kohou, et autres
Publié: (2025)
par: Wang, Kohou, et autres
Publié: (2025)
You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations
par: Zhou, Huayi, et autres
Publié: (2025)
par: Zhou, Huayi, et autres
Publié: (2025)
Deep Learning-Based Multi-Modal Fusion for Robust Robot Perception and Navigation
par: Lai, Delun, et autres
Publié: (2025)
par: Lai, Delun, et autres
Publié: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
par: Liu, Mengzhen, et autres
Publié: (2026)
par: Liu, Mengzhen, et autres
Publié: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface
par: Zhao, Yujie, et autres
Publié: (2025)
par: Zhao, Yujie, et autres
Publié: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
par: Lei, Zixing, et autres
Publié: (2026)
par: Lei, Zixing, et autres
Publié: (2026)
DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos
par: Bai, Yang, et autres
Publié: (2025)
par: Bai, Yang, et autres
Publié: (2025)
NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces
par: Huang, Zheng, et autres
Publié: (2025)
par: Huang, Zheng, et autres
Publié: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Towards Open-World Human Action Segmentation Using Graph Convolutional Networks
par: Xing, Hao, et autres
Publié: (2025)
par: Xing, Hao, et autres
Publié: (2025)
Self-supervised 6-DoF Robot Grasping by Demonstration via Augmented Reality Teleoperation System
par: Dengxiong, Xiwen, et autres
Publié: (2024)
par: Dengxiong, Xiwen, et autres
Publié: (2024)
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
par: Guan, Runwei, et autres
Publié: (2026)
par: Guan, Runwei, et autres
Publié: (2026)
Towards Dense and Accurate Radar Perception Via Efficient Cross-Modal Diffusion Model
par: Zhang, Ruibin, et autres
Publié: (2024)
par: Zhang, Ruibin, et autres
Publié: (2024)
CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control
par: Shi, Jiaqi, et autres
Publié: (2026)
par: Shi, Jiaqi, et autres
Publié: (2026)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
par: Guo, Jianing, et autres
Publié: (2025)
par: Guo, Jianing, et autres
Publié: (2025)
How Physics and Background Attributes Impact Video Transformers in Robotic Manipulation: A Case Study on Planar Pushing
par: Jin, Shutong, et autres
Publié: (2023)
par: Jin, Shutong, et autres
Publié: (2023)
Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations
par: Huang, Wei-Jin, et autres
Publié: (2026)
par: Huang, Wei-Jin, et autres
Publié: (2026)
Generate, Transfer, Adapt: Learning Functional Dexterous Grasping from a Single Human Demonstration
par: He, Xingyi, et autres
Publié: (2026)
par: He, Xingyi, et autres
Publié: (2026)
VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
par: Chen, Hanzhi, et autres
Publié: (2025)
par: Chen, Hanzhi, et autres
Publié: (2025)
SCAR: Self-Supervised Continuous Action Representation Learning
par: Liu, Hongjia, et autres
Publié: (2026)
par: Liu, Hongjia, et autres
Publié: (2026)
Multi-Camera Hand-Eye Calibration for Human-Robot Collaboration in Industrial Robotic Workcells
par: Allegro, Davide, et autres
Publié: (2024)
par: Allegro, Davide, et autres
Publié: (2024)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
Documents similaires
-
arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery
par: Xiao, Nan, et autres
Publié: (2026) -
RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
par: Jiang, Yuming, et autres
Publié: (2025) -
GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation, Demonstration, and Imitation
par: Wang, Zifan, et autres
Publié: (2024) -
RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation
par: Xiao, Zhanqi, et autres
Publié: (2026) -
MEM: Multi-Modal Elevation Mapping for Robotics and Learning
par: Erni, Gian, et autres
Publié: (2023)