XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Shichao, Wu, Kun, Che, Zhengping, Wang, Xinhua, Wu, Di, Liao, Fei, Liu, Ning, Zhang, Yixue, Zhao, Zhen, Xu, Zhiyuan, Li, Meng, Liu, Qingjie, Zhang, Shanghang, Wan, Min, Tang, Jian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
di: Li, Meng, et al.
Pubblicazione: (2025)
di: Li, Meng, et al.
Pubblicazione: (2025)
RoboAug: One Annotation to Hundreds of Scenes via Region-Contrastive Data Augmentation for Robotic Manipulation
di: Wang, Xinhua, et al.
Pubblicazione: (2026)
di: Wang, Xinhua, et al.
Pubblicazione: (2026)
Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation
di: Fan, Shichao, et al.
Pubblicazione: (2025)
di: Fan, Shichao, et al.
Pubblicazione: (2025)
RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation
di: Zhang, Yixue, et al.
Pubblicazione: (2026)
di: Zhang, Yixue, et al.
Pubblicazione: (2026)
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)
Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation
di: Wu, Kun, et al.
Pubblicazione: (2024)
di: Wu, Kun, et al.
Pubblicazione: (2024)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
di: Luo, Yulin, et al.
Pubblicazione: (2026)
di: Luo, Yulin, et al.
Pubblicazione: (2026)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
di: Wang, Guodong, et al.
Pubblicazione: (2026)
di: Wang, Guodong, et al.
Pubblicazione: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
di: Wen, Junjie, et al.
Pubblicazione: (2025)
di: Wen, Junjie, et al.
Pubblicazione: (2025)
A Survey on Robotics with Foundation Models: toward Embodied AI
di: Xu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Xu, Zhiyuan, et al.
Pubblicazione: (2024)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
di: Hou, Chengkai, et al.
Pubblicazione: (2025)
FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
di: Su, Yifei, et al.
Pubblicazione: (2025)
di: Su, Yifei, et al.
Pubblicazione: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Liu, Zhuoyang, et al.
Pubblicazione: (2025)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
di: Liu, Fei, et al.
Pubblicazione: (2025)
di: Liu, Fei, et al.
Pubblicazione: (2025)
HACTS: a Human-As-Copilot Teleoperation System for Robot Learning
di: Xu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Xu, Zhiyuan, et al.
Pubblicazione: (2025)
Lightweight Spatial Embedding for Vision-based 3D Occupancy Prediction
di: Zhang, Jinqing, et al.
Pubblicazione: (2024)
di: Zhang, Jinqing, et al.
Pubblicazione: (2024)
Unified Vision-Language-Action Model
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
di: Wang, Yuqi, et al.
Pubblicazione: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
di: Su, Kun, et al.
Pubblicazione: (2024)
di: Su, Kun, et al.
Pubblicazione: (2024)
Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation
di: He, Jingyang, et al.
Pubblicazione: (2026)
di: He, Jingyang, et al.
Pubblicazione: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation
di: Wang, Xinshun, et al.
Pubblicazione: (2026)
di: Wang, Xinshun, et al.
Pubblicazione: (2026)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
di: Fu, Yankai, et al.
Pubblicazione: (2025)
di: Fu, Yankai, et al.
Pubblicazione: (2025)
Motion Capture from Inertial and Vision Sensors
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and Rendering
di: Feng, Yutao, et al.
Pubblicazione: (2024)
di: Feng, Yutao, et al.
Pubblicazione: (2024)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
di: Hua, Peichun, et al.
Pubblicazione: (2025)
di: Hua, Peichun, et al.
Pubblicazione: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023)
di: Jin, Yang, et al.
Pubblicazione: (2023)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior
di: Niu, Haochen, et al.
Pubblicazione: (2026)
di: Niu, Haochen, et al.
Pubblicazione: (2026)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
di: Li, Siyuan, et al.
Pubblicazione: (2023)
di: Li, Siyuan, et al.
Pubblicazione: (2023)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
MoReFun: Past-Movement Guided Motion Representation Learning for Future Motion Prediction and Understanding
di: Shi, Junyu, et al.
Pubblicazione: (2024)
di: Shi, Junyu, et al.
Pubblicazione: (2024)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
Modeling Cross-vision Synergy for Unified Large Vision Model
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
di: Li, Meng, et al.
Pubblicazione: (2025) -
RoboAug: One Annotation to Hundreds of Scenes via Region-Contrastive Data Augmentation for Robotic Manipulation
di: Wang, Xinhua, et al.
Pubblicazione: (2026) -
Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation
di: Fan, Shichao, et al.
Pubblicazione: (2025) -
RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation
di: Zhang, Yixue, et al.
Pubblicazione: (2026) -
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
di: Liu, Zhuoyang, et al.
Pubblicazione: (2026)