Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Jun, Li, Qiwei, Li, Peiyan, Chen, Zilong, Sun, Nan, Su, Yifei, Wang, Heyun, Zhang, Yuan, Li, Xinghang, Liu, Huaping |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
par: Li, Peiyan, et autres
Publié: (2026)
par: Li, Peiyan, et autres
Publié: (2026)
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
par: Wang, Guokang, et autres
Publié: (2024)
par: Wang, Guokang, et autres
Publié: (2024)
What Matters in Building Vision-Language-Action Models for Generalist Robots
par: Li, Xinghang, et autres
Publié: (2024)
par: Li, Xinghang, et autres
Publié: (2024)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation
par: Guo, Jun, et autres
Publié: (2025)
par: Guo, Jun, et autres
Publié: (2025)
Unified Video Action Model
par: Li, Shuang, et autres
Publié: (2025)
par: Li, Shuang, et autres
Publié: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
par: Zhang, Zhengshen, et autres
Publié: (2025)
par: Zhang, Zhengshen, et autres
Publié: (2025)
CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
par: Sun, Nan, et autres
Publié: (2025)
par: Sun, Nan, et autres
Publié: (2025)
Video Generation with Learned Action Prior
par: Sarkar, Meenakshi, et autres
Publié: (2024)
par: Sarkar, Meenakshi, et autres
Publié: (2024)
Motus: A Unified Latent Action World Model
par: Bi, Hongzhe, et autres
Publié: (2025)
par: Bi, Hongzhe, et autres
Publié: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
Leveraging Large Language Model for Heterogeneous Ad Hoc Teamwork Collaboration
par: Liu, Xinzhu, et autres
Publié: (2024)
par: Liu, Xinzhu, et autres
Publié: (2024)
UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
par: Chen, Yixiang, et autres
Publié: (2026)
par: Chen, Yixiang, et autres
Publié: (2026)
Scaling World Model for Hierarchical Manipulation Policies
par: Long, Qian, et autres
Publié: (2026)
par: Long, Qian, et autres
Publié: (2026)
Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
par: Hu, Bin, et autres
Publié: (2025)
par: Hu, Bin, et autres
Publié: (2025)
SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction
par: Xu, Jie, et autres
Publié: (2024)
par: Xu, Jie, et autres
Publié: (2024)
Self-Supervised Monocular 4D Scene Reconstruction for Egocentric Videos
par: Yuan, Chengbo, et autres
Publié: (2024)
par: Yuan, Chengbo, et autres
Publié: (2024)
Action-Prior Denoising for Smooth Real-Time Chunking
par: Liu, Dongyang, et autres
Publié: (2026)
par: Liu, Dongyang, et autres
Publié: (2026)
VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation
par: Chen, Yixiang, et autres
Publié: (2025)
par: Chen, Yixiang, et autres
Publié: (2025)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
par: Shang, Yu, et autres
Publié: (2026)
par: Shang, Yu, et autres
Publié: (2026)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
par: Chai, Ying, et autres
Publié: (2025)
par: Chai, Ying, et autres
Publié: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter
par: Xu, Kechun, et autres
Publié: (2025)
par: Xu, Kechun, et autres
Publié: (2025)
DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos
par: Li, Can, et autres
Publié: (2026)
par: Li, Can, et autres
Publié: (2026)
Unifying Language-Action Understanding and Generation for Autonomous Driving
par: Wang, Xinyang, et autres
Publié: (2026)
par: Wang, Xinyang, et autres
Publié: (2026)
Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning
par: Zeng, Runhao, et autres
Publié: (2024)
par: Zeng, Runhao, et autres
Publié: (2024)
TesserAct: Learning 4D Embodied World Models
par: Zhen, Haoyu, et autres
Publié: (2025)
par: Zhen, Haoyu, et autres
Publié: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
par: Zhang, Jiazhao, et autres
Publié: (2024)
par: Zhang, Jiazhao, et autres
Publié: (2024)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
par: Yang, Jiabing, et autres
Publié: (2026)
par: Yang, Jiabing, et autres
Publié: (2026)
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
par: Wei, Julong, et autres
Publié: (2024)
par: Wei, Julong, et autres
Publié: (2024)
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI
par: Liu, Xinhao, et autres
Publié: (2025)
par: Liu, Xinhao, et autres
Publié: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
par: Li, Hengtao, et autres
Publié: (2025)
par: Li, Hengtao, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
Gaussian Sequences with Multi-Scale Dynamics for 4D Reconstruction from Monocular Casual Videos
par: Li, Can, et autres
Publié: (2026)
par: Li, Can, et autres
Publié: (2026)
Demonstrating HumanTHOR: A Simulation Platform and Benchmark for Human-Robot Collaboration in a Shared Workspace
par: Wang, Chenxu, et autres
Publié: (2024)
par: Wang, Chenxu, et autres
Publié: (2024)
VVLoc: Prior-free 3-DoF Vehicle Visual Localization
par: Huang, Ze, et autres
Publié: (2026)
par: Huang, Ze, et autres
Publié: (2026)
Autoregressive Meta-Actions for Unified Controllable Trajectory Generation
par: Zhao, Jianbo, et autres
Publié: (2025)
par: Zhao, Jianbo, et autres
Publié: (2025)
Documents similaires
-
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026) -
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
par: Li, Peiyan, et autres
Publié: (2026) -
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
par: Wang, Guokang, et autres
Publié: (2024) -
What Matters in Building Vision-Language-Action Models for Generalist Robots
par: Li, Xinghang, et autres
Publié: (2024) -
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)