Vidar: Embodied Video Diffusion Model for Generalist Manipulation
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Yao, Tan, Hengkai, Mao, Xinyi, Xiang, Chendong, Liu, Guodong, Huang, Shuhe, Su, Hang, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation
by: Tan, Hengkai, et al.
Published: (2025)
by: Tan, Hengkai, et al.
Published: (2025)
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
by: Feng, Yao, et al.
Published: (2025)
by: Feng, Yao, et al.
Published: (2025)
Motus: A Unified Latent Action World Model
by: Bi, Hongzhe, et al.
Published: (2025)
by: Bi, Hongzhe, et al.
Published: (2025)
H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
by: Bi, Hongzhe, et al.
Published: (2025)
by: Bi, Hongzhe, et al.
Published: (2025)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
by: Liu, Songming, et al.
Published: (2024)
by: Liu, Songming, et al.
Published: (2024)
Think Proprioceptively: Embodied Visual Reasoning for VLA Manipulation
by: Wang, Fangyuan, et al.
Published: (2026)
by: Wang, Fangyuan, et al.
Published: (2026)
VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
by: Wen, Youpeng, et al.
Published: (2024)
by: Wen, Youpeng, et al.
Published: (2024)
OctoNav: Towards Generalist Embodied Navigation
by: Gao, Chen, et al.
Published: (2025)
by: Gao, Chen, et al.
Published: (2025)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
by: Hung, Chia-Yu, et al.
Published: (2025)
by: Hung, Chia-Yu, et al.
Published: (2025)
RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization
by: Liu, Songming, et al.
Published: (2026)
by: Liu, Songming, et al.
Published: (2026)
TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers
by: Yu, Bin, et al.
Published: (2026)
by: Yu, Bin, et al.
Published: (2026)
ManiBox: Enhancing Embodied Spatial Generalization via Scalable Simulation Data Generations
by: Tan, Hengkai, et al.
Published: (2024)
by: Tan, Hengkai, et al.
Published: (2024)
Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model
by: Xu, Wenjiang, et al.
Published: (2025)
by: Xu, Wenjiang, et al.
Published: (2025)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
by: Hou, Zhi, et al.
Published: (2025)
by: Hou, Zhi, et al.
Published: (2025)
AoE: Always-on Egocentric Human Video Collection for Embodied AI
by: Yang, Bowen, et al.
Published: (2026)
by: Yang, Bowen, et al.
Published: (2026)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
by: Lang, Xiaolei, et al.
Published: (2026)
by: Lang, Xiaolei, et al.
Published: (2026)
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
by: Huang, Siyuan, et al.
Published: (2025)
by: Huang, Siyuan, et al.
Published: (2025)
ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
by: Sun, Yu, et al.
Published: (2026)
by: Sun, Yu, et al.
Published: (2026)
Closed Loop Interactive Embodied Reasoning for Robot Manipulation
by: Nazarczuk, Michal, et al.
Published: (2024)
by: Nazarczuk, Michal, et al.
Published: (2024)
Diffusion Dynamics Models with Generative State Estimation for Cloth Manipulation
by: Tian, Tongxuan, et al.
Published: (2025)
by: Tian, Tongxuan, et al.
Published: (2025)
A Survey of Embodied Learning for Object-Centric Robotic Manipulation
by: Zheng, Ying, et al.
Published: (2024)
by: Zheng, Ying, et al.
Published: (2024)
Turning Video Models into Generalist Robot Policies
by: Li, Sizhe Lester, et al.
Published: (2026)
by: Li, Sizhe Lester, et al.
Published: (2026)
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
by: Zhou, Kaichen, et al.
Published: (2026)
by: Zhou, Kaichen, et al.
Published: (2026)
R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation
by: Zhang, Yuhao, et al.
Published: (2026)
by: Zhang, Yuhao, et al.
Published: (2026)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
by: Hu, Yucheng, et al.
Published: (2024)
by: Hu, Yucheng, et al.
Published: (2024)
EVA: An Embodied World Model for Future Video Anticipation
by: Chi, Xiaowei, et al.
Published: (2024)
by: Chi, Xiaowei, et al.
Published: (2024)
Fourier Controller Networks for Real-Time Decision-Making in Embodied Learning
by: Tan, Hengkai, et al.
Published: (2024)
by: Tan, Hengkai, et al.
Published: (2024)
TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation
by: Zhou, Hanyu, et al.
Published: (2026)
by: Zhou, Hanyu, et al.
Published: (2026)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
by: Li, Peiyan, et al.
Published: (2026)
by: Li, Peiyan, et al.
Published: (2026)
DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
by: Gao, Shenyuan, et al.
Published: (2026)
by: Gao, Shenyuan, et al.
Published: (2026)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
by: Chen, Yixiang, et al.
Published: (2026)
by: Chen, Yixiang, et al.
Published: (2026)
WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
by: Shang, Yu, et al.
Published: (2026)
by: Shang, Yu, et al.
Published: (2026)
Rethinking Video Generation Model for the Embodied World
by: Deng, Yufan, et al.
Published: (2026)
by: Deng, Yufan, et al.
Published: (2026)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
by: Liu, Xinhao, et al.
Published: (2024)
by: Liu, Xinhao, et al.
Published: (2024)
RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation
by: Liu, Enguang, et al.
Published: (2025)
by: Liu, Enguang, et al.
Published: (2025)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
by: Shang, Yu, et al.
Published: (2026)
by: Shang, Yu, et al.
Published: (2026)
HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
by: Yang, Tianshuo, et al.
Published: (2026)
by: Yang, Tianshuo, et al.
Published: (2026)
Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization
by: Wang, Jianzong, et al.
Published: (2026)
by: Wang, Jianzong, et al.
Published: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
by: Zhang, Jiyao, et al.
Published: (2026)
by: Zhang, Jiyao, et al.
Published: (2026)
Similar Items
-
AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation
by: Tan, Hengkai, et al.
Published: (2025) -
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
by: Feng, Yao, et al.
Published: (2025) -
Motus: A Unified Latent Action World Model
by: Bi, Hongzhe, et al.
Published: (2025) -
H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
by: Bi, Hongzhe, et al.
Published: (2025) -
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
by: Liu, Songming, et al.
Published: (2024)