$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Pengfei, Chen, Shengcong, Chen, Di, Wang, Jiaxu, Jin, Rongjun, Zhu, Bingwen, Pan, Yike, Gu, Songen, Wang, Kuanning, Nan, Shufeng, Qiu, Xingyu, Qiu, Chenhao, Yang, Pu, Cai, Yunuo, Gao, Jianxiong, Li, Yifan, Fu, Yanwei, Yue, Xiangyu, Chen, Zhi, Luo, Jianlan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation
par: Gu, Songen, et autres
Publié: (2026)
par: Gu, Songen, et autres
Publié: (2026)
Act2Goal: From World Model To General Goal-conditioned Policy
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation
par: Wang, Kuanning, et autres
Publié: (2026)
par: Wang, Kuanning, et autres
Publié: (2026)
RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
par: Jiang, Feng, et autres
Publié: (2026)
par: Jiang, Feng, et autres
Publié: (2026)
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
par: Liao, Yue, et autres
Publié: (2025)
par: Liao, Yue, et autres
Publié: (2025)
Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation
par: Yu, Xinglei, et autres
Publié: (2026)
par: Yu, Xinglei, et autres
Publié: (2026)
GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation
par: Qiu, Boxiang, et autres
Publié: (2026)
par: Qiu, Boxiang, et autres
Publié: (2026)
Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
par: Chi, Haozhuang, et autres
Publié: (2026)
par: Chi, Haozhuang, et autres
Publié: (2026)
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
par: Huang, Siyuan, et autres
Publié: (2025)
par: Huang, Siyuan, et autres
Publié: (2025)
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
par: Yang, Zhaoyang, et autres
Publié: (2026)
par: Yang, Zhaoyang, et autres
Publié: (2026)
OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer
par: Wang, Kuanning, et autres
Publié: (2026)
par: Wang, Kuanning, et autres
Publié: (2026)
EnerVerse-AC: Envisioning Embodied Environments with Action Condition
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
Demystifying Action Space Design for Robotic Manipulation Policies
par: Feng, Yuchun, et autres
Publié: (2026)
par: Feng, Yuchun, et autres
Publié: (2026)
VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis
par: Gu, Songen, et autres
Publié: (2026)
par: Gu, Songen, et autres
Publié: (2026)
iMoWM: Taming Interactive Multi-Modal World Model for Robotic Manipulation
par: Zhang, Chuanrui, et autres
Publié: (2025)
par: Zhang, Chuanrui, et autres
Publié: (2025)
Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction
par: Feng, Jinyuan, et autres
Publié: (2024)
par: Feng, Jinyuan, et autres
Publié: (2024)
FMC-DETR: Frequency-Decoupled Multi-Domain Coordination for Aerial-View Object Detection
par: Liang, Ben, et autres
Publié: (2025)
par: Liang, Ben, et autres
Publié: (2025)
ResWM: Residual-Action World Model for Visual RL
par: Zhang, Jseen, et autres
Publié: (2026)
par: Zhang, Jseen, et autres
Publié: (2026)
RAG-6DPose: Retrieval-Augmented 6D Pose Estimation via Leveraging CAD as Knowledge Base
par: Wang, Kuanning, et autres
Publié: (2025)
par: Wang, Kuanning, et autres
Publié: (2025)
Sequential Multi-Object Grasping with One Dexterous Hand
par: He, Sicheng, et autres
Publié: (2025)
par: He, Sicheng, et autres
Publié: (2025)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
par: Feng, Yunhai, et autres
Publié: (2025)
par: Feng, Yunhai, et autres
Publié: (2025)
Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamic
par: Qu, Wanying, et autres
Publié: (2026)
par: Qu, Wanying, et autres
Publié: (2026)
RAG-WM: An Efficient Black-Box Watermarking Approach for Retrieval-Augmented Generation of Large Language Models
par: Lv, Peizhuo, et autres
Publié: (2025)
par: Lv, Peizhuo, et autres
Publié: (2025)
LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model
par: Cao, Chenjie, et autres
Publié: (2023)
par: Cao, Chenjie, et autres
Publié: (2023)
Inevitable Encounters: Backdoor Attacks Involving Lossy Compression
par: Li, Qian, et autres
Publié: (2026)
par: Li, Qian, et autres
Publié: (2026)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
par: Fan, Qingyu, et autres
Publié: (2026)
par: Fan, Qingyu, et autres
Publié: (2026)
An ontology evolution method based on folksonomy
par: Wang Shufeng
Publié: (2015)
par: Wang Shufeng
Publié: (2015)
PIN-WM: Learning Physics-INformed World Models for Non-Prehensile Manipulation
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution
par: Qiu, Haiyun, et autres
Publié: (2026)
par: Qiu, Haiyun, et autres
Publié: (2026)
A Note on Zero-Point Determinism in the Functional Relation p(x) = p(1) + p(0)
par: Wang, Rongjun
Publié: (2026)
par: Wang, Rongjun
Publié: (2026)
EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models
par: Yue, Hu, et autres
Publié: (2025)
par: Yue, Hu, et autres
Publié: (2025)
Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
3DTMDet: A Dual-Path Synergy Network of Transformer and SSM for 3D Object Detection in Point Clouds
par: Qiu, Bingwen, et autres
Publié: (2026)
par: Qiu, Bingwen, et autres
Publié: (2026)
SCOOP'D: Learning Mixed-Liquid-Solid Scooping via Sim2Real Generative Policy
par: Wang, Kuanning, et autres
Publié: (2025)
par: Wang, Kuanning, et autres
Publié: (2025)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
par: Yin, Shicheng, et autres
Publié: (2026)
par: Yin, Shicheng, et autres
Publié: (2026)
Preparation of interwoven structure composite paper via polylactic acid infiltrating fiber network
par: Yifan Liu, et autres
Publié: (2024)
par: Yifan Liu, et autres
Publié: (2024)
Evolving Skeletons: Motion Dynamics in Action Recognition
par: Qiu, Jushang, et autres
Publié: (2025)
par: Qiu, Jushang, et autres
Publié: (2025)
ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation
par: Chen, Zhikang, et autres
Publié: (2026)
par: Chen, Zhikang, et autres
Publié: (2026)
LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation
par: Huang, Yuhang, et autres
Publié: (2025)
par: Huang, Yuhang, et autres
Publié: (2025)
Documents similaires
-
Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation
par: Gu, Songen, et autres
Publié: (2026) -
Act2Goal: From World Model To General Goal-conditioned Policy
par: Zhou, Pengfei, et autres
Publié: (2025) -
OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation
par: Wang, Kuanning, et autres
Publié: (2026) -
RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
par: Jiang, Feng, et autres
Publié: (2026) -
Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
par: Liao, Yue, et autres
Publié: (2025)