Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Songen, Cai, Yunuo, Wang, Tianyu, Wu, Simo, Fu, Yanwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
par: Zhou, Pengfei, et autres
Publié: (2026)
par: Zhou, Pengfei, et autres
Publié: (2026)
VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation
par: Yu, Xinglei, et autres
Publié: (2026)
par: Yu, Xinglei, et autres
Publié: (2026)
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
par: Liu, Zhenyang, et autres
Publié: (2026)
par: Liu, Zhenyang, et autres
Publié: (2026)
OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
par: Zheng, Yuhang, et autres
Publié: (2026)
par: Zheng, Yuhang, et autres
Publié: (2026)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination
par: Barcellona, Leonardo, et autres
Publié: (2024)
par: Barcellona, Leonardo, et autres
Publié: (2024)
DreamGen: Unlocking Generalization in Robot Learning through Video World Models
par: Jang, Joel, et autres
Publié: (2025)
par: Jang, Joel, et autres
Publié: (2025)
GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation
par: Zhang, Zijian, et autres
Publié: (2026)
par: Zhang, Zijian, et autres
Publié: (2026)
TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation
par: Xu, Qinwen, et autres
Publié: (2026)
par: Xu, Qinwen, et autres
Publié: (2026)
VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis
par: Gu, Songen, et autres
Publié: (2026)
par: Gu, Songen, et autres
Publié: (2026)
Optimizing Robotic Manipulation with Decision-RWKV: A Recurrent Sequence Modeling Approach for Lifelong Learning
par: Dong, Yujian, et autres
Publié: (2024)
par: Dong, Yujian, et autres
Publié: (2024)
Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?
par: Zhang, Zhongru, et autres
Publié: (2026)
par: Zhang, Zhongru, et autres
Publié: (2026)
TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control
par: Liu, Zhenyang, et autres
Publié: (2025)
par: Liu, Zhenyang, et autres
Publié: (2025)
World Models for Robotic Manipulation: A Survey
par: Wang, Fangyuan, et autres
Publié: (2026)
par: Wang, Fangyuan, et autres
Publié: (2026)
Learning Robot Manipulation from Audio World Models
par: Zhang, Fan, et autres
Publié: (2025)
par: Zhang, Fan, et autres
Publié: (2025)
OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation
par: Wang, Kuanning, et autres
Publié: (2026)
par: Wang, Kuanning, et autres
Publié: (2026)
Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation
par: Song, Zijian, et autres
Publié: (2026)
par: Song, Zijian, et autres
Publié: (2026)
AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Adaptive Learning for Robotic Manipulation
par: Yuan, Ge, et autres
Publié: (2026)
par: Yuan, Ge, et autres
Publié: (2026)
Learning Versatile Humanoid Manipulation with Touch Dreaming
par: Niu, Yaru, et autres
Publié: (2026)
par: Niu, Yaru, et autres
Publié: (2026)
Instruct2Act: From Human Instruction to Actions Sequencing and Execution via Robot Action Network for Robotic Manipulation
par: Sharma, Archit, et autres
Publié: (2026)
par: Sharma, Archit, et autres
Publié: (2026)
STORM: Search-Guided Generative World Models for Robotic Manipulation
par: Lin, Wenjun, et autres
Publié: (2025)
par: Lin, Wenjun, et autres
Publié: (2025)
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
par: Fang, Haoquan, et autres
Publié: (2025)
par: Fang, Haoquan, et autres
Publié: (2025)
Imagine2Act: Leveraging Object-Action Motion Consistency from Imagined Goals for Robotic Manipulation
par: Heng, Liang, et autres
Publié: (2025)
par: Heng, Liang, et autres
Publié: (2025)
EEG-Driven AR-Robot System for Zero-Touch Grasping Manipulation
par: Wang, Junzhe, et autres
Publié: (2025)
par: Wang, Junzhe, et autres
Publié: (2025)
World In Your Hands: A Large-Scale and Open-Source Ecosystem for Learning Human-Centric Manipulation in the Wild
par: Zheng, Yupeng, et autres
Publié: (2025)
par: Zheng, Yupeng, et autres
Publié: (2025)
Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow
par: Dharmarajan, Karthik, et autres
Publié: (2025)
par: Dharmarajan, Karthik, et autres
Publié: (2025)
Learning Instruction-Guided Manipulation Affordance via Large Models for Embodied Robotic Tasks
par: Li, Dayou, et autres
Publié: (2024)
par: Li, Dayou, et autres
Publié: (2024)
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
par: Wang, Guokang, et autres
Publié: (2024)
par: Wang, Guokang, et autres
Publié: (2024)
iMoWM: Taming Interactive Multi-Modal World Model for Robotic Manipulation
par: Zhang, Chuanrui, et autres
Publié: (2025)
par: Zhang, Chuanrui, et autres
Publié: (2025)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
par: Yao, Yuanqi, et autres
Publié: (2025)
par: Yao, Yuanqi, et autres
Publié: (2025)
RoboDream: Compositional World Models for Scalable Robot Data Synthesis
par: Ye, Junjie, et autres
Publié: (2026)
par: Ye, Junjie, et autres
Publié: (2026)
DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
par: Gao, Shenyuan, et autres
Publié: (2026)
par: Gao, Shenyuan, et autres
Publié: (2026)
VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
par: Zhou, Kaichen, et autres
Publié: (2026)
par: Zhou, Kaichen, et autres
Publié: (2026)
DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
par: Jia, Emily Yue-Ting, et autres
Publié: (2026)
par: Jia, Emily Yue-Ting, et autres
Publié: (2026)
STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
par: Tian, Yuxuan, et autres
Publié: (2026)
par: Tian, Yuxuan, et autres
Publié: (2026)
DreamToNav: Generalizable Navigation for Robots via Generative Video Planning
par: Serpiva, Valerii, et autres
Publié: (2026)
par: Serpiva, Valerii, et autres
Publié: (2026)
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
par: Bai, Yongjie, et autres
Publié: (2025)
par: Bai, Yongjie, et autres
Publié: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026)
par: Li, Huiqiong, et autres
Publié: (2026)
iManip: Skill-Incremental Learning for Robotic Manipulation
par: Zheng, Zexin, et autres
Publié: (2025)
par: Zheng, Zexin, et autres
Publié: (2025)
Documents similaires
-
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
par: Zhou, Pengfei, et autres
Publié: (2026) -
VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation
par: Yu, Xinglei, et autres
Publié: (2026) -
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
par: Liu, Zhenyang, et autres
Publié: (2026) -
OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation
par: Zheng, Yuhang, et autres
Publié: (2026) -
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
par: Wang, Tianyu, et autres
Publié: (2024)