Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Haoran, Bai, Chenjia, Pan, Ling, Zhang, Weinan, Zhao, Bin, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction
di: Fan, Chenyou, et al.
Pubblicazione: (2025)
di: Fan, Chenyou, et al.
Pubblicazione: (2025)
AMPLIFY: Actionless Motion Priors for Robot Learning from Videos
di: Collins, Jeremy A., et al.
Pubblicazione: (2025)
di: Collins, Jeremy A., et al.
Pubblicazione: (2025)
SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
di: Zhang, Junjie, et al.
Pubblicazione: (2024)
di: Zhang, Junjie, et al.
Pubblicazione: (2024)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
di: Wu, Pengyuan, et al.
Pubblicazione: (2026)
di: Wu, Pengyuan, et al.
Pubblicazione: (2026)
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
di: Gao, Hao, et al.
Pubblicazione: (2025)
di: Gao, Hao, et al.
Pubblicazione: (2025)
SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects
di: Geng, Haoran, et al.
Pubblicazione: (2023)
di: Geng, Haoran, et al.
Pubblicazione: (2023)
Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis
di: Li, Dayou, et al.
Pubblicazione: (2026)
di: Li, Dayou, et al.
Pubblicazione: (2026)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach
di: Yang, Siyuan, et al.
Pubblicazione: (2025)
di: Yang, Siyuan, et al.
Pubblicazione: (2025)
Action Images: End-to-End Policy Learning via Multiview Video Generation
di: Zhen, Haoyu, et al.
Pubblicazione: (2026)
di: Zhen, Haoyu, et al.
Pubblicazione: (2026)
DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
di: Egbe, ThankGod, et al.
Pubblicazione: (2025)
di: Egbe, ThankGod, et al.
Pubblicazione: (2025)
NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
di: Li, Hongyu, et al.
Pubblicazione: (2025)
di: Li, Hongyu, et al.
Pubblicazione: (2025)
Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
di: Zheng, Jiakun, et al.
Pubblicazione: (2026)
di: Zheng, Jiakun, et al.
Pubblicazione: (2026)
Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
di: Wang, Lirui, et al.
Pubblicazione: (2024)
di: Wang, Lirui, et al.
Pubblicazione: (2024)
Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning
di: Bai, Chenjia, et al.
Pubblicazione: (2020)
di: Bai, Chenjia, et al.
Pubblicazione: (2020)
2HandedAfforder: Learning Precise Actionable Bimanual Affordances from Human Videos
di: Heidinger, Marvin, et al.
Pubblicazione: (2025)
di: Heidinger, Marvin, et al.
Pubblicazione: (2025)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
di: He, Yufan, et al.
Pubblicazione: (2025)
di: He, Yufan, et al.
Pubblicazione: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
di: Hou, Zhi, et al.
Pubblicazione: (2025)
di: Hou, Zhi, et al.
Pubblicazione: (2025)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
di: Wen, Xin, et al.
Pubblicazione: (2025)
di: Wen, Xin, et al.
Pubblicazione: (2025)
Pre-Trained Video Generative Models as World Simulators
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
di: Liang, Junbang, et al.
Pubblicazione: (2024)
di: Liang, Junbang, et al.
Pubblicazione: (2024)
EgoMimic: Scaling Imitation Learning via Egocentric Video
di: Kareer, Simar, et al.
Pubblicazione: (2024)
di: Kareer, Simar, et al.
Pubblicazione: (2024)
ARDuP: Active Region Video Diffusion for Universal Policies
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer
di: Yardi, Yash, et al.
Pubblicazione: (2025)
di: Yardi, Yash, et al.
Pubblicazione: (2025)
Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation
di: Zhao, Yinuo, et al.
Pubblicazione: (2024)
di: Zhao, Yinuo, et al.
Pubblicazione: (2024)
CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion
di: Ma, Jiahua, et al.
Pubblicazione: (2025)
di: Ma, Jiahua, et al.
Pubblicazione: (2025)
Diffusion Transformer Policy
di: Hou, Zhi, et al.
Pubblicazione: (2024)
di: Hou, Zhi, et al.
Pubblicazione: (2024)
DexGraspNet 2.0: Learning Generative Dexterous Grasping in Large-scale Synthetic Cluttered Scenes
di: Zhang, Jialiang, et al.
Pubblicazione: (2024)
di: Zhang, Jialiang, et al.
Pubblicazione: (2024)
Diffusion Reward: Learning Rewards via Conditional Video Diffusion
di: Huang, Tao, et al.
Pubblicazione: (2023)
di: Huang, Tao, et al.
Pubblicazione: (2023)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
di: Li, Peiyan, et al.
Pubblicazione: (2026)
di: Li, Peiyan, et al.
Pubblicazione: (2026)
X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations
di: Pace, Maximus A., et al.
Pubblicazione: (2025)
di: Pace, Maximus A., et al.
Pubblicazione: (2025)
Humanoid Whole-Body Locomotion on Narrow Terrain via Dynamic Balance and Reinforcement Learning
di: Xie, Weiji, et al.
Pubblicazione: (2025)
di: Xie, Weiji, et al.
Pubblicazione: (2025)
The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
di: Tsagkas, Nikolaos, et al.
Pubblicazione: (2025)
di: Tsagkas, Nikolaos, et al.
Pubblicazione: (2025)
Generalizable Humanoid Manipulation with 3D Diffusion Policies
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
Think Small, Act Big: Primitive Prompt Learning for Lifelong Robot Manipulation
di: Yao, Yuanqi, et al.
Pubblicazione: (2025)
di: Yao, Yuanqi, et al.
Pubblicazione: (2025)
Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
Robot Learning from Human Videos: A Survey
di: Ma, Junyi, et al.
Pubblicazione: (2026)
di: Ma, Junyi, et al.
Pubblicazione: (2026)
Large Pre-Trained Models for Bimanual Manipulation in 3D
di: Yurchyk, Hanna, et al.
Pubblicazione: (2025)
di: Yurchyk, Hanna, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction
di: Fan, Chenyou, et al.
Pubblicazione: (2025) -
AMPLIFY: Actionless Motion Priors for Robot Learning from Videos
di: Collins, Jeremy A., et al.
Pubblicazione: (2025) -
SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
di: Zhang, Junjie, et al.
Pubblicazione: (2024) -
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
di: Wu, Pengyuan, et al.
Pubblicazione: (2026) -
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
di: Gao, Hao, et al.
Pubblicazione: (2025)