Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Moo Jin, Gao, Yihuai, Lin, Tsung-Yi, Lin, Yen-Chen, Ge, Yunhao, Lam, Grace, Liang, Percy, Song, Shuran, Liu, Ming-Yu, Finn, Chelsea, Gu, Jinwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
di: Kim, Moo Jin, et al.
Pubblicazione: (2025)
di: Kim, Moo Jin, et al.
Pubblicazione: (2025)
Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
di: Sun, Zhanyi, et al.
Pubblicazione: (2025)
di: Sun, Zhanyi, et al.
Pubblicazione: (2025)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
di: Liang, Junbang, et al.
Pubblicazione: (2024)
di: Liang, Junbang, et al.
Pubblicazione: (2024)
Gated Memory Policy
di: Gao, Yihuai, et al.
Pubblicazione: (2026)
di: Gao, Yihuai, et al.
Pubblicazione: (2026)
Unified Video Action Model
di: Li, Shuang, et al.
Pubblicazione: (2025)
di: Li, Shuang, et al.
Pubblicazione: (2025)
Scalable Policy Evaluation with Video World Models
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
di: Chi, Cheng, et al.
Pubblicazione: (2023)
di: Chi, Cheng, et al.
Pubblicazione: (2023)
UMI on Legs: Making Manipulation Policies Mobile with Manipulation-Centric Whole-body Controllers
di: Ha, Huy, et al.
Pubblicazione: (2024)
di: Ha, Huy, et al.
Pubblicazione: (2024)
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
di: Tajwar, Fahim, et al.
Pubblicazione: (2024)
UMI-on-Air: Embodiment-Aware Guidance for Embodiment-Agnostic Visuomotor Policies
di: Gupta, Harsh, et al.
Pubblicazione: (2025)
di: Gupta, Harsh, et al.
Pubblicazione: (2025)
AutoFT: Learning an Objective for Robust Fine-Tuning
di: Choi, Caroline, et al.
Pubblicazione: (2024)
di: Choi, Caroline, et al.
Pubblicazione: (2024)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
di: Prasad, Aaditya, et al.
Pubblicazione: (2024)
di: Prasad, Aaditya, et al.
Pubblicazione: (2024)
OneTo3D: One Image to Re-editable Dynamic 3D Model and Video Generation
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
di: Ma, Jiahua, et al.
Pubblicazione: (2026)
di: Ma, Jiahua, et al.
Pubblicazione: (2026)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
di: Gong, Zhefei, et al.
Pubblicazione: (2024)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
di: Lee, Tony, et al.
Pubblicazione: (2026)
di: Lee, Tony, et al.
Pubblicazione: (2026)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
di: He, Yufan, et al.
Pubblicazione: (2025)
di: He, Yufan, et al.
Pubblicazione: (2025)
Constraint-Preserving Data Generation for Visuomotor Policy Learning
di: Lin, Kevin, et al.
Pubblicazione: (2025)
di: Lin, Kevin, et al.
Pubblicazione: (2025)
Dissecting Fine-Tuning Unlearning in Large Language Models
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
Cosmos World Foundation Model Platform for Physical AI
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
Latent Diffusion Planning for Imitation Learning
di: Xie, Amber, et al.
Pubblicazione: (2025)
di: Xie, Amber, et al.
Pubblicazione: (2025)
Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation
di: Ge, Yunhao, et al.
Pubblicazione: (2024)
di: Ge, Yunhao, et al.
Pubblicazione: (2024)
Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
Plenoptic Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2026)
di: Fu, Xiao, et al.
Pubblicazione: (2026)
EXPO: Stable Reinforcement Learning with Expressive Policies
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
di: Lei, Yuheng, et al.
Pubblicazione: (2026)
di: Lei, Yuheng, et al.
Pubblicazione: (2026)
Fast Visuomotor Policy for Robotic Manipulation
di: Jia, Jingkai, et al.
Pubblicazione: (2025)
di: Jia, Jingkai, et al.
Pubblicazione: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
Learning Generalizable Visuomotor Policy through Dynamics-Alignment
di: Lee, Dohyeok, et al.
Pubblicazione: (2025)
di: Lee, Dohyeok, et al.
Pubblicazione: (2025)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
Learning Long-Context Diffusion Policies via Past-Token Prediction
di: Torne, Marcel, et al.
Pubblicazione: (2025)
di: Torne, Marcel, et al.
Pubblicazione: (2025)
Do You Need Proprioceptive States in Visuomotor Policies?
di: Zhao, Juntu, et al.
Pubblicazione: (2025)
di: Zhao, Juntu, et al.
Pubblicazione: (2025)
LIVE: LaTex Interactive Visual Editing
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Robot Detection System 3: LRF groups and Coordinate System
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Anywhere: A Web Crawler Automation Management Interface
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Dynamic NeRF: A Review
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Documenti analoghi
-
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
di: Kim, Moo Jin, et al.
Pubblicazione: (2025) -
Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution
di: Sun, Zhanyi, et al.
Pubblicazione: (2025) -
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
di: Liang, Junbang, et al.
Pubblicazione: (2024) -
Gated Memory Policy
di: Gao, Yihuai, et al.
Pubblicazione: (2026) -
Unified Video Action Model
di: Li, Shuang, et al.
Pubblicazione: (2025)