Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Lirui, Zhao, Kevin, Liu, Chaoqi, Chen, Xinlei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
di: Wang, Lirui, et al.
Pubblicazione: (2024)
di: Wang, Lirui, et al.
Pubblicazione: (2024)
Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks
di: Zhao, Jialiang, et al.
Pubblicazione: (2024)
di: Zhao, Jialiang, et al.
Pubblicazione: (2024)
Dense Policy: Bidirectional Autoregressive Learning of Actions
di: Su, Yue, et al.
Pubblicazione: (2025)
di: Su, Yue, et al.
Pubblicazione: (2025)
Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation
di: Zhang, Wenbo, et al.
Pubblicazione: (2025)
di: Zhang, Wenbo, et al.
Pubblicazione: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
Motus: A Unified Latent Action World Model
di: Bi, Hongzhe, et al.
Pubblicazione: (2025)
di: Bi, Hongzhe, et al.
Pubblicazione: (2025)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
World Action Models are Zero-shot Policies
di: Ye, Seonghyeon, et al.
Pubblicazione: (2026)
di: Ye, Seonghyeon, et al.
Pubblicazione: (2026)
CorVS: Person Identification via Video Trajectory-Sensor Correspondence in a Real-World Warehouse
di: Kano, Kazuma, et al.
Pubblicazione: (2025)
di: Kano, Kazuma, et al.
Pubblicazione: (2025)
Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects
di: Kreber, Jens U., et al.
Pubblicazione: (2026)
di: Kreber, Jens U., et al.
Pubblicazione: (2026)
WorldEval: World Model as Real-World Robot Policies Evaluator
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
Improving Vision-Language-Action Model with Online Reinforcement Learning
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning
di: Bai, Chenjia, et al.
Pubblicazione: (2020)
di: Bai, Chenjia, et al.
Pubblicazione: (2020)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
di: Luo, Hao, et al.
Pubblicazione: (2025)
di: Luo, Hao, et al.
Pubblicazione: (2025)
AdaWorld: Learning Adaptable World Models with Latent Actions
di: Gao, Shenyuan, et al.
Pubblicazione: (2025)
di: Gao, Shenyuan, et al.
Pubblicazione: (2025)
iVideoGPT: Interactive VideoGPTs are Scalable World Models
di: Wu, Jialong, et al.
Pubblicazione: (2024)
di: Wu, Jialong, et al.
Pubblicazione: (2024)
DyST: Towards Dynamic Neural Scene Representations on Real-World Videos
di: Seitzer, Maximilian, et al.
Pubblicazione: (2023)
di: Seitzer, Maximilian, et al.
Pubblicazione: (2023)
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
di: Cheang, Chi-Lam, et al.
Pubblicazione: (2024)
di: Cheang, Chi-Lam, et al.
Pubblicazione: (2024)
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
di: Li, Qixiu, et al.
Pubblicazione: (2025)
di: Li, Qixiu, et al.
Pubblicazione: (2025)
Evaluating Real-World Robot Manipulation Policies in Simulation
di: Li, Xuanlin, et al.
Pubblicazione: (2024)
di: Li, Xuanlin, et al.
Pubblicazione: (2024)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2025)
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2025)
Scaling Face Interaction Graph Networks to Real World Scenes
di: Lopez-Guevara, Tatiana, et al.
Pubblicazione: (2024)
di: Lopez-Guevara, Tatiana, et al.
Pubblicazione: (2024)
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
di: Hong, Yining, et al.
Pubblicazione: (2024)
di: Hong, Yining, et al.
Pubblicazione: (2024)
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
di: Lee, Seungjae, et al.
Pubblicazione: (2025)
di: Lee, Seungjae, et al.
Pubblicazione: (2025)
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
di: Guruprasad, Pranav, et al.
Pubblicazione: (2024)
di: Guruprasad, Pranav, et al.
Pubblicazione: (2024)
Latent Action Pretraining from Videos
di: Ye, Seonghyeon, et al.
Pubblicazione: (2024)
di: Ye, Seonghyeon, et al.
Pubblicazione: (2024)
FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
di: An, Xinyuan, et al.
Pubblicazione: (2026)
di: An, Xinyuan, et al.
Pubblicazione: (2026)
GRAPE: Generalizing Robot Policy via Preference Alignment
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
Learning Visual Feature-Based World Models via Residual Latent Action
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
SCENEREPLICA: Benchmarking Real-World Robot Manipulation by Creating Replicable Scenes
di: Khargonkar, Ninad, et al.
Pubblicazione: (2023)
di: Khargonkar, Ninad, et al.
Pubblicazione: (2023)
Learning Massively Multitask World Models for Continuous Control
di: Hansen, Nicklas, et al.
Pubblicazione: (2025)
di: Hansen, Nicklas, et al.
Pubblicazione: (2025)
DISK: Dynamic Inference SKipping for World Models
di: Naman, Anugunj, et al.
Pubblicazione: (2026)
di: Naman, Anugunj, et al.
Pubblicazione: (2026)
Particle-Grid Neural Dynamics for Learning Deformable Object Models from RGB-D Videos
di: Zhang, Kaifeng, et al.
Pubblicazione: (2025)
di: Zhang, Kaifeng, et al.
Pubblicazione: (2025)
GenSim: Generating Robotic Simulation Tasks via Large Language Models
di: Wang, Lirui, et al.
Pubblicazione: (2023)
di: Wang, Lirui, et al.
Pubblicazione: (2023)
CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving
di: Zheng, Xiaoji, et al.
Pubblicazione: (2025)
di: Zheng, Xiaoji, et al.
Pubblicazione: (2025)
ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning
di: Liang, Yichao, et al.
Pubblicazione: (2025)
di: Liang, Yichao, et al.
Pubblicazione: (2025)
ReGentS: Real-World Safety-Critical Driving Scenario Generation Made Stable
di: Yin, Yuan, et al.
Pubblicazione: (2024)
di: Yin, Yuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers
di: Wang, Lirui, et al.
Pubblicazione: (2024) -
Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks
di: Zhao, Jialiang, et al.
Pubblicazione: (2024) -
Dense Policy: Bidirectional Autoregressive Learning of Actions
di: Su, Yue, et al.
Pubblicazione: (2025) -
Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation
di: Zhang, Wenbo, et al.
Pubblicazione: (2025) -
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
di: Zhao, Baining, et al.
Pubblicazione: (2026)