iVideoGPT: Interactive VideoGPTs are Scalable World Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Jialong, Yin, Shaofeng, Feng, Ningya, He, Xu, Li, Dong, Hao, Jianye, Long, Mingsheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
di: Miao, Shangchen, et al.
Pubblicazione: (2026)
di: Miao, Shangchen, et al.
Pubblicazione: (2026)
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025)
di: Wu, Jialong, et al.
Pubblicazione: (2025)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
Vid2World: Crafting Video Diffusion Models to Interactive World Models
di: Huang, Siqiao, et al.
Pubblicazione: (2025)
di: Huang, Siqiao, et al.
Pubblicazione: (2025)
Zero-Shot Temporal Interaction Localization for Egocentric Videos
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
di: Zhang, Erhang, et al.
Pubblicazione: (2025)
SUGAR: A Scalable Human-Video-Driven Generalizable Humanoid Loco-Manipulation Learning Framework
di: Wu, Tianshu, et al.
Pubblicazione: (2026)
di: Wu, Tianshu, et al.
Pubblicazione: (2026)
DeformMaster: An Interactive Physics-Neural World Model for Deformable Objects from Videos
di: Li, Can, et al.
Pubblicazione: (2026)
di: Li, Can, et al.
Pubblicazione: (2026)
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning
di: Yang, Jiange, et al.
Pubblicazione: (2025)
di: Yang, Jiange, et al.
Pubblicazione: (2025)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation
di: Zhao, Hongxiang, et al.
Pubblicazione: (2025)
di: Zhao, Hongxiang, et al.
Pubblicazione: (2025)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
di: Chen, Yixiang, et al.
Pubblicazione: (2026)
di: Chen, Yixiang, et al.
Pubblicazione: (2026)
Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
di: He, Yufan, et al.
Pubblicazione: (2025)
di: He, Yufan, et al.
Pubblicazione: (2025)
World Models for Learning Dexterous Hand-Object Interactions from Human Videos
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2025)
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2025)
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
Hand-Object Interaction Pretraining from Videos
di: Singh, Himanshu Gaurav, et al.
Pubblicazione: (2024)
di: Singh, Himanshu Gaurav, et al.
Pubblicazione: (2024)
Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation
di: Zhang, Hai, et al.
Pubblicazione: (2026)
di: Zhang, Hai, et al.
Pubblicazione: (2026)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
di: Li, Peiyan, et al.
Pubblicazione: (2026)
di: Li, Peiyan, et al.
Pubblicazione: (2026)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
di: Liang, Junbang, et al.
Pubblicazione: (2024)
di: Liang, Junbang, et al.
Pubblicazione: (2024)
Learning Camera Movement Control from Real-World Drone Videos
di: Hou, Yunzhong, et al.
Pubblicazione: (2024)
di: Hou, Yunzhong, et al.
Pubblicazione: (2024)
Scalable Benchmarking and Robust Learning for Noise-Free Ego-Motion and 3D Reconstruction from Noisy Video
di: Xu, Xiaohao, et al.
Pubblicazione: (2025)
di: Xu, Xiaohao, et al.
Pubblicazione: (2025)
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
di: Mei, Zhiting, et al.
Pubblicazione: (2025)
di: Mei, Zhiting, et al.
Pubblicazione: (2025)
EVA: An Embodied World Model for Future Video Anticipation
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
di: Zhou, Kaichen, et al.
Pubblicazione: (2026)
di: Zhou, Kaichen, et al.
Pubblicazione: (2026)
MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion
di: Hou, Minghui, et al.
Pubblicazione: (2025)
di: Hou, Minghui, et al.
Pubblicazione: (2025)
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
di: Guan, Runwei, et al.
Pubblicazione: (2026)
di: Guan, Runwei, et al.
Pubblicazione: (2026)
HarmonyDream: Task Harmonization Inside World Models
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
Rethinking Video Generation Model for the Embodied World
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
di: Li, Qixiu, et al.
Pubblicazione: (2025)
di: Li, Qixiu, et al.
Pubblicazione: (2025)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
ManipGPT: Is Affordance Segmentation by Large Vision Models Enough for Articulated Object Manipulation?
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
Trajectory World Models for Heterogeneous Environments
di: Yin, Shaofeng, et al.
Pubblicazione: (2025)
di: Yin, Shaofeng, et al.
Pubblicazione: (2025)
Mask2IV: Interaction-Centric Video Generation via Mask Trajectories
di: Li, Gen, et al.
Pubblicazione: (2025)
di: Li, Gen, et al.
Pubblicazione: (2025)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
di: Zhou, Yang, et al.
Pubblicazione: (2026)
di: Zhou, Yang, et al.
Pubblicazione: (2026)
ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment
di: Chen, Yuzhi, et al.
Pubblicazione: (2026)
di: Chen, Yuzhi, et al.
Pubblicazione: (2026)
VILP: Imitation Learning with Latent Video Planning
di: Xu, Zhengtong, et al.
Pubblicazione: (2025)
di: Xu, Zhengtong, et al.
Pubblicazione: (2025)
Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?
di: Wang, Dingrui, et al.
Pubblicazione: (2025)
di: Wang, Dingrui, et al.
Pubblicazione: (2025)
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
di: Li, Qiang, et al.
Pubblicazione: (2025)
di: Li, Qiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
di: Miao, Shangchen, et al.
Pubblicazione: (2026) -
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025) -
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024) -
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025) -
Vid2World: Crafting Video Diffusion Models to Interactive World Models
di: Huang, Siqiao, et al.
Pubblicazione: (2025)