minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Min, Zhu, Hongzhou, Yan, Bokai, Zhou, Zihan, Chen, Yimin, Sun, Wenqiang, Zheng, Kaiwen, He, Guande, Yang, Xiao, Li, Chongxuan, Bao, Fan, Zhu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
di: Zhao, Min, et al.
Pubblicazione: (2026)
di: Zhao, Min, et al.
Pubblicazione: (2026)
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
di: Zhao, Min, et al.
Pubblicazione: (2024)
di: Zhao, Min, et al.
Pubblicazione: (2024)
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
di: Bao, Fan, et al.
Pubblicazione: (2024)
di: Bao, Fan, et al.
Pubblicazione: (2024)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
Consistency Diffusion Bridge Models
di: He, Guande, et al.
Pubblicazione: (2024)
di: He, Guande, et al.
Pubblicazione: (2024)
Elucidating the Preconditioning in Consistency Distillation
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
Diffusion Bridge Implicit Models
di: Zheng, Kaiwen, et al.
Pubblicazione: (2024)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2024)
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
di: Chen, Zehua, et al.
Pubblicazione: (2023)
di: Chen, Zehua, et al.
Pubblicazione: (2023)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
di: Guo, Junliang, et al.
Pubblicazione: (2025)
di: Guo, Junliang, et al.
Pubblicazione: (2025)
Brain-WM: Brain Glioblastoma World Model
di: Wang, Chenhui, et al.
Pubblicazione: (2026)
di: Wang, Chenhui, et al.
Pubblicazione: (2026)
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
di: Zhou, Pengfei, et al.
Pubblicazione: (2026)
di: Zhou, Pengfei, et al.
Pubblicazione: (2026)
EgoExo-WM: Unlocking Exo Video for Ego World Models
di: Tran, Danny, et al.
Pubblicazione: (2026)
di: Tran, Danny, et al.
Pubblicazione: (2026)
Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
di: Lu, Cheng, et al.
Pubblicazione: (2022)
di: Lu, Cheng, et al.
Pubblicazione: (2022)
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
di: Wang, Meizhong, et al.
Pubblicazione: (2026)
di: Wang, Meizhong, et al.
Pubblicazione: (2026)
WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
VideoSAM: Open-World Video Segmentation
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
di: Guo, Pinxue, et al.
Pubblicazione: (2024)
iMoWM: Taming Interactive Multi-Modal World Model for Robotic Manipulation
di: Zhang, Chuanrui, et al.
Pubblicazione: (2025)
di: Zhang, Chuanrui, et al.
Pubblicazione: (2025)
ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation
di: Chen, Zhikang, et al.
Pubblicazione: (2026)
di: Chen, Zhikang, et al.
Pubblicazione: (2026)
FullStack Bench: Evaluating LLMs as Full Stack Coders
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
MotionStream: Real-Time Video Generation with Interactive Motion Controls
di: Shin, Joonghyuk, et al.
Pubblicazione: (2025)
di: Shin, Joonghyuk, et al.
Pubblicazione: (2025)
SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
di: Zhu, Haoyi, et al.
Pubblicazione: (2026)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
di: Yin, Shicheng, et al.
Pubblicazione: (2026)
di: Yin, Shicheng, et al.
Pubblicazione: (2026)
ResWM: Residual-Action World Model for Visual RL
di: Zhang, Jseen, et al.
Pubblicazione: (2026)
di: Zhang, Jseen, et al.
Pubblicazione: (2026)
Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations
di: Xue, Kaiwen, et al.
Pubblicazione: (2024)
di: Xue, Kaiwen, et al.
Pubblicazione: (2024)
InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model
di: InSpatio Team, et al.
Pubblicazione: (2026)
di: InSpatio Team, et al.
Pubblicazione: (2026)
MicroDreamer: Efficient 3D Generation in $\sim$20 Seconds by Score-based Iterative Reconstruction
di: Chen, Luxi, et al.
Pubblicazione: (2024)
di: Chen, Luxi, et al.
Pubblicazione: (2024)
OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction
di: Song, Yuxin Ray, et al.
Pubblicazione: (2025)
di: Song, Yuxin Ray, et al.
Pubblicazione: (2025)
VRAG: Learning World Models for Interactive Video Generation
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
AdaWM: Adaptive World Model based Planning for Autonomous Driving
di: Wang, Hang, et al.
Pubblicazione: (2025)
di: Wang, Hang, et al.
Pubblicazione: (2025)
Generalizing End-To-End Autonomous Driving In Real-World Environments Using Zero-Shot LLMs
di: Dong, Zeyu, et al.
Pubblicazione: (2024)
di: Dong, Zeyu, et al.
Pubblicazione: (2024)
OpenDCVCs: A PyTorch Open Source Implementation and Performance Evaluation of the DCVC series Video Codecs
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Open-Source Full-Duplex Conversational Datasets for Natural and Interactive Speech Synthesis
di: Zhou, Zhitong, et al.
Pubblicazione: (2025)
di: Zhou, Zhitong, et al.
Pubblicazione: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
Vision-based Manipulation from Single Human Video with Open-World Object Graphs
di: Zhu, Yifeng, et al.
Pubblicazione: (2024)
di: Zhu, Yifeng, et al.
Pubblicazione: (2024)
Pose-Aware Diffusion for 3D Generation
di: Zhou, Zihan, et al.
Pubblicazione: (2026)
di: Zhou, Zihan, et al.
Pubblicazione: (2026)
H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model
di: Huang, Jinbang, et al.
Pubblicazione: (2026)
di: Huang, Jinbang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
di: Zhao, Min, et al.
Pubblicazione: (2026) -
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025) -
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025) -
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
di: Zhao, Min, et al.
Pubblicazione: (2024) -
Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
di: Bao, Fan, et al.
Pubblicazione: (2024)