MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction
Fuente:
arXiv
Salvato in:
| Autori principali: | Ni, Jingcheng, Guo, Yuxin, Liu, Yichen, Chen, Rui, Lu, Lewei, Wu, Zehuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
di: Zhang, Tianrui, et al.
Pubblicazione: (2025)
di: Zhang, Tianrui, et al.
Pubblicazione: (2025)
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
di: Chen, Rui, et al.
Pubblicazione: (2024)
di: Chen, Rui, et al.
Pubblicazione: (2024)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
di: Wu, Zehuan, et al.
Pubblicazione: (2024)
ReactiveGWM: Steering NPC in Reactive Game World Models
di: Wang, Zeqing, et al.
Pubblicazione: (2026)
di: Wang, Zeqing, et al.
Pubblicazione: (2026)
ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
di: Qiu, Han, et al.
Pubblicazione: (2024)
di: Qiu, Han, et al.
Pubblicazione: (2024)
Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?
di: Liang, Chen, et al.
Pubblicazione: (2024)
di: Liang, Chen, et al.
Pubblicazione: (2024)
Semantic Segmentation on VSPW Dataset through Masked Video Consistency
di: Liang, Chen, et al.
Pubblicazione: (2024)
di: Liang, Chen, et al.
Pubblicazione: (2024)
Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
di: Hu, Bin, et al.
Pubblicazione: (2025)
di: Hu, Bin, et al.
Pubblicazione: (2025)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
Wavelet-Domain Masked Image Modeling for Color-Consistent HDR Video Reconstruction
di: Zhang, Yang, et al.
Pubblicazione: (2026)
di: Zhang, Yang, et al.
Pubblicazione: (2026)
Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image Restoration
di: Qin, Chu-Jie, et al.
Pubblicazione: (2024)
di: Qin, Chu-Jie, et al.
Pubblicazione: (2024)
Enhancing Image Matting in Real-World Scenes with Mask-Guided Iterative Refinement
di: Liu, Rui
Pubblicazione: (2025)
di: Liu, Rui
Pubblicazione: (2025)
AU-vMAE: Knowledge-Guide Action Units Detection via Video Masked Autoencoder
di: Jin, Qiaoqiao, et al.
Pubblicazione: (2024)
di: Jin, Qiaoqiao, et al.
Pubblicazione: (2024)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
di: Zou, Jialv, et al.
Pubblicazione: (2024)
di: Zou, Jialv, et al.
Pubblicazione: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
di: Chen, Wenchao, et al.
Pubblicazione: (2024)
di: Chen, Wenchao, et al.
Pubblicazione: (2024)
Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
di: Paidi, Santosh Kumar
Pubblicazione: (2026)
di: Paidi, Santosh Kumar
Pubblicazione: (2026)
MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
di: Chen, Yixiang, et al.
Pubblicazione: (2026)
di: Chen, Yixiang, et al.
Pubblicazione: (2026)
Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
di: Yang, Jingyi, et al.
Pubblicazione: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
di: Tian, Yuan, et al.
Pubblicazione: (2024)
di: Tian, Yuan, et al.
Pubblicazione: (2024)
VideoMAC: Video Masked Autoencoders Meet ConvNets
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
Hierarchical Masked 3D Diffusion Model for Video Outpainting
di: Fan, Fanda, et al.
Pubblicazione: (2023)
di: Fan, Fanda, et al.
Pubblicazione: (2023)
SIGMA: Sinkhorn-Guided Masked Video Modeling
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
Data Collection-free Masked Video Modeling
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2024)
di: Ishikawa, Yuchi, et al.
Pubblicazione: (2024)
Recurrent Video Masked Autoencoders
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
di: Zoran, Daniel, et al.
Pubblicazione: (2025)
Taming Teacher Forcing for Masked Autoregressive Video Generation
di: Zhou, Deyu, et al.
Pubblicazione: (2025)
di: Zhou, Deyu, et al.
Pubblicazione: (2025)
Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression
di: Wang, Lirui, et al.
Pubblicazione: (2025)
di: Wang, Lirui, et al.
Pubblicazione: (2025)
MaskControl: Spatio-Temporal Control for Masked Motion Synthesis
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling
di: Javed, Muhammad Gohar, et al.
Pubblicazione: (2024)
di: Javed, Muhammad Gohar, et al.
Pubblicazione: (2024)
FMVP: Masked Flow Matching for Adversarial Video Purification
di: Tang, Duoxun, et al.
Pubblicazione: (2026)
di: Tang, Duoxun, et al.
Pubblicazione: (2026)
CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
di: Wu, Xiaoxue, et al.
Pubblicazione: (2025)
DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2025)
di: Shi, Chen, et al.
Pubblicazione: (2025)
Diffusion Transformer Meets Random Masks: An Advanced PET Reconstruction Framework
di: Huang, Bin, et al.
Pubblicazione: (2025)
di: Huang, Bin, et al.
Pubblicazione: (2025)
DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving
di: Dang, Chenxu, et al.
Pubblicazione: (2026)
di: Dang, Chenxu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
di: Zhang, Tianrui, et al.
Pubblicazione: (2025) -
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
di: Chen, Rui, et al.
Pubblicazione: (2024) -
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
di: Wu, Zehuan, et al.
Pubblicazione: (2024) -
ReactiveGWM: Steering NPC in Reactive Game World Models
di: Wang, Zeqing, et al.
Pubblicazione: (2026) -
ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)