MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Haiguang, Liu, Daqi, Xie, Hongwei, Liu, Haisong, Ma, Enhui, Yu, Kaicheng, Wang, Limin, Wang, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
di: Ma, Enhui, et al.
Pubblicazione: (2024)
di: Ma, Enhui, et al.
Pubblicazione: (2024)
Arbitrary Generative Video Interpolation
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
di: Zhang, Guozhen, et al.
Pubblicazione: (2025)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
di: Chen, Rui, et al.
Pubblicazione: (2024)
di: Chen, Rui, et al.
Pubblicazione: (2024)
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
di: Li, Qiang, et al.
Pubblicazione: (2025)
di: Li, Qiang, et al.
Pubblicazione: (2025)
Do LLM Modules Generalize? A Study on Motion Generation for Autonomous Driving
di: Wang, Mingyi, et al.
Pubblicazione: (2025)
di: Wang, Mingyi, et al.
Pubblicazione: (2025)
Fully Sparse 3D Occupancy Prediction
di: Liu, Haisong, et al.
Pubblicazione: (2023)
di: Liu, Haisong, et al.
Pubblicazione: (2023)
SurroundSDF: Implicit 3D Scene Understanding Based on Signed Distance Field
di: Liu, Lizhe, et al.
Pubblicazione: (2024)
di: Liu, Lizhe, et al.
Pubblicazione: (2024)
StageInteractor: Query-based Object Detector with Cross-stage Interaction
di: Teng, Yao, et al.
Pubblicazione: (2023)
di: Teng, Yao, et al.
Pubblicazione: (2023)
Self-Supervised Multi-Frame Neural Scene Flow
di: Liu, Dongrui, et al.
Pubblicazione: (2024)
di: Liu, Dongrui, et al.
Pubblicazione: (2024)
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
di: Xia, Tianze, et al.
Pubblicazione: (2025)
di: Xia, Tianze, et al.
Pubblicazione: (2025)
Learning Optical Flow and Scene Flow with Bidirectional Camera-LiDAR Fusion
di: Liu, Haisong, et al.
Pubblicazione: (2023)
di: Liu, Haisong, et al.
Pubblicazione: (2023)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
di: Zhou, Yang, et al.
Pubblicazione: (2026)
di: Zhou, Yang, et al.
Pubblicazione: (2026)
DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving
di: Ma, Enhui, et al.
Pubblicazione: (2026)
di: Ma, Enhui, et al.
Pubblicazione: (2026)
Panacea+: Panoramic and Controllable Video Generation for Autonomous Driving
di: Wen, Yuqing, et al.
Pubblicazione: (2024)
di: Wen, Yuqing, et al.
Pubblicazione: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
di: Lin, Sihao, et al.
Pubblicazione: (2025)
di: Lin, Sihao, et al.
Pubblicazione: (2025)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
di: Li, Yongkang, et al.
Pubblicazione: (2026)
di: Li, Yongkang, et al.
Pubblicazione: (2026)
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
di: Li, Yingyan, et al.
Pubblicazione: (2025)
di: Li, Yingyan, et al.
Pubblicazione: (2025)
Glad: A Streaming Scene Generator for Autonomous Driving
di: Xie, Bin, et al.
Pubblicazione: (2025)
di: Xie, Bin, et al.
Pubblicazione: (2025)
Knowledge-Intensive Video Generation
di: Wang, Chenxu, et al.
Pubblicazione: (2026)
di: Wang, Chenxu, et al.
Pubblicazione: (2026)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
di: Shang, Shuyao, et al.
Pubblicazione: (2026)
di: Shang, Shuyao, et al.
Pubblicazione: (2026)
Knowledge Distillation via the Target-aware Transformer
di: Lin, Sihao, et al.
Pubblicazione: (2022)
di: Lin, Sihao, et al.
Pubblicazione: (2022)
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
di: Zhou, Lijun, et al.
Pubblicazione: (2026)
di: Zhou, Lijun, et al.
Pubblicazione: (2026)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation
di: Wang, Ruoyu, et al.
Pubblicazione: (2026)
di: Wang, Ruoyu, et al.
Pubblicazione: (2026)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving
di: Chen, Zeming, et al.
Pubblicazione: (2025)
di: Chen, Zeming, et al.
Pubblicazione: (2025)
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
di: Zou, Jialv, et al.
Pubblicazione: (2024)
di: Zou, Jialv, et al.
Pubblicazione: (2024)
Text-Guided Molecule Generation with Diffusion Language Model
di: Gong, Haisong, et al.
Pubblicazione: (2024)
di: Gong, Haisong, et al.
Pubblicazione: (2024)
DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning
di: Yan, Limin, et al.
Pubblicazione: (2026)
di: Yan, Limin, et al.
Pubblicazione: (2026)
World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving
di: Guan, Yanchen, et al.
Pubblicazione: (2025)
di: Guan, Yanchen, et al.
Pubblicazione: (2025)
Video World Models with Long-term Spatial Memory
di: Wu, Tong, et al.
Pubblicazione: (2025)
di: Wu, Tong, et al.
Pubblicazione: (2025)
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
di: Hu, Xiaotao, et al.
Pubblicazione: (2024)
di: Hu, Xiaotao, et al.
Pubblicazione: (2024)
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
di: Zhu, Ziyue, et al.
Pubblicazione: (2025)
di: Zhu, Ziyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
di: Ma, Enhui, et al.
Pubblicazione: (2024) -
Arbitrary Generative Video Interpolation
di: Zhang, Guozhen, et al.
Pubblicazione: (2025) -
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
di: Tang, Tao, et al.
Pubblicazione: (2025) -
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
di: Chen, Rui, et al.
Pubblicazione: (2024) -
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
di: Li, Qiang, et al.
Pubblicazione: (2025)