MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Haiguang, Liu, Daqi, Xie, Hongwei, Liu, Haisong, Ma, Enhui, Yu, Kaicheng, Wang, Limin, Wang, Bing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
por: Ma, Enhui, et al.
Publicado: (2024)
por: Ma, Enhui, et al.
Publicado: (2024)
Arbitrary Generative Video Interpolation
por: Zhang, Guozhen, et al.
Publicado: (2025)
por: Zhang, Guozhen, et al.
Publicado: (2025)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
por: Tang, Tao, et al.
Publicado: (2025)
por: Tang, Tao, et al.
Publicado: (2025)
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
por: Chen, Rui, et al.
Publicado: (2024)
por: Chen, Rui, et al.
Publicado: (2024)
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
por: Li, Qiang, et al.
Publicado: (2025)
por: Li, Qiang, et al.
Publicado: (2025)
Do LLM Modules Generalize? A Study on Motion Generation for Autonomous Driving
por: Wang, Mingyi, et al.
Publicado: (2025)
por: Wang, Mingyi, et al.
Publicado: (2025)
Fully Sparse 3D Occupancy Prediction
por: Liu, Haisong, et al.
Publicado: (2023)
por: Liu, Haisong, et al.
Publicado: (2023)
SurroundSDF: Implicit 3D Scene Understanding Based on Signed Distance Field
por: Liu, Lizhe, et al.
Publicado: (2024)
por: Liu, Lizhe, et al.
Publicado: (2024)
StageInteractor: Query-based Object Detector with Cross-stage Interaction
por: Teng, Yao, et al.
Publicado: (2023)
por: Teng, Yao, et al.
Publicado: (2023)
Self-Supervised Multi-Frame Neural Scene Flow
por: Liu, Dongrui, et al.
Publicado: (2024)
por: Liu, Dongrui, et al.
Publicado: (2024)
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
por: Xia, Tianze, et al.
Publicado: (2025)
por: Xia, Tianze, et al.
Publicado: (2025)
Learning Optical Flow and Scene Flow with Bidirectional Camera-LiDAR Fusion
por: Liu, Haisong, et al.
Publicado: (2023)
por: Liu, Haisong, et al.
Publicado: (2023)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving
por: Ma, Enhui, et al.
Publicado: (2026)
por: Ma, Enhui, et al.
Publicado: (2026)
Panacea+: Panoramic and Controllable Video Generation for Autonomous Driving
por: Wen, Yuqing, et al.
Publicado: (2024)
por: Wen, Yuqing, et al.
Publicado: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
por: Li, Zeqian, et al.
Publicado: (2023)
por: Li, Zeqian, et al.
Publicado: (2023)
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
por: Lin, Sihao, et al.
Publicado: (2025)
por: Lin, Sihao, et al.
Publicado: (2025)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
por: Li, Yongkang, et al.
Publicado: (2026)
por: Li, Yongkang, et al.
Publicado: (2026)
DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
por: Li, Yingyan, et al.
Publicado: (2025)
por: Li, Yingyan, et al.
Publicado: (2025)
Glad: A Streaming Scene Generator for Autonomous Driving
por: Xie, Bin, et al.
Publicado: (2025)
por: Xie, Bin, et al.
Publicado: (2025)
Knowledge-Intensive Video Generation
por: Wang, Chenxu, et al.
Publicado: (2026)
por: Wang, Chenxu, et al.
Publicado: (2026)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
por: Zhao, Zongchuang, et al.
Publicado: (2025)
por: Zhao, Zongchuang, et al.
Publicado: (2025)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
por: Shang, Shuyao, et al.
Publicado: (2026)
por: Shang, Shuyao, et al.
Publicado: (2026)
Knowledge Distillation via the Target-aware Transformer
por: Lin, Sihao, et al.
Publicado: (2022)
por: Lin, Sihao, et al.
Publicado: (2022)
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
por: Zhou, Lijun, et al.
Publicado: (2026)
por: Zhou, Lijun, et al.
Publicado: (2026)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
por: Zhang, Haiyu, et al.
Publicado: (2024)
por: Zhang, Haiyu, et al.
Publicado: (2024)
SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation
por: Wang, Ruoyu, et al.
Publicado: (2026)
por: Wang, Ruoyu, et al.
Publicado: (2026)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving
por: Chen, Zeming, et al.
Publicado: (2025)
por: Chen, Zeming, et al.
Publicado: (2025)
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
por: Liu, Xiaolu, et al.
Publicado: (2026)
por: Liu, Xiaolu, et al.
Publicado: (2026)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
por: Zou, Jialv, et al.
Publicado: (2024)
por: Zou, Jialv, et al.
Publicado: (2024)
Text-Guided Molecule Generation with Diffusion Language Model
por: Gong, Haisong, et al.
Publicado: (2024)
por: Gong, Haisong, et al.
Publicado: (2024)
DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning
por: Yan, Limin, et al.
Publicado: (2026)
por: Yan, Limin, et al.
Publicado: (2026)
World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving
por: Guan, Yanchen, et al.
Publicado: (2025)
por: Guan, Yanchen, et al.
Publicado: (2025)
Video World Models with Long-term Spatial Memory
por: Wu, Tong, et al.
Publicado: (2025)
por: Wu, Tong, et al.
Publicado: (2025)
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
por: Hu, Xiaotao, et al.
Publicado: (2024)
por: Hu, Xiaotao, et al.
Publicado: (2024)
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
por: Zhu, Ziyue, et al.
Publicado: (2025)
por: Zhu, Ziyue, et al.
Publicado: (2025)
Ejemplares similares
-
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
por: Ma, Enhui, et al.
Publicado: (2024) -
Arbitrary Generative Video Interpolation
por: Zhang, Guozhen, et al.
Publicado: (2025) -
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
por: Tang, Tao, et al.
Publicado: (2025) -
UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
por: Chen, Rui, et al.
Publicado: (2024) -
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
por: Li, Qiang, et al.
Publicado: (2025)