The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Tu, Sifan, Zhou, Xin, Liang, Dingkang, Jiang, Xingyu, Zhang, Yumeng, Li, Xiaofan, Bai, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniFuture: A 4D Driving World Model for Future Generation and Perception
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
A Unified Framework for 3D Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2024)
di: Xu, Wei, et al.
Pubblicazione: (2024)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
MINIMA: Modality Invariant Image Matching
di: Ren, Jiangwei, et al.
Pubblicazione: (2024)
di: Ren, Jiangwei, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning in Spectral Domain for Point Cloud Learning
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
di: Sun, Zhengyang, et al.
Pubblicazione: (2026)
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
di: Wu, Xianjin, et al.
Pubblicazione: (2026)
di: Wu, Xianjin, et al.
Pubblicazione: (2026)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2025)
di: Xu, Wei, et al.
Pubblicazione: (2025)
More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
di: Chen, Kaijin, et al.
Pubblicazione: (2026)
di: Chen, Kaijin, et al.
Pubblicazione: (2026)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
di: Guan, Yiran, et al.
Pubblicazione: (2026)
di: Guan, Yiran, et al.
Pubblicazione: (2026)
A Survey of World Models for Autonomous Driving
di: Feng, Tuo, et al.
Pubblicazione: (2025)
di: Feng, Tuo, et al.
Pubblicazione: (2025)
BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents
di: Zhang, Yumeng, et al.
Pubblicazione: (2024)
di: Zhang, Yumeng, et al.
Pubblicazione: (2024)
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
Video4Edit: Viewing Image Editing as a Degenerate Temporal Process
di: Li, Xiaofan, et al.
Pubblicazione: (2025)
di: Li, Xiaofan, et al.
Pubblicazione: (2025)
DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2025)
di: Shi, Chen, et al.
Pubblicazione: (2025)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
di: Zhou, Yang, et al.
Pubblicazione: (2026)
di: Zhou, Yang, et al.
Pubblicazione: (2026)
A Comprehensive Survey on World Models for Embodied AI
di: Li, Xinqing, et al.
Pubblicazione: (2025)
di: Li, Xinqing, et al.
Pubblicazione: (2025)
DriveFuture: Future-Aware Latent World Models for Autonomous Driving
di: Hong, Yufeng, et al.
Pubblicazione: (2026)
di: Hong, Yufeng, et al.
Pubblicazione: (2026)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
di: Kong, Dehong, et al.
Pubblicazione: (2025)
di: Kong, Dehong, et al.
Pubblicazione: (2025)
HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving
di: Li, Qiang, et al.
Pubblicazione: (2025)
di: Li, Qiang, et al.
Pubblicazione: (2025)
PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
Deep Event-based Object Detection in Autonomous Driving: A Survey
di: Zhou, Bingquan, et al.
Pubblicazione: (2024)
di: Zhou, Bingquan, et al.
Pubblicazione: (2024)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
di: Shi, Chen, et al.
Pubblicazione: (2026)
di: Shi, Chen, et al.
Pubblicazione: (2026)
Progressive Bird's Eye View Perception for Safety-Critical Autonomous Driving: A Comprehensive Survey
di: Gong, Yan, et al.
Pubblicazione: (2025)
di: Gong, Yan, et al.
Pubblicazione: (2025)
Anomaly Detection by Adapting a pre-trained Vision Language Model
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
3D Object Detection for Autonomous Driving: A Survey
di: Qian, Rui, et al.
Pubblicazione: (2021)
di: Qian, Rui, et al.
Pubblicazione: (2021)
DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
di: Hu, Xiaotao, et al.
Pubblicazione: (2024)
di: Hu, Xiaotao, et al.
Pubblicazione: (2024)
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving
di: Huang, Minqing, et al.
Pubblicazione: (2026)
di: Huang, Minqing, et al.
Pubblicazione: (2026)
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
di: Zhou, Lijun, et al.
Pubblicazione: (2026)
di: Zhou, Lijun, et al.
Pubblicazione: (2026)
Exploring the Interplay Between Video Generation and World Models in Autonomous Driving: A Survey
di: Fu, Ao, et al.
Pubblicazione: (2024)
di: Fu, Ao, et al.
Pubblicazione: (2024)
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
PointMamba: A Simple State Space Model for Point Cloud Analysis
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
Epona: Autoregressive Diffusion World Model for Autonomous Driving
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhang, Kaiwen, et al.
Pubblicazione: (2025)
Semi-Supervised Vision-Centric 3D Occupancy World Model for Autonomous Driving
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
di: Min, Chen, et al.
Pubblicazione: (2024)
di: Min, Chen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UniFuture: A 4D Driving World Model for Future Generation and Perception
di: Liang, Dingkang, et al.
Pubblicazione: (2025) -
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2025) -
A Unified Framework for 3D Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2024) -
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025) -
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)