Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Tianshuai, Liu, Xiaolu, Wang, Song, Zhu, Yiyao, Liang, Ao, Kong, Lingdong, Zhao, Guoyang, Gong, Zeying, Cen, Jun, Huang, Zhiyu, Hao, Xiaoshuai, Li, Linfeng, Song, Hang, Li, Xiangtai, Ma, Jun, Shen, Shaojie, Zhu, Jianke, Tao, Dacheng, Liu, Ziwei, Liang, Junwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration
di: Gong, Zeying, et al.
Pubblicazione: (2025)
di: Gong, Zeying, et al.
Pubblicazione: (2025)
FLUX: Accelerating Cross-Embodiment Generative Navigation Policies via Rectified Flow and Static-to-Dynamic Learning
di: Gong, Zeying, et al.
Pubblicazione: (2026)
di: Gong, Zeying, et al.
Pubblicazione: (2026)
From Cognition to Precognition: A Future-Aware Framework for Social Navigation
di: Gong, Zeying, et al.
Pubblicazione: (2024)
di: Gong, Zeying, et al.
Pubblicazione: (2024)
3EED: Ground Everything Everywhere in 3D
di: Li, Rong, et al.
Pubblicazione: (2025)
di: Li, Rong, et al.
Pubblicazione: (2025)
NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation
di: Hu, Tianshuai, et al.
Pubblicazione: (2026)
di: Hu, Tianshuai, et al.
Pubblicazione: (2026)
Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
Uncertainty-Instructed Structure Injection for Generalizable HD Map Construction
di: Liu, Xiaolu, et al.
Pubblicazione: (2025)
di: Liu, Xiaolu, et al.
Pubblicazione: (2025)
DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
MGMap: Mask-Guided Learning for Online Vectorized HD Map Construction
di: Liu, Xiaolu, et al.
Pubblicazione: (2024)
di: Liu, Xiaolu, et al.
Pubblicazione: (2024)
U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
di: Xu, Xiang, et al.
Pubblicazione: (2025)
di: Xu, Xiang, et al.
Pubblicazione: (2025)
Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation
di: Wang, Song, et al.
Pubblicazione: (2024)
di: Wang, Song, et al.
Pubblicazione: (2024)
MambaMap: Online Vectorized HD Map Construction using State Space Model
di: Yang, Ruizi, et al.
Pubblicazione: (2025)
di: Yang, Ruizi, et al.
Pubblicazione: (2025)
PatchMixer: A Patch-Mixing Architecture for Long-Term Time Series Forecasting
di: Gong, Zeying, et al.
Pubblicazione: (2023)
di: Gong, Zeying, et al.
Pubblicazione: (2023)
Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis
di: Xu, Xiang, et al.
Pubblicazione: (2026)
di: Xu, Xiang, et al.
Pubblicazione: (2026)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
DragTraffic: Interactive and Controllable Traffic Scene Generation for Autonomous Driving
di: Wang, Sheng, et al.
Pubblicazione: (2024)
di: Wang, Sheng, et al.
Pubblicazione: (2024)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
di: Liu, Xiaolu, et al.
Pubblicazione: (2026)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
di: Li, Rong, et al.
Pubblicazione: (2024)
di: Li, Rong, et al.
Pubblicazione: (2024)
Zero-Shot 3D Visual Grounding from Vision-Language Models
di: Li, Rong, et al.
Pubblicazione: (2025)
di: Li, Rong, et al.
Pubblicazione: (2025)
4D Panoptic Scene Graph Generation
di: Yang, Jingkang, et al.
Pubblicazione: (2024)
di: Yang, Jingkang, et al.
Pubblicazione: (2024)
Learning to Generate 4D LiDAR Sequences
di: Liang, Ao, et al.
Pubblicazione: (2025)
di: Liang, Ao, et al.
Pubblicazione: (2025)
LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences
di: Liang, Ao, et al.
Pubblicazione: (2025)
di: Liang, Ao, et al.
Pubblicazione: (2025)
3D and 4D World Modeling: A Survey
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
Intrinsic Second-Order magnon Thermal Hall Effect
di: Li, Jun-Cen, et al.
Pubblicazione: (2024)
di: Li, Jun-Cen, et al.
Pubblicazione: (2024)
Visual Grounding from Event Cameras
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
LiMoE: Mixture of LiDAR Representation Learners from Automotive Scenes
di: Xu, Xiang, et al.
Pubblicazione: (2025)
di: Xu, Xiang, et al.
Pubblicazione: (2025)
PostRainBench: A comprehensive benchmark and a new model for precipitation forecasting
di: Tang, Yujin, et al.
Pubblicazione: (2023)
di: Tang, Yujin, et al.
Pubblicazione: (2023)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
di: Yu, Hanxun, et al.
Pubblicazione: (2025)
di: Yu, Hanxun, et al.
Pubblicazione: (2025)
DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes
di: Bian, Hengwei, et al.
Pubblicazione: (2024)
di: Bian, Hengwei, et al.
Pubblicazione: (2024)
Past Meets Present: Creating Historical Analogy with Large Language Models
di: Li, Nianqi, et al.
Pubblicazione: (2024)
di: Li, Nianqi, et al.
Pubblicazione: (2024)
Is Your Driving World Model an All-Around Player?
di: Kong, Lingdong, et al.
Pubblicazione: (2026)
di: Kong, Lingdong, et al.
Pubblicazione: (2026)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
di: Shi, Zhan, et al.
Pubblicazione: (2025)
di: Shi, Zhan, et al.
Pubblicazione: (2025)
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
di: Gan, Qijun, et al.
Pubblicazione: (2024)
di: Gan, Qijun, et al.
Pubblicazione: (2024)
Xenotransplantation in China: Past, Present, and Future
di: Kai Xing, et al.
Pubblicazione: (2025)
di: Kai Xing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration
di: Gong, Zeying, et al.
Pubblicazione: (2025) -
FLUX: Accelerating Cross-Embodiment Generative Navigation Policies via Rectified Flow and Static-to-Dynamic Learning
di: Gong, Zeying, et al.
Pubblicazione: (2026) -
From Cognition to Precognition: A Future-Aware Framework for Social Navigation
di: Gong, Zeying, et al.
Pubblicazione: (2024) -
3EED: Ground Everything Everywhere in 3D
di: Li, Rong, et al.
Pubblicazione: (2025) -
NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation
di: Hu, Tianshuai, et al.
Pubblicazione: (2026)