Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jiaru, Gagvani, Manav, Cui, Can, Peng, Juntong, Zhang, Ruqi, Wang, Ziran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
por: Song, Nan, et al.
Publicado: (2025)
por: Song, Nan, et al.
Publicado: (2025)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving
por: Hamid, Kaiser, et al.
Publicado: (2026)
por: Hamid, Kaiser, et al.
Publicado: (2026)
Multimodal Action Diffusion for Robust End-to-End Autonomous Driving
por: Rodríguez-Vidal, Jorge Daniel, et al.
Publicado: (2026)
por: Rodríguez-Vidal, Jorge Daniel, et al.
Publicado: (2026)
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving
por: Liao, Bencheng, et al.
Publicado: (2024)
por: Liao, Bencheng, et al.
Publicado: (2024)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
por: Jiang, Bo, et al.
Publicado: (2024)
por: Jiang, Bo, et al.
Publicado: (2024)
VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving
por: Seong, Hyunki, et al.
Publicado: (2025)
por: Seong, Hyunki, et al.
Publicado: (2025)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
por: Duan, Yiqun, et al.
Publicado: (2024)
por: Duan, Yiqun, et al.
Publicado: (2024)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
por: Zhang, Songyan, et al.
Publicado: (2024)
por: Zhang, Songyan, et al.
Publicado: (2024)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
por: Huang, Wenhui, et al.
Publicado: (2026)
por: Huang, Wenhui, et al.
Publicado: (2026)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
por: Chen, Xuesong, et al.
Publicado: (2025)
por: Chen, Xuesong, et al.
Publicado: (2025)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
por: Jiang, Hao, et al.
Publicado: (2025)
por: Jiang, Hao, et al.
Publicado: (2025)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
por: Zhou, Zewei, et al.
Publicado: (2025)
por: Zhou, Zewei, et al.
Publicado: (2025)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
DriveE2E: Closed-Loop Benchmark for End-to-End Autonomous Driving through Real-to-Simulation
por: Yu, Haibao, et al.
Publicado: (2025)
por: Yu, Haibao, et al.
Publicado: (2025)
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
por: Zou, Jialv, et al.
Publicado: (2025)
por: Zou, Jialv, et al.
Publicado: (2025)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
por: Ge, Xuri, et al.
Publicado: (2024)
por: Ge, Xuri, et al.
Publicado: (2024)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
por: Wang, Linbo, et al.
Publicado: (2026)
por: Wang, Linbo, et al.
Publicado: (2026)
End-to-End Autonomous Driving through V2X Cooperation
por: Yu, Haibao, et al.
Publicado: (2024)
por: Yu, Haibao, et al.
Publicado: (2024)
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
por: Sun, Wenchao, et al.
Publicado: (2024)
por: Sun, Wenchao, et al.
Publicado: (2024)
FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling
por: Hamid, Kaiser, et al.
Publicado: (2025)
por: Hamid, Kaiser, et al.
Publicado: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
SparseAD: Sparse Query-Centric Paradigm for Efficient End-to-End Autonomous Driving
por: Zhang, Diankun, et al.
Publicado: (2024)
por: Zhang, Diankun, et al.
Publicado: (2024)
ComDrive: Comfort-Oriented End-to-End Autonomous Driving
por: Wang, Junming, et al.
Publicado: (2024)
por: Wang, Junming, et al.
Publicado: (2024)
DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
por: Shang, Shuyao, et al.
Publicado: (2025)
por: Shang, Shuyao, et al.
Publicado: (2025)
Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving
por: Li, Peidong, et al.
Publicado: (2024)
por: Li, Peidong, et al.
Publicado: (2024)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024)
por: Xu, Yi, et al.
Publicado: (2024)
FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model
por: Lin, Hongbin, et al.
Publicado: (2025)
por: Lin, Hongbin, et al.
Publicado: (2025)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
por: Sun, Bin, et al.
Publicado: (2025)
por: Sun, Bin, et al.
Publicado: (2025)
World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model
por: Zheng, Yupeng, et al.
Publicado: (2025)
por: Zheng, Yupeng, et al.
Publicado: (2025)
GenAD: Generative End-to-End Autonomous Driving
por: Zheng, Wenzhao, et al.
Publicado: (2024)
por: Zheng, Wenzhao, et al.
Publicado: (2024)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
por: Song, Ruiqi, et al.
Publicado: (2025)
por: Song, Ruiqi, et al.
Publicado: (2025)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)
por: Wang, Yiru, et al.
Publicado: (2026)
DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving
por: Su, Haisheng, et al.
Publicado: (2026)
por: Su, Haisheng, et al.
Publicado: (2026)
Enhancing End-to-End Autonomous Driving with Latent World Model
por: Li, Yingyan, et al.
Publicado: (2024)
por: Li, Yingyan, et al.
Publicado: (2024)
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving
por: Zhang, Bozhou, et al.
Publicado: (2025)
por: Zhang, Bozhou, et al.
Publicado: (2025)
Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving
por: Li, Tengpeng, et al.
Publicado: (2025)
por: Li, Tengpeng, et al.
Publicado: (2025)
DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
por: Song, Ziying, et al.
Publicado: (2025)
por: Song, Ziying, et al.
Publicado: (2025)
Ejemplares similares
-
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
por: Cui, Can, et al.
Publicado: (2025) -
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
por: Song, Nan, et al.
Publicado: (2025) -
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
por: Fu, Haoyu, et al.
Publicado: (2025) -
ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving
por: Hamid, Kaiser, et al.
Publicado: (2026) -
Multimodal Action Diffusion for Robust End-to-End Autonomous Driving
por: Rodríguez-Vidal, Jorge Daniel, et al.
Publicado: (2026)