From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Ang, Sining, Yang, Yuguang, Dang, Chenxu, Chen, Canyu, Chi, Cheng, Liu, Haiyan, Mao, Xuanyao, Bao, Jason, Xuliang, Sun, Bingchuan, Wang, Yan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
por: Ang, Sining, et al.
Publicado: (2026)
por: Ang, Sining, et al.
Publicado: (2026)
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
por: Chen, Canyu, et al.
Publicado: (2026)
por: Chen, Canyu, et al.
Publicado: (2026)
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
por: You, Zihan, et al.
Publicado: (2026)
por: You, Zihan, et al.
Publicado: (2026)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024)
por: Xu, Yi, et al.
Publicado: (2024)
SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
por: Dang, Chenxu, et al.
Publicado: (2025)
por: Dang, Chenxu, et al.
Publicado: (2025)
Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
por: Qin, Jack, et al.
Publicado: (2025)
por: Qin, Jack, et al.
Publicado: (2025)
SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving
por: Zheng, Peiru, et al.
Publicado: (2025)
por: Zheng, Peiru, et al.
Publicado: (2025)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
por: Song, Ruiqi, et al.
Publicado: (2025)
por: Song, Ruiqi, et al.
Publicado: (2025)
Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning
por: Song, Yuehao, et al.
Publicado: (2026)
por: Song, Yuehao, et al.
Publicado: (2026)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
por: Fan, Zehua, et al.
Publicado: (2026)
por: Fan, Zehua, et al.
Publicado: (2026)
V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models
por: You, Junwei, et al.
Publicado: (2024)
por: You, Junwei, et al.
Publicado: (2024)
DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving
por: Dang, Chenxu, et al.
Publicado: (2026)
por: Dang, Chenxu, et al.
Publicado: (2026)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
por: Zhao, Zhonghan, et al.
Publicado: (2025)
por: Zhao, Zhonghan, et al.
Publicado: (2025)
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
por: Sun, Wenchao, et al.
Publicado: (2024)
por: Sun, Wenchao, et al.
Publicado: (2024)
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion
por: Liu, Pei, et al.
Publicado: (2025)
por: Liu, Pei, et al.
Publicado: (2025)
GEMINUS: Dual-aware Global and Scene-Adaptive Mixture-of-Experts for End-to-End Autonomous Driving
por: Wan, Chi, et al.
Publicado: (2025)
por: Wan, Chi, et al.
Publicado: (2025)
AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models
por: Han, Yuxuan, et al.
Publicado: (2026)
por: Han, Yuxuan, et al.
Publicado: (2026)
FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder
por: Dong, Zeyu, et al.
Publicado: (2026)
por: Dong, Zeyu, et al.
Publicado: (2026)
DualAD: Disentangling the Dynamic and Static World for End-to-End Driving
por: Doll, Simon, et al.
Publicado: (2024)
por: Doll, Simon, et al.
Publicado: (2024)
Exploring Contextual Representation and Multi-Modality for End-to-End Autonomous Driving
por: Azam, Shoaib, et al.
Publicado: (2022)
por: Azam, Shoaib, et al.
Publicado: (2022)
Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving
por: Li, Peidong, et al.
Publicado: (2024)
por: Li, Peidong, et al.
Publicado: (2024)
AR Forcing: Towards Long-Horizon Robot Navigation World Model
por: Yang, Yifei, et al.
Publicado: (2026)
por: Yang, Yifei, et al.
Publicado: (2026)
VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
por: Chang, Fuhao, et al.
Publicado: (2025)
por: Chang, Fuhao, et al.
Publicado: (2025)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
por: Chen, Xuesong, et al.
Publicado: (2025)
por: Chen, Xuesong, et al.
Publicado: (2025)
VDT-Auto: End-to-end Autonomous Driving with VLM-Guided Diffusion Transformers
por: Guo, Ziang, et al.
Publicado: (2025)
por: Guo, Ziang, et al.
Publicado: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
por: Jiang, Bo, et al.
Publicado: (2024)
por: Jiang, Bo, et al.
Publicado: (2024)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
por: Song, Nan, et al.
Publicado: (2025)
por: Song, Nan, et al.
Publicado: (2025)
GMF-Drive: Gated Mamba Fusion with Spatial-Aware BEV Representation for End-to-End Autonomous Driving
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
por: Min, Anna, et al.
Publicado: (2025)
por: Min, Anna, et al.
Publicado: (2025)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
por: Huang, Wenhui, et al.
Publicado: (2026)
por: Huang, Wenhui, et al.
Publicado: (2026)
NudgeVAD: Language-Nudged End-to-End Driving via FiLM Residuals
por: Yang, Chieh-Chi, et al.
Publicado: (2026)
por: Yang, Chieh-Chi, et al.
Publicado: (2026)
PIE: Perception and Interaction Enhanced End-to-End Motion Planning for Autonomous Driving
por: Yuan, Chengran, et al.
Publicado: (2025)
por: Yuan, Chengran, et al.
Publicado: (2025)
Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
por: Koran, Alex, et al.
Publicado: (2026)
por: Koran, Alex, et al.
Publicado: (2026)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
por: Zhang, Songyan, et al.
Publicado: (2024)
por: Zhang, Songyan, et al.
Publicado: (2024)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
por: Jiang, Hao, et al.
Publicado: (2025)
por: Jiang, Hao, et al.
Publicado: (2025)
P-Hologen: An End-to-End Generative Framework for Phase-Only Holograms
por: Park, JooHyun, et al.
Publicado: (2024)
por: Park, JooHyun, et al.
Publicado: (2024)
P‐Hologen: An End‐to‐End Generative Framework for Phase‐Only Holograms
por: JooHyun Park, et al.
Publicado: (2024)
por: JooHyun Park, et al.
Publicado: (2024)
DriveSafer: End-to-End Autonomous Driving with Safety Guidance
por: Sural, Shounak, et al.
Publicado: (2026)
por: Sural, Shounak, et al.
Publicado: (2026)
Ejemplares similares
-
CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
por: Ang, Sining, et al.
Publicado: (2026) -
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
por: Chen, Canyu, et al.
Publicado: (2026) -
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
por: You, Zihan, et al.
Publicado: (2026) -
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024) -
SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic Queries
por: Dang, Chenxu, et al.
Publicado: (2025)