LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiao, Siwen, Fang, Yangyi, Peng, Baoyun, Chen, Wangqun, Veeravalli, Bharadwaj |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
di: Li, Peizheng, et al.
Pubblicazione: (2025)
di: Li, Peizheng, et al.
Pubblicazione: (2025)
DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
di: Fu, Yongjie, et al.
Pubblicazione: (2024)
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
Fus-MAE: A cross-attention-based data fusion approach for Masked Autoencoders in remote sensing
di: Chan-To-Hing, Hugo, et al.
Pubblicazione: (2024)
di: Chan-To-Hing, Hugo, et al.
Pubblicazione: (2024)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
di: Huang, Zilin, et al.
Pubblicazione: (2026)
di: Huang, Zilin, et al.
Pubblicazione: (2026)
DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models
di: Zhou, Xirui, et al.
Pubblicazione: (2025)
di: Zhou, Xirui, et al.
Pubblicazione: (2025)
VERDI: VLM-Embedded Reasoning for Autonomous Driving
di: Feng, Bowen, et al.
Pubblicazione: (2025)
di: Feng, Bowen, et al.
Pubblicazione: (2025)
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
di: Chen, Lihong, et al.
Pubblicazione: (2025)
di: Chen, Lihong, et al.
Pubblicazione: (2025)
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
di: Zheng, Weicheng, et al.
Pubblicazione: (2025)
di: Zheng, Weicheng, et al.
Pubblicazione: (2025)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures
di: Fernandez, David, et al.
Pubblicazione: (2026)
di: Fernandez, David, et al.
Pubblicazione: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
Precise Drive with VLM: First Prize Solution for PRCV 2024 Drive LM challenge
di: Huang, Bin, et al.
Pubblicazione: (2024)
di: Huang, Bin, et al.
Pubblicazione: (2024)
ContextVLM: Zero-Shot and Few-Shot Context Understanding for Autonomous Driving using Vision Language Models
di: Sural, Shounak, et al.
Pubblicazione: (2024)
di: Sural, Shounak, et al.
Pubblicazione: (2024)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
di: Chen, Xuesong, et al.
Pubblicazione: (2025)
di: Chen, Xuesong, et al.
Pubblicazione: (2025)
Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM
di: Qin, Jack, et al.
Pubblicazione: (2025)
di: Qin, Jack, et al.
Pubblicazione: (2025)
VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
di: Huang, Zilin, et al.
Pubblicazione: (2024)
di: Huang, Zilin, et al.
Pubblicazione: (2024)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
DeepInteraction++: Multi-Modality Interaction for Autonomous Driving
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
di: Yang, Zeyu, et al.
Pubblicazione: (2024)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
VLP: Vision Language Planning for Autonomous Driving
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
VDT-Auto: End-to-end Autonomous Driving with VLM-Guided Diffusion Transformers
di: Guo, Ziang, et al.
Pubblicazione: (2025)
di: Guo, Ziang, et al.
Pubblicazione: (2025)
Learning with Unmasked Tokens Drives Stronger Vision Learners
di: Kim, Taekyung, et al.
Pubblicazione: (2023)
di: Kim, Taekyung, et al.
Pubblicazione: (2023)
MapVision: CVPR 2024 Autonomous Grand Challenge Mapless Driving Tech Report
di: Yang, Zhongyu, et al.
Pubblicazione: (2024)
di: Yang, Zhongyu, et al.
Pubblicazione: (2024)
VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness
di: Chen, Qimao, et al.
Pubblicazione: (2026)
di: Chen, Qimao, et al.
Pubblicazione: (2026)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
di: Yang, Lijin, et al.
Pubblicazione: (2026)
di: Yang, Lijin, et al.
Pubblicazione: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
di: Diao, Muxi, et al.
Pubblicazione: (2025)
di: Diao, Muxi, et al.
Pubblicazione: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2024)
di: Wang, Shihao, et al.
Pubblicazione: (2024)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving
di: Peng, Xiaoxu, et al.
Pubblicazione: (2026)
di: Peng, Xiaoxu, et al.
Pubblicazione: (2026)
Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?
di: Bai, Yifan, et al.
Pubblicazione: (2024)
di: Bai, Yifan, et al.
Pubblicazione: (2024)
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
di: Luo, Yuechen, et al.
Pubblicazione: (2025)
di: Luo, Yuechen, et al.
Pubblicazione: (2025)
Spatial-aware Vision Language Model for Autonomous Driving
di: Wei, Weijie, et al.
Pubblicazione: (2025)
di: Wei, Weijie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024) -
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
di: Li, Peizheng, et al.
Pubblicazione: (2025) -
DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving
di: Fu, Yongjie, et al.
Pubblicazione: (2024) -
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
di: Hassani, Hossein, et al.
Pubblicazione: (2025) -
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
di: Zhang, Enming, et al.
Pubblicazione: (2024)