MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Enming, Dai, Xingyuan, Huang, Min, Lv, Yisheng, Miao, Qinghai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2025)
par: Zhang, Enming, et autres
Publié: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
par: Zhang, Enming, et autres
Publié: (2024)
par: Zhang, Enming, et autres
Publié: (2024)
LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
par: Jiao, Siwen, et autres
Publié: (2024)
par: Jiao, Siwen, et autres
Publié: (2024)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
par: Yang, Lijin, et autres
Publié: (2026)
par: Yang, Lijin, et autres
Publié: (2026)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
par: Zhang, Songyan, et autres
Publié: (2024)
par: Zhang, Songyan, et autres
Publié: (2024)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2024)
par: Wang, Shihao, et autres
Publié: (2024)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
par: Tian, Xiaoyu, et autres
Publié: (2024)
par: Tian, Xiaoyu, et autres
Publié: (2024)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
par: Ma, Yunsheng, et autres
Publié: (2024)
par: Ma, Yunsheng, et autres
Publié: (2024)
Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving
par: Yang, Sheng, et autres
Publié: (2025)
par: Yang, Sheng, et autres
Publié: (2025)
VLP: Vision Language Planning for Autonomous Driving
par: Pan, Chenbin, et autres
Publié: (2024)
par: Pan, Chenbin, et autres
Publié: (2024)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
par: Gopalkrishnan, Akshay, et autres
Publié: (2024)
par: Gopalkrishnan, Akshay, et autres
Publié: (2024)
Mini Autonomous Car Driving based on 3D Convolutional Neural Networks
par: Moraes, Pablo, et autres
Publié: (2025)
par: Moraes, Pablo, et autres
Publié: (2025)
HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving
par: Wu, Zehuan, et autres
Publié: (2024)
par: Wu, Zehuan, et autres
Publié: (2024)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
par: Chen, Xuyang, et autres
Publié: (2026)
par: Chen, Xuyang, et autres
Publié: (2026)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
Spatial-aware Vision Language Model for Autonomous Driving
par: Wei, Weijie, et autres
Publié: (2025)
par: Wei, Weijie, et autres
Publié: (2025)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
par: Cui, Erfei, et autres
Publié: (2023)
par: Cui, Erfei, et autres
Publié: (2023)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
par: Chen, Xuesong, et autres
Publié: (2025)
par: Chen, Xuesong, et autres
Publié: (2025)
Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?
par: Bai, Yifan, et autres
Publié: (2024)
par: Bai, Yifan, et autres
Publié: (2024)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
par: Yue, Tongtian, et autres
Publié: (2024)
par: Yue, Tongtian, et autres
Publié: (2024)
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
par: Hassani, Hossein, et autres
Publié: (2025)
par: Hassani, Hossein, et autres
Publié: (2025)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
par: Zhang, Zhenguo, et autres
Publié: (2025)
par: Zhang, Zhenguo, et autres
Publié: (2025)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
par: Zhang, Tianyuan, et autres
Publié: (2024)
par: Zhang, Tianyuan, et autres
Publié: (2024)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
par: Xiong, Minhao, et autres
Publié: (2025)
par: Xiong, Minhao, et autres
Publié: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
par: Zhou, Xingcheng, et autres
Publié: (2025)
par: Zhou, Xingcheng, et autres
Publié: (2025)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
par: Zhang, Yiwei, et autres
Publié: (2026)
par: Zhang, Yiwei, et autres
Publié: (2026)
DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
par: Min, Chen, et autres
Publié: (2024)
par: Min, Chen, et autres
Publié: (2024)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
par: Bhat, Mohammad Qazim, et autres
Publié: (2026)
par: Bhat, Mohammad Qazim, et autres
Publié: (2026)
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
par: Zhang, Jiaru, et autres
Publié: (2026)
par: Zhang, Jiaru, et autres
Publié: (2026)
DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving
par: HU, Haibo, et autres
Publié: (2025)
par: HU, Haibo, et autres
Publié: (2025)
RealDriveSim: A Realistic Multi-Modal Multi-Task Synthetic Dataset for Autonomous Driving
par: Jadon, Arpit, et autres
Publié: (2025)
par: Jadon, Arpit, et autres
Publié: (2025)
Language Prompt for Autonomous Driving
par: Wu, Dongming, et autres
Publié: (2023)
par: Wu, Dongming, et autres
Publié: (2023)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
par: Min, Chen, et autres
Publié: (2023)
par: Min, Chen, et autres
Publié: (2023)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
Gating Syn-to-Real Knowledge for Pedestrian Crossing Prediction in Safe Driving
par: Bai, Jie, et autres
Publié: (2024)
par: Bai, Jie, et autres
Publié: (2024)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
par: Arai, Hidehisa, et autres
Publié: (2024)
par: Arai, Hidehisa, et autres
Publié: (2024)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
par: Wang, Jie, et autres
Publié: (2026)
par: Wang, Jie, et autres
Publié: (2026)
Documents similaires
-
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2025) -
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026) -
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
par: Zhang, Enming, et autres
Publié: (2024) -
LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
par: Jiao, Siwen, et autres
Publié: (2024) -
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
par: Yang, Lijin, et autres
Publié: (2026)