VLP: Vision Language Planning for Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Chenbin, Yaman, Burhaneddin, Nesti, Tommaso, Mallik, Abhirup, Allievi, Alessandro G, Velipasalar, Senem, Ren, Liu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP-BEVFormer: Enhancing Multi-View Image-Based BEV Detector with Ground Truth Flow
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
ALN-P3: Unified Language Alignment for Perception, Prediction, and Planning in Autonomous Driving
di: Ma, Yunsheng, et al.
Pubblicazione: (2025)
di: Ma, Yunsheng, et al.
Pubblicazione: (2025)
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
di: Ye, Xin, et al.
Pubblicazione: (2025)
di: Ye, Xin, et al.
Pubblicazione: (2025)
DG-MVP: 3D Domain Generalization via Multiple Views of Point Clouds for Classification
di: Ren, Huantao, et al.
Pubblicazione: (2025)
di: Ren, Huantao, et al.
Pubblicazione: (2025)
3D-PointZshotS: Geometry-Aware 3D Point Cloud Zero-Shot Semantic Segmentation Narrowing the Visual-Semantic Gap
di: Yang, Minmin, et al.
Pubblicazione: (2025)
di: Yang, Minmin, et al.
Pubblicazione: (2025)
GaitPoint+: A Gait Recognition Network Incorporating Point Cloud Analysis and Recycling
di: Ren, Huantao, et al.
Pubblicazione: (2024)
di: Ren, Huantao, et al.
Pubblicazione: (2024)
MTA: Multimodal Task Alignment for BEV Perception and Captioning
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
PRISM: Product Retrieval In Shopping Carts using Hybrid Matching
di: Kabadayi, Arda, et al.
Pubblicazione: (2025)
di: Kabadayi, Arda, et al.
Pubblicazione: (2025)
Trans${^2}$-CBCT: A Dual-Transformer Framework for Sparse-View CBCT Reconstruction
di: Yang, Minmin, et al.
Pubblicazione: (2025)
di: Yang, Minmin, et al.
Pubblicazione: (2025)
AdaWM: Adaptive World Model based Planning for Autonomous Driving
di: Wang, Hang, et al.
Pubblicazione: (2025)
di: Wang, Hang, et al.
Pubblicazione: (2025)
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
di: Xiong, Zhexiao, et al.
Pubblicazione: (2026)
di: Xiong, Zhexiao, et al.
Pubblicazione: (2026)
PaPr: Training-Free One-Step Patch Pruning with Lightweight ConvNets for Faster Inference
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
Only My Model On My Data: A Privacy Preserving Approach Protecting one Model and Deceiving Unauthorized Black-Box Models
di: Chai, Weiheng, et al.
Pubblicazione: (2024)
di: Chai, Weiheng, et al.
Pubblicazione: (2024)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
di: Pan, Chenbin, et al.
Pubblicazione: (2025)
Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting
di: Lu, Yiren, et al.
Pubblicazione: (2026)
di: Lu, Yiren, et al.
Pubblicazione: (2026)
Vision-Language Models can Identify Distracted Driver Behavior from Naturalistic Videos
di: Hasan, Md Zahid, et al.
Pubblicazione: (2023)
di: Hasan, Md Zahid, et al.
Pubblicazione: (2023)
LORD: Large Models based Opposite Reward Design for Autonomous Driving
di: Ye, Xin, et al.
Pubblicazione: (2024)
di: Ye, Xin, et al.
Pubblicazione: (2024)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
On the Real-World Adversarial Robustness of Real-Time Semantic Segmentation Models for Autonomous Driving
di: Rossolini, Giulio, et al.
Pubblicazione: (2022)
di: Rossolini, Giulio, et al.
Pubblicazione: (2022)
Calibrated and Resource-Aware Super-Resolution for Reliable Driver Behavior Analysis
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
di: Shihab, Ibne Farabi, et al.
Pubblicazione: (2025)
SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
di: Mahdizadeh, Ailar, et al.
Pubblicazione: (2025)
di: Mahdizadeh, Ailar, et al.
Pubblicazione: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
di: Hao, Xixuan, et al.
Pubblicazione: (2024)
di: Hao, Xixuan, et al.
Pubblicazione: (2024)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
di: Kong, Dehong, et al.
Pubblicazione: (2025)
di: Kong, Dehong, et al.
Pubblicazione: (2025)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
di: Yang, Lijin, et al.
Pubblicazione: (2026)
di: Yang, Lijin, et al.
Pubblicazione: (2026)
Spatial-aware Vision Language Model for Autonomous Driving
di: Wei, Weijie, et al.
Pubblicazione: (2025)
di: Wei, Weijie, et al.
Pubblicazione: (2025)
CARLA-GeAR: a Dataset Generator for a Systematic Evaluation of Adversarial Robustness of Vision Models
di: Nesti, Federico, et al.
Pubblicazione: (2022)
di: Nesti, Federico, et al.
Pubblicazione: (2022)
Fully Unified Motion Planning for End-to-End Autonomous Driving
di: Liu, Lin, et al.
Pubblicazione: (2025)
di: Liu, Lin, et al.
Pubblicazione: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
di: Yang, Yu, et al.
Pubblicazione: (2024)
di: Yang, Yu, et al.
Pubblicazione: (2024)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
di: Diao, Muxi, et al.
Pubblicazione: (2025)
di: Diao, Muxi, et al.
Pubblicazione: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2024)
di: Wang, Shihao, et al.
Pubblicazione: (2024)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
Language Prompt for Autonomous Driving
di: Wu, Dongming, et al.
Pubblicazione: (2023)
di: Wu, Dongming, et al.
Pubblicazione: (2023)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
di: Chen, Xuesong, et al.
Pubblicazione: (2025)
di: Chen, Xuesong, et al.
Pubblicazione: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CLIP-BEVFormer: Enhancing Multi-View Image-Based BEV Detector with Ground Truth Flow
di: Pan, Chenbin, et al.
Pubblicazione: (2024) -
ALN-P3: Unified Language Alignment for Perception, Prediction, and Planning in Autonomous Driving
di: Ma, Yunsheng, et al.
Pubblicazione: (2025) -
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
di: Ye, Xin, et al.
Pubblicazione: (2025) -
DG-MVP: 3D Domain Generalization via Multiple Views of Point Clouds for Classification
di: Ren, Huantao, et al.
Pubblicazione: (2025) -
3D-PointZshotS: Geometry-Aware 3D Point Cloud Zero-Shot Semantic Segmentation Narrowing the Visual-Semantic Gap
di: Yang, Minmin, et al.
Pubblicazione: (2025)