Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Lijin, Huang, Jianing, Huang, Zhongzhan, Liu, Shu, Yang, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
por: Liu, Shu, et al.
Publicado: (2025)
por: Liu, Shu, et al.
Publicado: (2025)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
por: Bhat, Mohammad Qazim, et al.
Publicado: (2026)
por: Bhat, Mohammad Qazim, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
por: Zheng, Weicheng, et al.
Publicado: (2026)
por: Zheng, Weicheng, et al.
Publicado: (2026)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
por: Chi, Haohan, et al.
Publicado: (2025)
por: Chi, Haohan, et al.
Publicado: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
por: Xiong, Minhao, et al.
Publicado: (2025)
por: Xiong, Minhao, et al.
Publicado: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
por: Tian, Xiaoyu, et al.
Publicado: (2024)
por: Tian, Xiaoyu, et al.
Publicado: (2024)
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
por: Yang, Yu, et al.
Publicado: (2024)
por: Yang, Yu, et al.
Publicado: (2024)
Unifying Language-Action Understanding and Generation for Autonomous Driving
por: Wang, Xinyang, et al.
Publicado: (2026)
por: Wang, Xinyang, et al.
Publicado: (2026)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
por: Diao, Muxi, et al.
Publicado: (2025)
por: Diao, Muxi, et al.
Publicado: (2025)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
por: Zhang, Songyan, et al.
Publicado: (2024)
por: Zhang, Songyan, et al.
Publicado: (2024)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
por: Luo, Yuechen, et al.
Publicado: (2026)
por: Luo, Yuechen, et al.
Publicado: (2026)
VLP: Vision Language Planning for Autonomous Driving
por: Pan, Chenbin, et al.
Publicado: (2024)
por: Pan, Chenbin, et al.
Publicado: (2024)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
por: Wang, Guoqing, et al.
Publicado: (2026)
por: Wang, Guoqing, et al.
Publicado: (2026)
An Overview about Emerging Technologies of Autonomous Driving
por: Huang, Yu, et al.
Publicado: (2023)
por: Huang, Yu, et al.
Publicado: (2023)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
por: Sun, Bin, et al.
Publicado: (2025)
por: Sun, Bin, et al.
Publicado: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
por: Qian, Kangan, et al.
Publicado: (2025)
por: Qian, Kangan, et al.
Publicado: (2025)
DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving
por: Su, Haisheng, et al.
Publicado: (2026)
por: Su, Haisheng, et al.
Publicado: (2026)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
por: Huang, Wenhui, et al.
Publicado: (2026)
por: Huang, Wenhui, et al.
Publicado: (2026)
nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving
por: Huang, Zhiyu, et al.
Publicado: (2026)
por: Huang, Zhiyu, et al.
Publicado: (2026)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
por: Chen, Xuesong, et al.
Publicado: (2025)
por: Chen, Xuesong, et al.
Publicado: (2025)
Object-Centric Stereo Ranging for Autonomous Driving: From Dense Disparity to Census-Based Template Matching
por: Huang, Qihao
Publicado: (2026)
por: Huang, Qihao
Publicado: (2026)
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
por: Zhang, Haiming, et al.
Publicado: (2024)
por: Zhang, Haiming, et al.
Publicado: (2024)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
por: Zhou, Zewei, et al.
Publicado: (2025)
por: Zhou, Zewei, et al.
Publicado: (2025)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
por: Zhang, Yiwei, et al.
Publicado: (2026)
por: Zhang, Yiwei, et al.
Publicado: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2025)
por: Wang, Shihao, et al.
Publicado: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2024)
por: Wang, Shihao, et al.
Publicado: (2024)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
por: Zhang, Enming, et al.
Publicado: (2024)
por: Zhang, Enming, et al.
Publicado: (2024)
Grid-Centric Traffic Scenario Perception for Autonomous Driving: A Comprehensive Review
por: Shi, Yining, et al.
Publicado: (2023)
por: Shi, Yining, et al.
Publicado: (2023)
Semi-Supervised Vision-Centric 3D Occupancy World Model for Autonomous Driving
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
por: Cui, Can, et al.
Publicado: (2025)
por: Cui, Can, et al.
Publicado: (2025)
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
por: You, Zihan, et al.
Publicado: (2026)
por: You, Zihan, et al.
Publicado: (2026)
Ejemplares similares
-
BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving
por: Liu, Shu, et al.
Publicado: (2025) -
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
por: Bhat, Mohammad Qazim, et al.
Publicado: (2026) -
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025) -
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
por: Zheng, Weicheng, et al.
Publicado: (2026) -
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)