CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arai, Hidehisa, Miwa, Keita, Sasaki, Kento, Yamaguchi, Yu, Watanabe, Kohei, Aoki, Shunsuke, Yamamoto, Issei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression
par: Miwa, Keita, et autres
Publié: (2025)
par: Miwa, Keita, et autres
Publié: (2025)
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
par: Arai, Hidehisa, et autres
Publié: (2024)
par: Arai, Hidehisa, et autres
Publié: (2024)
Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
par: Yokoi, Shingo, et autres
Publié: (2025)
par: Yokoi, Shingo, et autres
Publié: (2025)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
par: Ishihara, Keishi, et autres
Publié: (2025)
par: Ishihara, Keishi, et autres
Publié: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
par: Zhou, Xingcheng, et autres
Publié: (2025)
par: Zhou, Xingcheng, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving
par: Seong, Hyunki, et autres
Publié: (2025)
par: Seong, Hyunki, et autres
Publié: (2025)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
par: Luo, Yuechen, et autres
Publié: (2026)
par: Luo, Yuechen, et autres
Publié: (2026)
SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving
par: You, Zihan, et autres
Publié: (2026)
par: You, Zihan, et autres
Publié: (2026)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
par: Wang, Yiru, et autres
Publié: (2026)
par: Wang, Yiru, et autres
Publié: (2026)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
par: Inoue, Yuichi, et autres
Publié: (2024)
par: Inoue, Yuichi, et autres
Publié: (2024)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
par: Chi, Haohan, et autres
Publié: (2025)
par: Chi, Haohan, et autres
Publié: (2025)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
par: Li, Yongkang, et autres
Publié: (2026)
par: Li, Yongkang, et autres
Publié: (2026)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
par: Zhou, Zewei, et autres
Publié: (2025)
par: Zhou, Zewei, et autres
Publié: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)
par: Zhang, Wenyao, et autres
Publié: (2025)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
par: Shang, Shuyao, et autres
Publié: (2026)
par: Shang, Shuyao, et autres
Publié: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2024)
par: Wang, Shihao, et autres
Publié: (2024)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
par: Wang, Guoqing, et autres
Publié: (2026)
par: Wang, Guoqing, et autres
Publié: (2026)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
par: Yang, Lijin, et autres
Publié: (2026)
par: Yang, Lijin, et autres
Publié: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
par: Jiang, Sicong, et autres
Publié: (2025)
par: Jiang, Sicong, et autres
Publié: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
par: Wang, Zhaohui, et autres
Publié: (2025)
par: Wang, Zhaohui, et autres
Publié: (2025)
QuoVLA: Quotient Space for Vision-Language-Action Models
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)
par: Liu, Zeting, et autres
Publié: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
par: Du, Fan, et autres
Publié: (2026)
par: Du, Fan, et autres
Publié: (2026)
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
par: Gao, Yuan, et autres
Publié: (2026)
par: Gao, Yuan, et autres
Publié: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving
par: Huang, Minqing, et autres
Publié: (2026)
par: Huang, Minqing, et autres
Publié: (2026)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
par: Shi, Yiran, et autres
Publié: (2026)
par: Shi, Yiran, et autres
Publié: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
par: Zhao, Rui, et autres
Publié: (2026)
par: Zhao, Rui, et autres
Publié: (2026)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
par: Fu, Haoyu, et autres
Publié: (2025)
par: Fu, Haoyu, et autres
Publié: (2025)
Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Datasets for Lane Detection in Autonomous Driving: A Comprehensive Review
par: Gamerdinger, Jörg, et autres
Publié: (2025)
par: Gamerdinger, Jörg, et autres
Publié: (2025)
Documents similaires
-
One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression
par: Miwa, Keita, et autres
Publié: (2025) -
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
par: Arai, Hidehisa, et autres
Publié: (2024) -
Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
par: Yokoi, Shingo, et autres
Publié: (2025) -
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
par: Ishihara, Keishi, et autres
Publié: (2025) -
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
par: Zhou, Xingcheng, et autres
Publié: (2025)