Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Jingtao, Lu, Hongliang, Qiu, Xiaoyun, Wang, Yixuan, Zheng, Xinhu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
di: Chen, Peng, et al.
Pubblicazione: (2025)
di: Chen, Peng, et al.
Pubblicazione: (2025)
Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
di: Liao, Yifan, et al.
Pubblicazione: (2025)
di: Liao, Yifan, et al.
Pubblicazione: (2025)
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
di: Wang, Yujin, et al.
Pubblicazione: (2025)
di: Wang, Yujin, et al.
Pubblicazione: (2025)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
Learning Vision-Language-Action World Models for Autonomous Driving
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
di: Jiang, Sicong, et al.
Pubblicazione: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025)
di: Li, Muyao, et al.
Pubblicazione: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
di: Zuo, Sicheng, et al.
Pubblicazione: (2026)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
di: Zhao, Rui, et al.
Pubblicazione: (2026)
di: Zhao, Rui, et al.
Pubblicazione: (2026)
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
di: Zheng, Weicheng, et al.
Pubblicazione: (2026)
di: Zheng, Weicheng, et al.
Pubblicazione: (2026)
DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models
di: Hao, Yuhan, et al.
Pubblicazione: (2025)
di: Hao, Yuhan, et al.
Pubblicazione: (2025)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
di: Wang, Zehao, et al.
Pubblicazione: (2026)
di: Wang, Zehao, et al.
Pubblicazione: (2026)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
di: Yang, Zhenjie, et al.
Pubblicazione: (2025)
di: Yang, Zhenjie, et al.
Pubblicazione: (2025)
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
di: Rawal, Ishaan, et al.
Pubblicazione: (2026)
di: Rawal, Ishaan, et al.
Pubblicazione: (2026)
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
di: Tang, Yihong, et al.
Pubblicazione: (2025)
di: Tang, Yihong, et al.
Pubblicazione: (2025)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
di: Wang, Daming, et al.
Pubblicazione: (2025)
di: Wang, Daming, et al.
Pubblicazione: (2025)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
Information-Theoretic Constraints for Continual Vision-Language-Action Alignment
di: Zhao, Libang, et al.
Pubblicazione: (2026)
di: Zhao, Libang, et al.
Pubblicazione: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
di: Ma, Jie, et al.
Pubblicazione: (2026)
di: Ma, Jie, et al.
Pubblicazione: (2026)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
di: Fan, Qingyu, et al.
Pubblicazione: (2026)
di: Fan, Qingyu, et al.
Pubblicazione: (2026)
VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
di: Xu, Changhua, et al.
Pubblicazione: (2026)
di: Xu, Changhua, et al.
Pubblicazione: (2026)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
di: Jiang, Hao, et al.
Pubblicazione: (2025)
di: Jiang, Hao, et al.
Pubblicazione: (2025)
Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
di: Shi, Jin, et al.
Pubblicazione: (2026)
di: Shi, Jin, et al.
Pubblicazione: (2026)
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
di: He, Chiyuan, et al.
Pubblicazione: (2025)
di: He, Chiyuan, et al.
Pubblicazione: (2025)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
di: Ming, Yifei, et al.
Pubblicazione: (2024)
di: Ming, Yifei, et al.
Pubblicazione: (2024)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
di: Gao, Haoxiang, et al.
Pubblicazione: (2025)
di: Gao, Haoxiang, et al.
Pubblicazione: (2025)
Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving
di: Yang, Sheng, et al.
Pubblicazione: (2025)
di: Yang, Sheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
di: Chen, Peng, et al.
Pubblicazione: (2025) -
Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
di: Liao, Yifan, et al.
Pubblicazione: (2025) -
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
di: Wang, Yujin, et al.
Pubblicazione: (2025) -
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
di: Mei, Xiaodong, et al.
Pubblicazione: (2026) -
Learning Vision-Language-Action World Models for Autonomous Driving
di: Wang, Guoqing, et al.
Pubblicazione: (2026)