Guardado en:
| Autores principales: | He, Jingtao, Lu, Hongliang, Qiu, Xiaoyun, Wang, Yixuan, Zheng, Xinhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.31041 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
por: Liao, Yifan, et al.
Publicado: (2025)
por: Liao, Yifan, et al.
Publicado: (2025)
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
por: Chen, Peng, et al.
Publicado: (2025)
por: Chen, Peng, et al.
Publicado: (2025)
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
por: Wang, Yujin, et al.
Publicado: (2025)
por: Wang, Yujin, et al.
Publicado: (2025)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
por: Mei, Xiaodong, et al.
Publicado: (2026)
por: Mei, Xiaodong, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
por: Wang, Guoqing, et al.
Publicado: (2026)
por: Wang, Guoqing, et al.
Publicado: (2026)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
por: Zuo, Sicheng, et al.
Publicado: (2026)
por: Zuo, Sicheng, et al.
Publicado: (2026)
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
por: Wang, Zehao, et al.
Publicado: (2026)
por: Wang, Zehao, et al.
Publicado: (2026)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
por: Li, Muyao, et al.
Publicado: (2025)
por: Li, Muyao, et al.
Publicado: (2025)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models
por: Hao, Yuhan, et al.
Publicado: (2025)
por: Hao, Yuhan, et al.
Publicado: (2025)
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
por: Zheng, Weicheng, et al.
Publicado: (2026)
por: Zheng, Weicheng, et al.
Publicado: (2026)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
por: Theodoridis, Nikos, et al.
Publicado: (2026)
por: Theodoridis, Nikos, et al.
Publicado: (2026)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
por: Ong, Kenneth J. K.
Publicado: (2026)
por: Ong, Kenneth J. K.
Publicado: (2026)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
por: Rawal, Ishaan, et al.
Publicado: (2026)
por: Rawal, Ishaan, et al.
Publicado: (2026)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
por: Wang, Daming, et al.
Publicado: (2025)
por: Wang, Daming, et al.
Publicado: (2025)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
por: Zheng, Peiru, et al.
Publicado: (2024)
por: Zheng, Peiru, et al.
Publicado: (2024)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
por: Gao, Mingjian, et al.
Publicado: (2026)
por: Gao, Mingjian, et al.
Publicado: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
por: Wang, Huanyu, et al.
Publicado: (2025)
por: Wang, Huanyu, et al.
Publicado: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
por: He, Chiyuan, et al.
Publicado: (2025)
por: He, Chiyuan, et al.
Publicado: (2025)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
por: Zheng, Wenzhao, et al.
Publicado: (2024)
por: Zheng, Wenzhao, et al.
Publicado: (2024)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
por: Fan, Qingyu, et al.
Publicado: (2026)
por: Fan, Qingyu, et al.
Publicado: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
por: Ming, Yifei, et al.
Publicado: (2024)
por: Ming, Yifei, et al.
Publicado: (2024)
Information-Theoretic Constraints for Continual Vision-Language-Action Alignment
por: Zhao, Libang, et al.
Publicado: (2026)
por: Zhao, Libang, et al.
Publicado: (2026)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2025)
por: Luo, Jiayun, et al.
Publicado: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
por: He, Jialuo, et al.
Publicado: (2026)
por: He, Jialuo, et al.
Publicado: (2026)
Multi-Level Bidirectional Biomimetic Learning for EEG-Based Visual Decoding
por: Liu, Jingtao, et al.
Publicado: (2026)
por: Liu, Jingtao, et al.
Publicado: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
por: Ma, Jie, et al.
Publicado: (2026)
por: Ma, Jie, et al.
Publicado: (2026)
VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
por: Xu, Changhua, et al.
Publicado: (2026)
por: Xu, Changhua, et al.
Publicado: (2026)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
por: Gao, Haoxiang, et al.
Publicado: (2025)
por: Gao, Haoxiang, et al.
Publicado: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
por: Xiong, Minhao, et al.
Publicado: (2025)
por: Xiong, Minhao, et al.
Publicado: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
por: Chen, Siyi, et al.
Publicado: (2026)
por: Chen, Siyi, et al.
Publicado: (2026)
Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
por: Shi, Jin, et al.
Publicado: (2026)
por: Shi, Jin, et al.
Publicado: (2026)
Ejemplares similares
-
Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving
por: Liao, Yifan, et al.
Publicado: (2025) -
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
por: Chen, Peng, et al.
Publicado: (2025) -
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
por: Wang, Yujin, et al.
Publicado: (2025) -
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
por: Mei, Xiaodong, et al.
Publicado: (2026) -
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)