Vega: Learning to Drive with Natural Language Instructions
Fuente:
arXiv
Guardado en:
| Autores principales: | Zuo, Sicheng, Li, Yuxuan, Zheng, Wenzhao, Zhu, Zheng, Zhou, Jie, Lu, Jiwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GPD-1: Generative Pre-training for Driving
por: Xie, Zixun, et al.
Publicado: (2024)
por: Xie, Zixun, et al.
Publicado: (2024)
DVGT: Driving Visual Geometry Transformer
por: Zuo, Sicheng, et al.
Publicado: (2025)
por: Zuo, Sicheng, et al.
Publicado: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
por: Zuo, Sicheng, et al.
Publicado: (2026)
por: Zuo, Sicheng, et al.
Publicado: (2026)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
por: Zheng, Wenzhao, et al.
Publicado: (2024)
por: Zheng, Wenzhao, et al.
Publicado: (2024)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
por: Zuo, Sicheng, et al.
Publicado: (2024)
por: Zuo, Sicheng, et al.
Publicado: (2024)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
por: Wu, Yuqi, et al.
Publicado: (2024)
por: Wu, Yuqi, et al.
Publicado: (2024)
GaussianAD: Gaussian-Centric End-to-End Autonomous Driving
por: Zheng, Wenzhao, et al.
Publicado: (2024)
por: Zheng, Wenzhao, et al.
Publicado: (2024)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
por: Wu, Yuqi, et al.
Publicado: (2025)
por: Wu, Yuqi, et al.
Publicado: (2025)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
por: Huang, Yuanhui, et al.
Publicado: (2024)
por: Huang, Yuanhui, et al.
Publicado: (2024)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
por: Zhuo, Dong, et al.
Publicado: (2026)
por: Zhuo, Dong, et al.
Publicado: (2026)
$\bf{D^3}$QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
por: Zhang, Yanran, et al.
Publicado: (2025)
por: Zhang, Yanran, et al.
Publicado: (2025)
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
por: Wang, Lening, et al.
Publicado: (2024)
por: Wang, Lening, et al.
Publicado: (2024)
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
por: Shao, Hao, et al.
Publicado: (2026)
por: Shao, Hao, et al.
Publicado: (2026)
Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving
por: Fei, Xin, et al.
Publicado: (2024)
por: Fei, Xin, et al.
Publicado: (2024)
Hardness-Aware Scene Synthesis for Semi-Supervised 3D Object Detection
por: Zeng, Shuai, et al.
Publicado: (2024)
por: Zeng, Shuai, et al.
Publicado: (2024)
Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models
por: Martinez-Sanchez, Angel, et al.
Publicado: (2026)
por: Martinez-Sanchez, Angel, et al.
Publicado: (2026)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
por: Zhang, Jiwen, et al.
Publicado: (2026)
por: Zhang, Jiwen, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
SpectralAR: Spectral Autoregressive Visual Generation
por: Huang, Yuanhui, et al.
Publicado: (2025)
por: Huang, Yuanhui, et al.
Publicado: (2025)
Streaming 4D Visual Geometry Transformer
por: Zhuo, Dong, et al.
Publicado: (2025)
por: Zhuo, Dong, et al.
Publicado: (2025)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving
por: Huang, Zilin, et al.
Publicado: (2026)
por: Huang, Zilin, et al.
Publicado: (2026)
Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving
por: Yang, Sheng, et al.
Publicado: (2025)
por: Yang, Sheng, et al.
Publicado: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
por: Yin, Hang, et al.
Publicado: (2025)
por: Yin, Hang, et al.
Publicado: (2025)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
por: Dong, Jiajun, et al.
Publicado: (2025)
por: Dong, Jiajun, et al.
Publicado: (2025)
Instruction-Guided Visual Masking
por: Zheng, Jinliang, et al.
Publicado: (2024)
por: Zheng, Jinliang, et al.
Publicado: (2024)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
por: Song, Jingyu, et al.
Publicado: (2025)
por: Song, Jingyu, et al.
Publicado: (2025)
Grounding 3D Object Affordance with Language Instructions, Visual Observations and Interactions
por: Zhu, He, et al.
Publicado: (2025)
por: Zhu, He, et al.
Publicado: (2025)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving
por: Lu, Han, et al.
Publicado: (2024)
por: Lu, Han, et al.
Publicado: (2024)
WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
por: Xu, Mingwang, et al.
Publicado: (2025)
por: Xu, Mingwang, et al.
Publicado: (2025)
SQS: Enhancing Sparse Perception Models via Query-based Splatting in Autonomous Driving
por: Zhang, Haiming, et al.
Publicado: (2025)
por: Zhang, Haiming, et al.
Publicado: (2025)
LangCoop: Collaborative Driving with Language
por: Gao, Xiangbo, et al.
Publicado: (2025)
por: Gao, Xiangbo, et al.
Publicado: (2025)
Terra: Explorable Native 3D World Model with Point Latents
por: Huang, Yuanhui, et al.
Publicado: (2025)
por: Huang, Yuanhui, et al.
Publicado: (2025)
Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
por: Yang, Zhenjie, et al.
Publicado: (2025)
por: Yang, Zhenjie, et al.
Publicado: (2025)
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
Astra: General Interactive World Model with Autoregressive Denoising
por: Zhu, Yixuan, et al.
Publicado: (2025)
por: Zhu, Yixuan, et al.
Publicado: (2025)
VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving
por: Huang, Zilin, et al.
Publicado: (2024)
por: Huang, Zilin, et al.
Publicado: (2024)
Ejemplares similares
-
GPD-1: Generative Pre-training for Driving
por: Xie, Zixun, et al.
Publicado: (2024) -
DVGT: Driving Visual Geometry Transformer
por: Zuo, Sicheng, et al.
Publicado: (2025) -
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
por: Zuo, Sicheng, et al.
Publicado: (2026) -
Doe-1: Closed-Loop Autonomous Driving with Large World Model
por: Zheng, Wenzhao, et al.
Publicado: (2024) -
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
por: Zuo, Sicheng, et al.
Publicado: (2024)