LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yuechen, Li, Fang, Xu, Shaoqing, Ji, Yang, Zhang, Zehan, Wang, Bing, Shen, Yuannan, Cui, Jianwei, Chen, Long, Chen, Guang, Ye, Hangjun, Yang, Zhi-Xin, Wen, Fuxi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
por: Liu, Zhuoyang, et al.
Publicado: (2026)
por: Liu, Zhuoyang, et al.
Publicado: (2026)
Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures
por: Luo, Yuechen, et al.
Publicado: (2026)
por: Luo, Yuechen, et al.
Publicado: (2026)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
por: Luo, Yuechen, et al.
Publicado: (2025)
por: Luo, Yuechen, et al.
Publicado: (2025)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)
por: Wang, Yiru, et al.
Publicado: (2026)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
por: Mei, Xiaodong, et al.
Publicado: (2026)
por: Mei, Xiaodong, et al.
Publicado: (2026)
UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
por: Li, Yongkang, et al.
Publicado: (2026)
por: Li, Yongkang, et al.
Publicado: (2026)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
por: Guo, Xiangyu, et al.
Publicado: (2025)
por: Guo, Xiangyu, et al.
Publicado: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
por: Zuo, Sicheng, et al.
Publicado: (2026)
por: Zuo, Sicheng, et al.
Publicado: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
por: Chen, Hao, et al.
Publicado: (2026)
por: Chen, Hao, et al.
Publicado: (2026)
ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation
por: Ma, Chuanhao, et al.
Publicado: (2026)
por: Ma, Chuanhao, et al.
Publicado: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
por: Sha, Lin, et al.
Publicado: (2026)
por: Sha, Lin, et al.
Publicado: (2026)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
por: Zeng, Shuang, et al.
Publicado: (2025)
por: Zeng, Shuang, et al.
Publicado: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
por: Zhang, Dapeng, et al.
Publicado: (2025)
por: Zhang, Dapeng, et al.
Publicado: (2025)
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
por: Gao, Yuan, et al.
Publicado: (2026)
por: Gao, Yuan, et al.
Publicado: (2026)
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving
por: Huang, Minqing, et al.
Publicado: (2026)
por: Huang, Minqing, et al.
Publicado: (2026)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
por: Wang, Jie, et al.
Publicado: (2026)
por: Wang, Jie, et al.
Publicado: (2026)
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving
por: Peng, Qihang, et al.
Publicado: (2025)
por: Peng, Qihang, et al.
Publicado: (2025)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
por: Mo, Xiaoxing, et al.
Publicado: (2025)
por: Mo, Xiaoxing, et al.
Publicado: (2025)
DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving
por: Dang, Chenxu, et al.
Publicado: (2026)
por: Dang, Chenxu, et al.
Publicado: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
por: Ye, Jinhui, et al.
Publicado: (2026)
por: Ye, Jinhui, et al.
Publicado: (2026)
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
por: Shang, Shuyao, et al.
Publicado: (2026)
por: Shang, Shuyao, et al.
Publicado: (2026)
DriveFuture: Future-Aware Latent World Models for Autonomous Driving
por: Hong, Yufeng, et al.
Publicado: (2026)
por: Hong, Yufeng, et al.
Publicado: (2026)
DriveVA: Video Action Models are Zero-Shot Drivers
por: Liu, Mengmeng, et al.
Publicado: (2026)
por: Liu, Mengmeng, et al.
Publicado: (2026)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
por: Li, Ye, et al.
Publicado: (2026)
por: Li, Ye, et al.
Publicado: (2026)
Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving
por: Zheng, Yinan, et al.
Publicado: (2026)
por: Zheng, Yinan, et al.
Publicado: (2026)
Learning from Mistakes: Post-Training for Driving VLA with Takeover Data
por: Gao, Yinfeng, et al.
Publicado: (2026)
por: Gao, Yinfeng, et al.
Publicado: (2026)
PointForward: Feedforward Driving Reconstruction through Point-Aligned Representations
por: Chi, Cheng, et al.
Publicado: (2026)
por: Chi, Cheng, et al.
Publicado: (2026)
VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness
por: Chen, Qimao, et al.
Publicado: (2026)
por: Chen, Qimao, et al.
Publicado: (2026)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
por: Wang, Linbo, et al.
Publicado: (2026)
por: Wang, Linbo, et al.
Publicado: (2026)
WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving
por: Zhu, Ziyue, et al.
Publicado: (2025)
por: Zhu, Ziyue, et al.
Publicado: (2025)
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
por: Xia, Tianze, et al.
Publicado: (2025)
por: Xia, Tianze, et al.
Publicado: (2025)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
por: Jiang, Feng, et al.
Publicado: (2025)
por: Jiang, Feng, et al.
Publicado: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
por: Sun, Jingwen, et al.
Publicado: (2026)
por: Sun, Jingwen, et al.
Publicado: (2026)
VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving
por: Seong, Hyunki, et al.
Publicado: (2025)
por: Seong, Hyunki, et al.
Publicado: (2025)
Ejemplares similares
-
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
por: Liu, Zhuoyang, et al.
Publicado: (2026) -
Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures
por: Luo, Yuechen, et al.
Publicado: (2026) -
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026) -
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
por: Luo, Yuechen, et al.
Publicado: (2025) -
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)