Improving 3D Labeling in Self-Driving by Inferring Vehicle Information using Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Steven, Khaitan, Shivesh, Djuric, Nemanja |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
par: Chiu, Hsu-kuang, et autres
Publié: (2025)
par: Chiu, Hsu-kuang, et autres
Publié: (2025)
GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching
par: Dagda, Barkin, et autres
Publié: (2025)
par: Dagda, Barkin, et autres
Publié: (2025)
Strategic Fusion of Vision Language Models: Shapley-Credited Context-Aware Dawid-Skene for Multi-Label Tasks in Autonomous Driving
par: Feng, Yuxiang, et autres
Publié: (2025)
par: Feng, Yuxiang, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)
par: Xiao, Wenli, et autres
Publié: (2025)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
par: Fu, Haoyu, et autres
Publié: (2025)
par: Fu, Haoyu, et autres
Publié: (2025)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
par: Liu, Kangcheng, et autres
Publié: (2023)
par: Liu, Kangcheng, et autres
Publié: (2023)
ToosiCubix: Monocular 3D Cuboid Labeling via Vehicle Part Annotations
par: Nasihatkon, Behrooz, et autres
Publié: (2025)
par: Nasihatkon, Behrooz, et autres
Publié: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
par: Jiang, Bo, et autres
Publié: (2024)
par: Jiang, Bo, et autres
Publié: (2024)
C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving
par: Tian, Kefei, et autres
Publié: (2026)
par: Tian, Kefei, et autres
Publié: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
Inferring Driving Maps by Deep Learning-based Trail Map Extraction
par: Hubbertz, Michael, et autres
Publié: (2025)
par: Hubbertz, Michael, et autres
Publié: (2025)
Modeling 3D Pedestrian-Vehicle Interactions for Vehicle-Conditioned Pose Forecasting
par: Zhu, Guangxun, et autres
Publié: (2026)
par: Zhu, Guangxun, et autres
Publié: (2026)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
par: Chahe, Amirhosein, et autres
Publié: (2025)
par: Chahe, Amirhosein, et autres
Publié: (2025)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
par: Chen, Anthony, et autres
Publié: (2025)
par: Chen, Anthony, et autres
Publié: (2025)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
4D-CAAL: 4D Radar-Camera Calibration and Auto-Labeling for Autonomous Driving
par: Yao, Shanliang, et autres
Publié: (2026)
par: Yao, Shanliang, et autres
Publié: (2026)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
par: Renz, Katrin, et autres
Publié: (2025)
par: Renz, Katrin, et autres
Publié: (2025)
Zero-Shot 3D Visual Grounding from Vision-Language Models
par: Li, Rong, et autres
Publié: (2025)
par: Li, Rong, et autres
Publié: (2025)
Scalable Vision-Based 3D Object Detection and Monocular Depth Estimation for Autonomous Driving
par: Liu, Yuxuan
Publié: (2024)
par: Liu, Yuxuan
Publié: (2024)
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
par: Saxena, Pranav, et autres
Publié: (2025)
par: Saxena, Pranav, et autres
Publié: (2025)
AutoDrive-QA: A Multiple-Choice Benchmark for Vision-Language Evaluation in Urban Autonomous Driving
par: Khalili, Boshra, et autres
Publié: (2025)
par: Khalili, Boshra, et autres
Publié: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
Drive-Through 3D Vehicle Exterior Reconstruction via Dynamic-Scene SfM and Distortion-Aware Gaussian Splatting
par: Kulkarni, Nitin, et autres
Publié: (2026)
par: Kulkarni, Nitin, et autres
Publié: (2026)
SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models
par: Liu, Haowen, et autres
Publié: (2025)
par: Liu, Haowen, et autres
Publié: (2025)
3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks
par: Bhat, Vineet, et autres
Publié: (2025)
par: Bhat, Vineet, et autres
Publié: (2025)
AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving
par: Yuan, Zhenlong, et autres
Publié: (2025)
par: Yuan, Zhenlong, et autres
Publié: (2025)
Decentralized Vehicle Coordination: The Berkeley DeepDrive Drone Dataset and Consensus-Based Models
par: Wu, Fangyu, et autres
Publié: (2022)
par: Wu, Fangyu, et autres
Publié: (2022)
Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
par: Xia, Zhongyu, et autres
Publié: (2026)
par: Xia, Zhongyu, et autres
Publié: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
par: Jiang, Sicong, et autres
Publié: (2025)
par: Jiang, Sicong, et autres
Publié: (2025)
IROAM: Improving Roadside Monocular 3D Object Detection Learning from Autonomous Vehicle Data Domain
par: Wang, Zhe, et autres
Publié: (2025)
par: Wang, Zhe, et autres
Publié: (2025)
3D Object Visibility Prediction in Autonomous Driving
par: Luo, Chuanyu, et autres
Publié: (2024)
par: Luo, Chuanyu, et autres
Publié: (2024)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
par: Song, Jingyu, et autres
Publié: (2025)
par: Song, Jingyu, et autres
Publié: (2025)
Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving
par: Yang, Sheng, et autres
Publié: (2025)
par: Yang, Sheng, et autres
Publié: (2025)
Low-Cost Infrared Vision Systems for Improved Safety of Emergency Vehicle Operations Under Low-Visibility Conditions
par: Naddaf-Sh, M-Mahdi, et autres
Publié: (2025)
par: Naddaf-Sh, M-Mahdi, et autres
Publié: (2025)
WLST: Weak Labels Guided Self-training for Weakly-supervised Domain Adaptation on 3D Object Detection
par: Tsou, Tsung-Lin, et autres
Publié: (2023)
par: Tsou, Tsung-Lin, et autres
Publié: (2023)
Documents similaires
-
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
par: Chiu, Hsu-kuang, et autres
Publié: (2025) -
GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching
par: Dagda, Barkin, et autres
Publié: (2025) -
Strategic Fusion of Vision Language Models: Shapley-Credited Context-Aware Dawid-Skene for Multi-Label Tasks in Autonomous Driving
par: Feng, Yuxiang, et autres
Publié: (2025) -
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026) -
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)