DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Diao, Muxi, Yang, Lele, Yin, Hongbo, Wang, Zhexu, Wang, Yejie, Tian, Daxin, Liang, Kongming, Ma, Zhanyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024)
di: Wang, Xinran, et al.
Pubblicazione: (2024)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
Toward Generalizable Forgery Detection and Reasoning
di: Gao, Yueying, et al.
Pubblicazione: (2025)
di: Gao, Yueying, et al.
Pubblicazione: (2025)
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos
di: Yang, Zixi, et al.
Pubblicazione: (2025)
di: Yang, Zixi, et al.
Pubblicazione: (2025)
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
di: Yang, Yuxuan, et al.
Pubblicazione: (2026)
di: Yang, Yuxuan, et al.
Pubblicazione: (2026)
Evaluating Attribute Comprehension in Large Vision-Language Models
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
di: Wang, Shihao, et al.
Pubblicazione: (2024)
di: Wang, Shihao, et al.
Pubblicazione: (2024)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving
di: Wang, Yujin, et al.
Pubblicazione: (2026)
di: Wang, Yujin, et al.
Pubblicazione: (2026)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
di: Diao, Muxi, et al.
Pubblicazione: (2026)
di: Diao, Muxi, et al.
Pubblicazione: (2026)
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
di: Yin, Zijin, et al.
Pubblicazione: (2024)
di: Yin, Zijin, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
di: Wu, Aodi, et al.
Pubblicazione: (2025)
di: Wu, Aodi, et al.
Pubblicazione: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
di: Wang, Guoqing, et al.
Pubblicazione: (2026)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
di: Yang, Lijin, et al.
Pubblicazione: (2026)
di: Yang, Lijin, et al.
Pubblicazione: (2026)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
di: Wang, Jie, et al.
Pubblicazione: (2026)
di: Wang, Jie, et al.
Pubblicazione: (2026)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
di: Kong, Dehong, et al.
Pubblicazione: (2025)
di: Kong, Dehong, et al.
Pubblicazione: (2025)
Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving
di: Nie, Ming, et al.
Pubblicazione: (2023)
di: Nie, Ming, et al.
Pubblicazione: (2023)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
PGP-SAM: Prototype-Guided Prompt Learning for Efficient Few-Shot Medical Image Segmentation
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
di: Yan, Zhonghao, et al.
Pubblicazione: (2025)
VLP: Vision Language Planning for Autonomous Driving
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
di: Pan, Chenbin, et al.
Pubblicazione: (2024)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
di: Xiong, Minhao, et al.
Pubblicazione: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
di: Jiang, Bo, et al.
Pubblicazione: (2024)
di: Jiang, Bo, et al.
Pubblicazione: (2024)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
di: Sun, Bin, et al.
Pubblicazione: (2025)
di: Sun, Bin, et al.
Pubblicazione: (2025)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
di: Xing, Shuo, et al.
Pubblicazione: (2024)
di: Xing, Shuo, et al.
Pubblicazione: (2024)
C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving
di: Tian, Kefei, et al.
Pubblicazione: (2026)
di: Tian, Kefei, et al.
Pubblicazione: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
Language Prompt for Autonomous Driving
di: Wu, Dongming, et al.
Pubblicazione: (2023)
di: Wu, Dongming, et al.
Pubblicazione: (2023)
Documenti analoghi
-
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
di: Yan, Zhonghao, et al.
Pubblicazione: (2025) -
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
di: Wang, Xinran, et al.
Pubblicazione: (2024) -
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025) -
Toward Generalizable Forgery Detection and Reasoning
di: Gao, Yueying, et al.
Pubblicazione: (2025) -
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)