TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Hassani, Hossein, Nikan, Soodeh, Shami, Abdallah |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
di: Chen, Lihong, et al.
Pubblicazione: (2025)
di: Chen, Lihong, et al.
Pubblicazione: (2025)
DriveLM: Driving with Graph Visual Question Answering
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
di: Cai, Yuliang, et al.
Pubblicazione: (2026)
di: Cai, Yuliang, et al.
Pubblicazione: (2026)
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
di: Lin, Yuxin, et al.
Pubblicazione: (2025)
di: Lin, Yuxin, et al.
Pubblicazione: (2025)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
Multiscale Video Transformers for Class Agnostic Segmentation in Autonomous Driving
di: Cheshmi, Leila, et al.
Pubblicazione: (2025)
di: Cheshmi, Leila, et al.
Pubblicazione: (2025)
SGNetPose+: Stepwise Goal-Driven Networks with Pose Information for Trajectory Prediction in Autonomous Driving
di: Ghiya, Akshat, et al.
Pubblicazione: (2025)
di: Ghiya, Akshat, et al.
Pubblicazione: (2025)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
di: Gopalkrishnan, Akshay, et al.
Pubblicazione: (2024)
di: Gopalkrishnan, Akshay, et al.
Pubblicazione: (2024)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement
di: Jiao, Siwen, et al.
Pubblicazione: (2024)
di: Jiao, Siwen, et al.
Pubblicazione: (2024)
Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns
di: Rekanar, Kaavya, et al.
Pubblicazione: (2024)
di: Rekanar, Kaavya, et al.
Pubblicazione: (2024)
COOOL: Challenge Of Out-Of-Label A Novel Benchmark for Autonomous Driving
di: AlShami, Ali K., et al.
Pubblicazione: (2024)
di: AlShami, Ali K., et al.
Pubblicazione: (2024)
Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention
di: Ma, Yiming, et al.
Pubblicazione: (2023)
di: Ma, Yiming, et al.
Pubblicazione: (2023)
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
Visual Implicit Geometry Transformer for Autonomous Driving
di: Shirokov, Arsenii, et al.
Pubblicazione: (2026)
di: Shirokov, Arsenii, et al.
Pubblicazione: (2026)
DriveVGGT: Calibration-Constrained Visual Geometry Transformers for Multi-Camera Autonomous Driving
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
di: Jia, Xiaosong, et al.
Pubblicazione: (2025)
Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?
di: Bai, Yifan, et al.
Pubblicazione: (2024)
di: Bai, Yifan, et al.
Pubblicazione: (2024)
Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering
di: Shi, Yumeng, et al.
Pubblicazione: (2025)
di: Shi, Yumeng, et al.
Pubblicazione: (2025)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering
di: Li, Wenli, et al.
Pubblicazione: (2026)
di: Li, Wenli, et al.
Pubblicazione: (2026)
Visual Point Cloud Forecasting enables Scalable Autonomous Driving
di: Yang, Zetong, et al.
Pubblicazione: (2023)
di: Yang, Zetong, et al.
Pubblicazione: (2023)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
HawkDrive: A Transformer-driven Visual Perception System for Autonomous Driving in Night Scene
di: Guo, Ziang, et al.
Pubblicazione: (2024)
di: Guo, Ziang, et al.
Pubblicazione: (2024)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
TruckDrive: Long-Range Autonomous Highway Driving Dataset
di: Ghilotti, Filippo, et al.
Pubblicazione: (2026)
di: Ghilotti, Filippo, et al.
Pubblicazione: (2026)
Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving
di: Jia, Xiaosong, et al.
Pubblicazione: (2024)
di: Jia, Xiaosong, et al.
Pubblicazione: (2024)
Language Prompt for Autonomous Driving
di: Wu, Dongming, et al.
Pubblicazione: (2023)
di: Wu, Dongming, et al.
Pubblicazione: (2023)
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
di: Lan, Jian, et al.
Pubblicazione: (2025)
di: Lan, Jian, et al.
Pubblicazione: (2025)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
di: Li, Peizheng, et al.
Pubblicazione: (2025)
di: Li, Peizheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning
di: Chen, Lihong, et al.
Pubblicazione: (2025) -
DriveLM: Driving with Graph Visual Question Answering
di: Sima, Chonghao, et al.
Pubblicazione: (2023) -
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023) -
Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
di: Cai, Yuliang, et al.
Pubblicazione: (2026) -
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)