Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Cai, Yuliang, Ye, Dongqiangzi, Chen, Zitian, Wu, Chongruo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering
di: Cai, Yuliang, et al.
Pubblicazione: (2024)
di: Cai, Yuliang, et al.
Pubblicazione: (2024)
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
DriveLM: Driving with Graph Visual Question Answering
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering
di: Weng, Weixi, et al.
Pubblicazione: (2024)
di: Weng, Weixi, et al.
Pubblicazione: (2024)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
di: Gopalkrishnan, Akshay, et al.
Pubblicazione: (2024)
di: Gopalkrishnan, Akshay, et al.
Pubblicazione: (2024)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
di: Lin, Yuxin, et al.
Pubblicazione: (2025)
di: Lin, Yuxin, et al.
Pubblicazione: (2025)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
di: Ye, Qilang, et al.
Pubblicazione: (2024)
di: Ye, Qilang, et al.
Pubblicazione: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
SparseDrive: End-to-End Autonomous Driving via Sparse Scene Representation
di: Sun, Wenchao, et al.
Pubblicazione: (2024)
di: Sun, Wenchao, et al.
Pubblicazione: (2024)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
di: Zheng, Peiru, et al.
Pubblicazione: (2024)
VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
di: Song, Ruiqi, et al.
Pubblicazione: (2025)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
di: Zhang, Jiayu, et al.
Pubblicazione: (2026)
di: Zhang, Jiayu, et al.
Pubblicazione: (2026)
VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models
di: Yin, Ziyi, et al.
Pubblicazione: (2024)
di: Yin, Ziyi, et al.
Pubblicazione: (2024)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
di: Guan, Runwei, et al.
Pubblicazione: (2025)
di: Guan, Runwei, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
di: Yu, Seungjun, et al.
Pubblicazione: (2025)
3D Question Answering for City Scene Understanding
di: Sun, Penglei, et al.
Pubblicazione: (2024)
di: Sun, Penglei, et al.
Pubblicazione: (2024)
Can Visual Language Models Replace OCR-Based Visual Question Answering Pipelines in Production? A Case Study in Retail
di: Lamm, Bianca, et al.
Pubblicazione: (2024)
di: Lamm, Bianca, et al.
Pubblicazione: (2024)
Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents
di: Wei, Yuxi, et al.
Pubblicazione: (2024)
di: Wei, Yuxi, et al.
Pubblicazione: (2024)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
di: Gou, Chenhui, et al.
Pubblicazione: (2025)
Reconstruction as a Bridge for Event-Based Visual Question Answering
di: Lou, Hanyue, et al.
Pubblicazione: (2025)
di: Lou, Hanyue, et al.
Pubblicazione: (2025)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
QIRL: Boosting Visual Question Answering via Optimized Question-Image Relation Learning
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
di: Xu, Quanxing, et al.
Pubblicazione: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
Compressing Multi-Task Model for Autonomous Driving via Pruning and Knowledge Distillation
di: Wang, Jiayuan, et al.
Pubblicazione: (2025)
di: Wang, Jiayuan, et al.
Pubblicazione: (2025)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
di: Shen, Zhixuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023) -
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
di: Tao, Mingzhe, et al.
Pubblicazione: (2026) -
CluMo: Cluster-based Modality Fusion Prompt for Continual Learning in Visual Question Answering
di: Cai, Yuliang, et al.
Pubblicazione: (2024) -
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
di: Hassani, Hossein, et al.
Pubblicazione: (2025) -
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)