RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
Fuente:
arXiv
Guardado en:
| Autores principales: | Guan, Runwei, Hu, Rongsheng, Chen, Shangshu, Xiao, Ningyuan, Xia, Xue, Liu, Jiayang, Chen, Beibei, Tang, Ziren, Ouyang, Ningwei, Liang, Shaofeng, Fan, Yuxuan, Sun, Wanjie, Yue, Yutao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
por: Hu, Rongsheng, et al.
Publicado: (2026)
por: Hu, Rongsheng, et al.
Publicado: (2026)
Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
por: Guan, Runwei, et al.
Publicado: (2025)
por: Guan, Runwei, et al.
Publicado: (2025)
Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving
por: Guan, Runwei, et al.
Publicado: (2025)
por: Guan, Runwei, et al.
Publicado: (2025)
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
por: Guan, Runwei, et al.
Publicado: (2026)
por: Guan, Runwei, et al.
Publicado: (2026)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2025)
por: Zhou, Sheng, et al.
Publicado: (2025)
BERT-VQA: Visual Question Answering on Plots
por: Vu, Tai, et al.
Publicado: (2025)
por: Vu, Tai, et al.
Publicado: (2025)
CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks
por: Wang, Beibei, et al.
Publicado: (2024)
por: Wang, Beibei, et al.
Publicado: (2024)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
por: Luo, Jingzhou, et al.
Publicado: (2025)
por: Luo, Jingzhou, et al.
Publicado: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
por: Chen, Pingyi, et al.
Publicado: (2024)
por: Chen, Pingyi, et al.
Publicado: (2024)
Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension
por: Guan, Runwei, et al.
Publicado: (2024)
por: Guan, Runwei, et al.
Publicado: (2024)
ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
por: Yin, Shaofeng, et al.
Publicado: (2025)
por: Yin, Shaofeng, et al.
Publicado: (2025)
CommVQA: Situating Visual Question Answering in Communicative Contexts
por: Naik, Nandita Shankar, et al.
Publicado: (2024)
por: Naik, Nandita Shankar, et al.
Publicado: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
RoScenes: A Large-scale Multi-view 3D Dataset for Roadside Perception
por: Zhu, Xiaosu, et al.
Publicado: (2024)
por: Zhu, Xiaosu, et al.
Publicado: (2024)
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
por: Shen, Jialu, et al.
Publicado: (2026)
por: Shen, Jialu, et al.
Publicado: (2026)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
por: Mirzaei, Motahhare, et al.
Publicado: (2024)
por: Mirzaei, Motahhare, et al.
Publicado: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
por: Singh, Shubhankar, et al.
Publicado: (2024)
por: Singh, Shubhankar, et al.
Publicado: (2024)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
por: Vu, Sinh Trong, et al.
Publicado: (2025)
por: Vu, Sinh Trong, et al.
Publicado: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion
por: Hou, Minghui, et al.
Publicado: (2025)
por: Hou, Minghui, et al.
Publicado: (2025)
Question Classification with Deep Contextualized Transformer
por: Luo, Haozheng, et al.
Publicado: (2019)
por: Luo, Haozheng, et al.
Publicado: (2019)
Cognitive Disentanglement for Referring Multi-Object Tracking
por: Liang, Shaofeng, et al.
Publicado: (2025)
por: Liang, Shaofeng, et al.
Publicado: (2025)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
por: Min, Juhong, et al.
Publicado: (2024)
por: Min, Juhong, et al.
Publicado: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
por: Brilli, Dionysia Danai, et al.
Publicado: (2025)
por: Brilli, Dionysia Danai, et al.
Publicado: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
por: Nguyen, Hai-Dang, et al.
Publicado: (2025)
Referring Flexible Image Restoration
por: Guan, Runwei, et al.
Publicado: (2024)
por: Guan, Runwei, et al.
Publicado: (2024)
MOSE: Boosting Vision-based Roadside 3D Object Detection with Scene Cues
por: Chen, Xiahan, et al.
Publicado: (2024)
por: Chen, Xiahan, et al.
Publicado: (2024)
QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems
por: He, Zhixian, et al.
Publicado: (2024)
por: He, Zhixian, et al.
Publicado: (2024)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
por: Fan, Lin, et al.
Publicado: (2024)
por: Fan, Lin, et al.
Publicado: (2024)
ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
por: Kim, Yoonsik, et al.
Publicado: (2024)
por: Kim, Yoonsik, et al.
Publicado: (2024)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
por: Mao, Xianwei, et al.
Publicado: (2026)
por: Mao, Xianwei, et al.
Publicado: (2026)
SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory
por: Alam, Samiul, et al.
Publicado: (2026)
por: Alam, Samiul, et al.
Publicado: (2026)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
por: Yeh, Yahsin, et al.
Publicado: (2025)
por: Yeh, Yahsin, et al.
Publicado: (2025)
UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation
por: Ghosh, Shiv, et al.
Publicado: (2026)
por: Ghosh, Shiv, et al.
Publicado: (2026)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
por: Chen, Zhuo, et al.
Publicado: (2024)
por: Chen, Zhuo, et al.
Publicado: (2024)
Ejemplares similares
-
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
por: Hu, Rongsheng, et al.
Publicado: (2026) -
Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
por: Guan, Runwei, et al.
Publicado: (2025) -
Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving
por: Guan, Runwei, et al.
Publicado: (2025) -
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
por: Guan, Runwei, et al.
Publicado: (2026) -
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)