SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Bo, Qiao, Pengfei, Ma, Minhan, Zhang, Xuange, Tang, Yinan, Xu, Peng, Liu, Kun, Yuan, Tongtong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Language Models for Video Surveillance Applications
by: De Silva, Ulindu, et al.
Published: (2025)
by: De Silva, Ulindu, et al.
Published: (2025)
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
by: Zhao, Kaikai, et al.
Published: (2025)
by: Zhao, Kaikai, et al.
Published: (2025)
A Benchmark for Crime Surveillance Video Analysis with Large Models
by: Chen, Haoran, et al.
Published: (2025)
by: Chen, Haoran, et al.
Published: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
by: Li, Kunchang, et al.
Published: (2023)
by: Li, Kunchang, et al.
Published: (2023)
HiMix: Reducing Computational Complexity in Large Vision-Language Models
by: Zhang, Xuange, et al.
Published: (2025)
by: Zhang, Xuange, et al.
Published: (2025)
CRCL: Causal Representation Consistency Learning for Anomaly Detection in Surveillance Videos
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
AssistPDA: An Online Video Surveillance Assistant for Video Anomaly Prediction, Detection, and Analysis
by: Yang, Zhiwei, et al.
Published: (2025)
by: Yang, Zhiwei, et al.
Published: (2025)
SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models
by: Rabasseda, Oriol, et al.
Published: (2026)
by: Rabasseda, Oriol, et al.
Published: (2026)
Evaluation of Vision-LLMs in Surveillance Video
by: Benschop, Pascal, et al.
Published: (2025)
by: Benschop, Pascal, et al.
Published: (2025)
Customer Analytics using Surveillance Video
by: Ijjina, Earnest Paul, et al.
Published: (2025)
by: Ijjina, Earnest Paul, et al.
Published: (2025)
Chapter Quality Assessment in Video Surveillance
by: Leszczuk, Mikoaj, et al.
Published: (2021)
by: Leszczuk, Mikoaj, et al.
Published: (2021)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
by: Hu, Yutao, et al.
Published: (2024)
by: Hu, Yutao, et al.
Published: (2024)
Inter-Feature-Map Differential Coding of Surveillance Video
by: Iino, Kei, et al.
Published: (2024)
by: Iino, Kei, et al.
Published: (2024)
Detection of Object Throwing Behavior in Surveillance Videos
by: Kersten, Ivo P. C., et al.
Published: (2024)
by: Kersten, Ivo P. C., et al.
Published: (2024)
Zero-Shot Action Recognition in Surveillance Videos
by: Pereira, Joao, et al.
Published: (2024)
by: Pereira, Joao, et al.
Published: (2024)
MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding
by: Kou, Qian, et al.
Published: (2026)
by: Kou, Qian, et al.
Published: (2026)
ACCIDENT: A Benchmark Dataset for Vehicle Accident Detection from Traffic Surveillance Videos
by: Picek, Lukas, et al.
Published: (2026)
by: Picek, Lukas, et al.
Published: (2026)
Surveillance & Society
Published: (2005)
Published: (2005)
Surveillance Cinema
by: Zimmer, Catherine
Published: (2024)
by: Zimmer, Catherine
Published: (2024)
States of Surveillance
Published: (2025)
Published: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
by: Cao, Jiahuan, et al.
Published: (2024)
by: Cao, Jiahuan, et al.
Published: (2024)
Explainable Semantic Federated Learning Enabled Industrial Edge Network for Fire Surveillance
by: Dong, Li, et al.
Published: (2024)
by: Dong, Li, et al.
Published: (2024)
HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark
by: Pal, Aniket, et al.
Published: (2025)
by: Pal, Aniket, et al.
Published: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
Video Forgery Detection for Surveillance Cameras: A Review
by: Tayfor, Noor B., et al.
Published: (2025)
by: Tayfor, Noor B., et al.
Published: (2025)
Few-shot Semantic Encoding and Decoding for Video Surveillance
by: Cheng, Baoping, et al.
Published: (2025)
by: Cheng, Baoping, et al.
Published: (2025)
OD-VIRAT: A Large-Scale Benchmark for Object Detection in Realistic Surveillance Environments
by: Ullah, Hayat, et al.
Published: (2025)
by: Ullah, Hayat, et al.
Published: (2025)
Ada-K Routing: Boosting the Efficiency of MoE-based LLMs
by: Yue, Tongtian, et al.
Published: (2024)
by: Yue, Tongtian, et al.
Published: (2024)
Vision Transformer for Robust Occluded Person Reidentification in Complex Surveillance Scenes
by: Li, Bo, et al.
Published: (2025)
by: Li, Bo, et al.
Published: (2025)
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
by: Huang, Ziqi, et al.
Published: (2024)
by: Huang, Ziqi, et al.
Published: (2024)
BEACON: Benchmark for Comprehensive RNA Tasks and Language Models
by: Ren, Yuchen, et al.
Published: (2024)
by: Ren, Yuchen, et al.
Published: (2024)
Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
by: Guan, Runwei, et al.
Published: (2025)
by: Guan, Runwei, et al.
Published: (2025)
Active Reconfigurable Intelligent Surface Aided Surveillance Scheme
by: Hu, Xinyue, et al.
Published: (2022)
by: Hu, Xinyue, et al.
Published: (2022)
A Scalable and Generalised Deep Learning Framework for Anomaly Detection in Surveillance Videos
by: Sabah Abdulazeez Jebur, et al.
Published: (2025)
by: Sabah Abdulazeez Jebur, et al.
Published: (2025)
A Scalable and Generalized Deep Learning Framework for Anomaly Detection in Surveillance Videos
by: Jebur, Sabah Abdulazeez, et al.
Published: (2024)
by: Jebur, Sabah Abdulazeez, et al.
Published: (2024)
Racism and Racial Surveillance
Published: (2021)
Published: (2021)
Surveillance, Privacy and Security
Published: (2025)
Published: (2025)
Systemic Risk Surveillance
by: Dimitriadis, Timo, et al.
Published: (2026)
by: Dimitriadis, Timo, et al.
Published: (2026)
Similar Items
-
Large Language Models for Video Surveillance Applications
by: De Silva, Ulindu, et al.
Published: (2025) -
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
by: Zhao, Kaikai, et al.
Published: (2025) -
A Benchmark for Crime Surveillance Video Analysis with Large Models
by: Chen, Haoran, et al.
Published: (2025) -
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
by: Li, Kunchang, et al.
Published: (2023) -
HiMix: Reducing Computational Complexity in Large Vision-Language Models
by: Zhang, Xuange, et al.
Published: (2025)