SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Rabasseda, Oriol, Li, Zenjie, Nasrollahi, Kamal, Escalera, Sergio |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding
by: Erregue, Iñaki, et al.
Published: (2026)
by: Erregue, Iñaki, et al.
Published: (2026)
Visual Context-Aware Person Fall Detection
by: Nagaj, Aleksander, et al.
Published: (2024)
by: Nagaj, Aleksander, et al.
Published: (2024)
YOLO11-JDE: Fast and Accurate Multi-Object Tracking with Self-Supervised Re-ID
by: Erregue, Iñaki, et al.
Published: (2025)
by: Erregue, Iñaki, et al.
Published: (2025)
Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU
by: Vidal, Àlex Pujol, et al.
Published: (2025)
by: Vidal, Àlex Pujol, et al.
Published: (2025)
Balancing Privacy and Action Performance: A Penalty-Driven Approach to Image Anonymization
by: Aslam, Nazia, et al.
Published: (2025)
by: Aslam, Nazia, et al.
Published: (2025)
A Hyperbolic Perspective on Hierarchical Structure in Object-Centric Scene Representations
by: Madan, Neelu, et al.
Published: (2026)
by: Madan, Neelu, et al.
Published: (2026)
Leveraging Large Language Models for Multimodal Search
by: Barbany, Oriol, et al.
Published: (2024)
by: Barbany, Oriol, et al.
Published: (2024)
Bounding Boxes and Probabilistic Graphical Models: Video Anomaly Detection Simplified
by: Siemon, Mia, et al.
Published: (2024)
by: Siemon, Mia, et al.
Published: (2024)
A Transformer Model for Boundary Detection in Continuous Sign Language
by: Rastgoo, Razieh, et al.
Published: (2024)
by: Rastgoo, Razieh, et al.
Published: (2024)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
by: Liu, Bo, et al.
Published: (2025)
by: Liu, Bo, et al.
Published: (2025)
Video Anomaly Detection with Contours -- A Study
by: Siemon, Mia, et al.
Published: (2025)
by: Siemon, Mia, et al.
Published: (2025)
Action Valuation in Sports: A Survey
by: Xarles, Artur, et al.
Published: (2025)
by: Xarles, Artur, et al.
Published: (2025)
SADA: Semantic adversarial unsupervised domain adaptation for Temporal Action Localization
by: Pujol-Perich, David, et al.
Published: (2023)
by: Pujol-Perich, David, et al.
Published: (2023)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
by: Xu, Mengya, et al.
Published: (2025)
by: Xu, Mengya, et al.
Published: (2025)
ASTRA: An Action Spotting TRAnsformer for Soccer Videos
by: Xarles, Artur, et al.
Published: (2024)
by: Xarles, Artur, et al.
Published: (2024)
A Benchmark for Crime Surveillance Video Analysis with Large Models
by: Chen, Haoran, et al.
Published: (2025)
by: Chen, Haoran, et al.
Published: (2025)
Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?
by: Feng, Hengyi, et al.
Published: (2025)
by: Feng, Hengyi, et al.
Published: (2025)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
by: Molina, Adrià, et al.
Published: (2024)
by: Molina, Adrià, et al.
Published: (2024)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
by: Wang, Lehan, et al.
Published: (2025)
by: Wang, Lehan, et al.
Published: (2025)
Large Language Models for Video Surveillance Applications
by: De Silva, Ulindu, et al.
Published: (2025)
by: De Silva, Ulindu, et al.
Published: (2025)
TSBOW -- Traffic Surveillance Benchmark for Occluded Vehicles Under Various Weather Conditions
by: Huynh, Ngoc Doan-Minh, et al.
Published: (2026)
by: Huynh, Ngoc Doan-Minh, et al.
Published: (2026)
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
by: Zhao, Kaikai, et al.
Published: (2025)
by: Zhao, Kaikai, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
Beyond Caption-Based Queries for Video Moment Retrieval
by: Pujol-Perich, David, et al.
Published: (2026)
by: Pujol-Perich, David, et al.
Published: (2026)
FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks
by: Wu, Peiran, et al.
Published: (2024)
by: Wu, Peiran, et al.
Published: (2024)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
by: Xu, Mingjie, et al.
Published: (2025)
by: Xu, Mingjie, et al.
Published: (2025)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
by: De Min, Thomas, et al.
Published: (2026)
by: De Min, Thomas, et al.
Published: (2026)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
by: Qin, Zhenyue, et al.
Published: (2024)
by: Qin, Zhenyue, et al.
Published: (2024)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
by: Qin, Zhenyue, et al.
Published: (2025)
by: Qin, Zhenyue, et al.
Published: (2025)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
by: Li, Jiale, et al.
Published: (2025)
by: Li, Jiale, et al.
Published: (2025)
What Matters in Virtual Try-Off? Dual-UNet Diffusion Model For Garment Reconstruction
by: Truong, Loc-Phat, et al.
Published: (2026)
by: Truong, Loc-Phat, et al.
Published: (2026)
DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models
by: Lin, Jieru, et al.
Published: (2024)
by: Lin, Jieru, et al.
Published: (2024)
SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports
by: Xia, Haotian, et al.
Published: (2025)
by: Xia, Haotian, et al.
Published: (2025)
FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis
by: Gavas, Ekta, et al.
Published: (2025)
by: Gavas, Ekta, et al.
Published: (2025)
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags
by: Qi, Daiqing, et al.
Published: (2024)
by: Qi, Daiqing, et al.
Published: (2024)
Multimodal Large Models Are Effective Action Anticipators
by: Wang, Binglu, et al.
Published: (2025)
by: Wang, Binglu, et al.
Published: (2025)
Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
by: Liu, Zhaochen, et al.
Published: (2025)
by: Liu, Zhaochen, et al.
Published: (2025)
SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence
by: Gong, Ziyang, et al.
Published: (2025)
by: Gong, Ziyang, et al.
Published: (2025)
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
by: Chiu, Hsu-kuang, et al.
Published: (2025)
by: Chiu, Hsu-kuang, et al.
Published: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
by: Li, Jian, et al.
Published: (2024)
by: Li, Jian, et al.
Published: (2024)
Similar Items
-
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding
by: Erregue, Iñaki, et al.
Published: (2026) -
Visual Context-Aware Person Fall Detection
by: Nagaj, Aleksander, et al.
Published: (2024) -
YOLO11-JDE: Fast and Accurate Multi-Object Tracking with Self-Supervised Re-ID
by: Erregue, Iñaki, et al.
Published: (2025) -
Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU
by: Vidal, Àlex Pujol, et al.
Published: (2025) -
Balancing Privacy and Action Performance: A Penalty-Driven Approach to Image Anonymization
by: Aslam, Nazia, et al.
Published: (2025)