A Benchmark for Crime Surveillance Video Analysis with Large Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Haoran, Yi, Dong, Cao, Moyan, Huang, Chensen, Zhu, Guibo, Wang, Jinqiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
por: Ma, Kexin, et al.
Publicado: (2026)
por: Ma, Kexin, et al.
Publicado: (2026)
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner
por: Cai, Pengxiang, et al.
Publicado: (2024)
por: Cai, Pengxiang, et al.
Publicado: (2024)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
por: Liu, Bo, et al.
Publicado: (2025)
por: Liu, Bo, et al.
Publicado: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024)
por: Wang, Langyu, et al.
Publicado: (2024)
FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
BFRFormer: Transformer-based generator for Real-World Blind Face Restoration
por: Ge, Guojing, et al.
Publicado: (2024)
por: Ge, Guojing, et al.
Publicado: (2024)
Large Language Models for Video Surveillance Applications
por: De Silva, Ulindu, et al.
Publicado: (2025)
por: De Silva, Ulindu, et al.
Publicado: (2025)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation
por: Gao, Hongcheng, et al.
Publicado: (2025)
por: Gao, Hongcheng, et al.
Publicado: (2025)
PM-VIS: High-Performance Box-Supervised Video Instance Segmentation
por: Yang, Zhangjing, et al.
Publicado: (2024)
por: Yang, Zhangjing, et al.
Publicado: (2024)
Federated Learning for Medical Image Classification: A Comprehensive Benchmark
por: Zhou, Zhekai, et al.
Publicado: (2025)
por: Zhou, Zhekai, et al.
Publicado: (2025)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2025)
por: Wang, Langyu, et al.
Publicado: (2025)
Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark
por: Cao, Bing, et al.
Publicado: (2024)
por: Cao, Bing, et al.
Publicado: (2024)
An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval
por: Cao, Min, et al.
Publicado: (2025)
por: Cao, Min, et al.
Publicado: (2025)
SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models
por: Rabasseda, Oriol, et al.
Publicado: (2026)
por: Rabasseda, Oriol, et al.
Publicado: (2026)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
por: Deng, Andong, et al.
Publicado: (2026)
por: Deng, Andong, et al.
Publicado: (2026)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
AssistPDA: An Online Video Surveillance Assistant for Video Anomaly Prediction, Detection, and Analysis
por: Yang, Zhiwei, et al.
Publicado: (2025)
por: Yang, Zhiwei, et al.
Publicado: (2025)
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
por: Hei, Xusen, et al.
Publicado: (2025)
por: Hei, Xusen, et al.
Publicado: (2025)
Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark
por: Wu, Yongliang, et al.
Publicado: (2024)
por: Wu, Yongliang, et al.
Publicado: (2024)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
por: Yu, Jiachen, et al.
Publicado: (2025)
por: Yu, Jiachen, et al.
Publicado: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
por: Guo, Haiyang, et al.
Publicado: (2026)
por: Guo, Haiyang, et al.
Publicado: (2026)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
por: Liu, Yaofang, et al.
Publicado: (2023)
por: Liu, Yaofang, et al.
Publicado: (2023)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
por: Zhang, Shi-Xue, et al.
Publicado: (2025)
OD-VIRAT: A Large-Scale Benchmark for Object Detection in Realistic Surveillance Environments
por: Ullah, Hayat, et al.
Publicado: (2025)
por: Ullah, Hayat, et al.
Publicado: (2025)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
por: Zhou, Weijie, et al.
Publicado: (2026)
por: Zhou, Weijie, et al.
Publicado: (2026)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Imagine How To Change: Explicit Procedure Modeling for Change Captioning
por: Sun, Jiayang, et al.
Publicado: (2026)
por: Sun, Jiayang, et al.
Publicado: (2026)
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
por: Wang, Yueqian, et al.
Publicado: (2025)
por: Wang, Yueqian, et al.
Publicado: (2025)
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
por: Zhan, Yufei, et al.
Publicado: (2023)
por: Zhan, Yufei, et al.
Publicado: (2023)
Poisoning Prompt-Guided Sampling in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2025)
por: Cao, Yuxin, et al.
Publicado: (2025)
ProDisc-VAD: An Efficient System for Weakly-Supervised Anomaly Detection in Video Surveillance Applications
por: Zhu, Tao, et al.
Publicado: (2025)
por: Zhu, Tao, et al.
Publicado: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
Ejemplares similares
-
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024) -
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
por: Ma, Kexin, et al.
Publicado: (2026) -
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
por: Gu, Zhaopeng, et al.
Publicado: (2025) -
Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner
por: Cai, Pengxiang, et al.
Publicado: (2024) -
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2025)