Harnessing Large Language Models for Training-free Video Anomaly Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zanella, Luca, Menapace, Willi, Mancini, Massimiliano, Wang, Yiming, Ricci, Elisa |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
Training-free Online Video Step Grounding
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
Compositional Caching for Training-free Open-vocabulary Attribute Detection
par: Garosi, Marco, et autres
Publié: (2025)
par: Garosi, Marco, et autres
Publié: (2025)
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
par: Das, Deepayan, et autres
Publié: (2025)
par: Das, Deepayan, et autres
Publié: (2025)
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
par: Das, Deepayan, et autres
Publié: (2024)
par: Das, Deepayan, et autres
Publié: (2024)
Vocabulary-free Image Classification
par: Conti, Alessandro, et autres
Publié: (2023)
par: Conti, Alessandro, et autres
Publié: (2023)
Vocabulary-free Image Classification and Semantic Segmentation
par: Conti, Alessandro, et autres
Publié: (2024)
par: Conti, Alessandro, et autres
Publié: (2024)
On Large Multimodal Models as Open-World Image Classifiers
par: Conti, Alessandro, et autres
Publié: (2025)
par: Conti, Alessandro, et autres
Publié: (2025)
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
par: Caldarella, Simone, et autres
Publié: (2024)
par: Caldarella, Simone, et autres
Publié: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
par: De Min, Thomas, et autres
Publié: (2026)
par: De Min, Thomas, et autres
Publié: (2026)
Large Multimodal Models as General In-Context Classifiers
par: Garosi, Marco, et autres
Publié: (2026)
par: Garosi, Marco, et autres
Publié: (2026)
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
par: Skorokhodov, Ivan, et autres
Publié: (2024)
par: Skorokhodov, Ivan, et autres
Publié: (2024)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
par: Farina, Matteo, et autres
Publié: (2025)
par: Farina, Matteo, et autres
Publié: (2025)
Test-time Vocabulary Adaptation for Language-driven Object Detection
par: Liu, Mingxuan, et autres
Publié: (2025)
par: Liu, Mingxuan, et autres
Publié: (2025)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
par: Berasi, Davide, et autres
Publié: (2025)
par: Berasi, Davide, et autres
Publié: (2025)
Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion Models
par: Menapace, Willi, et autres
Publié: (2023)
par: Menapace, Willi, et autres
Publié: (2023)
MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Automatic benchmarking of large multimodal models via iterative experiment programming
par: Conti, Alessandro, et autres
Publié: (2024)
par: Conti, Alessandro, et autres
Publié: (2024)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
par: Zhang, Jinjin, et autres
Publié: (2025)
par: Zhang, Jinjin, et autres
Publié: (2025)
Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual Classifiers
par: Guimard, Quentin, et autres
Publié: (2025)
par: Guimard, Quentin, et autres
Publié: (2025)
Unlearning Personal Data from a Single Image
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Vision-by-Language for Training-Free Compositional Image Retrieval
par: Karthik, Shyamgopal, et autres
Publié: (2023)
par: Karthik, Shyamgopal, et autres
Publié: (2023)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
par: Menapace, Willi, et autres
Publié: (2024)
par: Menapace, Willi, et autres
Publié: (2024)
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
par: Guimard, Quentin, et autres
Publié: (2026)
par: Guimard, Quentin, et autres
Publié: (2026)
Video Anomaly Detection and Explanation via Large Language Models
par: Lv, Hui, et autres
Publié: (2024)
par: Lv, Hui, et autres
Publié: (2024)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
par: Wu, Ziyi, et autres
Publié: (2025)
par: Wu, Ziyi, et autres
Publié: (2025)
From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
par: Gentile, Francesco, et autres
Publié: (2026)
par: Gentile, Francesco, et autres
Publié: (2026)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
par: Bonat, Laurence, et autres
Publié: (2026)
par: Bonat, Laurence, et autres
Publié: (2026)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Mind the Time: Temporally-Controlled Multi-Event Video Generation
par: Wu, Ziyi, et autres
Publié: (2024)
par: Wu, Ziyi, et autres
Publié: (2024)
ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
par: Liberatori, Benedetta, et autres
Publié: (2025)
par: Liberatori, Benedetta, et autres
Publié: (2025)
Frequency-Guided Diffusion Model with Perturbation Training for Skeleton-Based Video Anomaly Detection
par: Tan, Xiaofeng, et autres
Publié: (2024)
par: Tan, Xiaofeng, et autres
Publié: (2024)
4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models
par: Yu, Heng, et autres
Publié: (2024)
par: Yu, Heng, et autres
Publié: (2024)
MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
par: Yang, Shengtian, et autres
Publié: (2025)
par: Yang, Shengtian, et autres
Publié: (2025)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
par: Gu, Zhaopeng, et autres
Publié: (2025)
par: Gu, Zhaopeng, et autres
Publié: (2025)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
par: Huang, Yiran, et autres
Publié: (2025)
par: Huang, Yiran, et autres
Publié: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
par: Gu, Zhaopeng, et autres
Publié: (2024)
par: Gu, Zhaopeng, et autres
Publié: (2024)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
par: Jiang, Yalong, et autres
Publié: (2024)
par: Jiang, Yalong, et autres
Publié: (2024)
Documents similaires
-
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025) -
Training-free Online Video Step Grounding
par: Zanella, Luca, et autres
Publié: (2025) -
Compositional Caching for Training-free Open-vocabulary Attribute Detection
par: Garosi, Marco, et autres
Publié: (2025) -
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
par: Das, Deepayan, et autres
Publié: (2025) -
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
par: Das, Deepayan, et autres
Publié: (2024)