Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Shu, Tian, Xinyu, Wesemann, Lukas, Waschkowski, Fabian, Yang, Zhaoyuan, Zhang, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025)
par: Tian, Xinyu, et autres
Publié: (2025)
ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2023)
par: Tian, Xinyu, et autres
Publié: (2023)
Identifying and Mitigating Position Bias of Multi-image Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025)
par: Tian, Xinyu, et autres
Publié: (2025)
SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models
par: Zou, Shu, et autres
Publié: (2025)
par: Zou, Shu, et autres
Publié: (2025)
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2026)
par: Tian, Xinyu, et autres
Publié: (2026)
High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models
par: He, Mengqi, et autres
Publié: (2025)
par: He, Mengqi, et autres
Publié: (2025)
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality
par: Tao, Chaofan, et autres
Publié: (2024)
par: Tao, Chaofan, et autres
Publié: (2024)
Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection
par: Fan, Yuanting, et autres
Publié: (2025)
par: Fan, Yuanting, et autres
Publié: (2025)
Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models
par: Zheng, Yue, et autres
Publié: (2025)
par: Zheng, Yue, et autres
Publié: (2025)
Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection
par: Yang, Zhiwei, et autres
Publié: (2024)
par: Yang, Zhiwei, et autres
Publié: (2024)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
par: Jiang, Yalong, et autres
Publié: (2024)
par: Jiang, Yalong, et autres
Publié: (2024)
Text-guided Fine-Grained Video Anomaly Understanding
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
par: Deng, Hanqiu, et autres
Publié: (2023)
par: Deng, Hanqiu, et autres
Publié: (2023)
VL4AD: Vision-Language Models Improve Pixel-wise Anomaly Detection
par: Zhong, Liangyu, et autres
Publié: (2024)
par: Zhong, Liangyu, et autres
Publié: (2024)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
par: Ding, Zongcan, et autres
Publié: (2025)
par: Ding, Zongcan, et autres
Publié: (2025)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
par: Hai, Jia-Wei, et autres
Publié: (2026)
par: Hai, Jia-Wei, et autres
Publié: (2026)
Video Anomaly Detection and Explanation via Large Language Models
par: Lv, Hui, et autres
Publié: (2024)
par: Lv, Hui, et autres
Publié: (2024)
Dissolving Is Amplifying: Towards Fine-Grained Anomaly Detection
par: Shi, Jian, et autres
Publié: (2023)
par: Shi, Jian, et autres
Publié: (2023)
Human-Free Automated Prompting for Vision-Language Anomaly Detection: Prompt Optimization with Meta-guiding Prompt Scheme
par: Chen, Pi-Wei, et autres
Publié: (2024)
par: Chen, Pi-Wei, et autres
Publié: (2024)
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
par: Zhao, Peisen, et autres
Publié: (2026)
par: Zhao, Peisen, et autres
Publié: (2026)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
par: Lan, Long, et autres
Publié: (2024)
par: Lan, Long, et autres
Publié: (2024)
Learn Suspected Anomalies from Event Prompts for Video Anomaly Detection
par: Tao, Chenchen, et autres
Publié: (2024)
par: Tao, Chenchen, et autres
Publié: (2024)
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
par: Maack, Lennart, et autres
Publié: (2026)
par: Maack, Lennart, et autres
Publié: (2026)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
par: Pereira, João, et autres
Publié: (2026)
par: Pereira, João, et autres
Publié: (2026)
FILA: Fine-Grained Vision Language Models
par: Zhu, Shiding, et autres
Publié: (2024)
par: Zhu, Shiding, et autres
Publié: (2024)
Topo-R1: Detecting Topological Anomalies via Vision-Language Models
par: Xu, Meilong, et autres
Publié: (2026)
par: Xu, Meilong, et autres
Publié: (2026)
Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection
par: Pu, Yujiang, et autres
Publié: (2023)
par: Pu, Yujiang, et autres
Publié: (2023)
Fine-grained Abnormality Prompt Learning for Zero-shot Anomaly Detection
par: Zhu, Jiawen, et autres
Publié: (2024)
par: Zhu, Jiawen, et autres
Publié: (2024)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
par: Zhao, Fufangchen, et autres
Publié: (2025)
par: Zhao, Fufangchen, et autres
Publié: (2025)
VADMamba++: Efficient Video Anomaly Detection via Hybrid Modeling in Grayscale Space
par: Lyu, Jihao, et autres
Publié: (2026)
par: Lyu, Jihao, et autres
Publié: (2026)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
par: Xiao, Wenyi, et autres
Publié: (2024)
par: Xiao, Wenyi, et autres
Publié: (2024)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
par: Liao, Jingyi, et autres
Publié: (2025)
par: Liao, Jingyi, et autres
Publié: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
par: Zhang, Mingyuan, et autres
Publié: (2025)
par: Zhang, Mingyuan, et autres
Publié: (2025)
AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection
par: Zhou, Qihang, et autres
Publié: (2023)
par: Zhou, Qihang, et autres
Publié: (2023)
Fine-Grained Side Information Guided Dual-Prompts for Zero-Shot Skeleton Action Recognition
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models
par: Ye, Muchao, et autres
Publié: (2024)
par: Ye, Muchao, et autres
Publié: (2024)
InPK: Infusing Prior Knowledge into Prompt for Vision-Language Models
par: Zhou, Shuchang, et autres
Publié: (2025)
par: Zhou, Shuchang, et autres
Publié: (2025)
Anomaly Object Segmentation with Vision-Language Models for Steel Scrap Recycling
par: Tanaka, Daichi, et autres
Publié: (2025)
par: Tanaka, Daichi, et autres
Publié: (2025)
Documents similaires
-
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025) -
ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2023) -
Identifying and Mitigating Position Bias of Multi-image Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025) -
SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models
par: Zou, Shu, et autres
Publié: (2025) -
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2026)