Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Xiaohao, Cao, Yunkang, Zhang, Huaxin, Sang, Nong, Huang, Xiaonan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
par: Zhang, Huaxin, et autres
Publié: (2024)
par: Zhang, Huaxin, et autres
Publié: (2024)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
par: Zhang, Huaxin, et autres
Publié: (2024)
par: Zhang, Huaxin, et autres
Publié: (2024)
A Survey on Visual Anomaly Detection: Challenge, Approach, and Prospect
par: Cao, Yunkang, et autres
Publié: (2024)
par: Cao, Yunkang, et autres
Publié: (2024)
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
par: Zhang, Huaxin, et autres
Publié: (2024)
par: Zhang, Huaxin, et autres
Publié: (2024)
Complementary Pseudo Multimodal Feature for Point Cloud Anomaly Detection
par: Cao, Yunkang, et autres
Publié: (2023)
par: Cao, Yunkang, et autres
Publié: (2023)
Visual Anomaly Detection under Complex View-Illumination Interplay: A Large-Scale Benchmark
par: Cao, Yunkang, et autres
Publié: (2025)
par: Cao, Yunkang, et autres
Publié: (2025)
LogiCode: an LLM-Driven Framework for Logical Anomaly Detection
par: Zhang, Yiheng, et autres
Publié: (2024)
par: Zhang, Yiheng, et autres
Publié: (2024)
Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
HR-Pro: Point-supervised Temporal Action Localization via Hierarchical Reliability Propagation
par: Zhang, Huaxin, et autres
Publié: (2023)
par: Zhang, Huaxin, et autres
Publié: (2023)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
par: Li, Wenqiao, et autres
Publié: (2025)
par: Li, Wenqiao, et autres
Publié: (2025)
Attention Fusion Reverse Distillation for Multi-Lighting Image Anomaly Detection
par: Zhang, Yiheng, et autres
Publié: (2024)
par: Zhang, Yiheng, et autres
Publié: (2024)
VarAD: Lightweight High-Resolution Image Anomaly Detection via Visual Autoregressive Modeling
par: Cao, Yunkang, et autres
Publié: (2024)
par: Cao, Yunkang, et autres
Publié: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
par: Xu, Jiacong, et autres
Publié: (2025)
par: Xu, Jiacong, et autres
Publié: (2025)
Unseen Visual Anomaly Generation
par: Sun, Han, et autres
Publié: (2024)
par: Sun, Han, et autres
Publié: (2024)
When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills
par: Wang, Yunfei, et autres
Publié: (2026)
par: Wang, Yunfei, et autres
Publié: (2026)
Generative Denoise Distillation: Simple Stochastic Noises Induce Efficient Knowledge Transfer for Dense Prediction
par: Liu, Zhaoge, et autres
Publié: (2024)
par: Liu, Zhaoge, et autres
Publié: (2024)
Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation
par: Uehara, Kohei, et autres
Publié: (2024)
par: Uehara, Kohei, et autres
Publié: (2024)
Multi-View Reconstruction with Global Context for 3D Anomaly Detection
par: Sun, Yihan, et autres
Publié: (2025)
par: Sun, Yihan, et autres
Publié: (2025)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Boosting Global-Local Feature Matching via Anomaly Synthesis for Multi-Class Point Cloud Anomaly Detection
par: Cheng, Yuqi, et autres
Publié: (2025)
par: Cheng, Yuqi, et autres
Publié: (2025)
Prototypical Learning Guided Context-Aware Segmentation Network for Few-Shot Anomaly Detection
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection
par: Gu, Yao, et autres
Publié: (2026)
par: Gu, Yao, et autres
Publié: (2026)
Leveraging Learning Bias for Noisy Anomaly Detection
par: Zhang, Yuxin, et autres
Publié: (2025)
par: Zhang, Yuxin, et autres
Publié: (2025)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Prior Normality Prompt Transformer for Multi-class Industrial Image Anomaly Detection
par: Yao, Haiming, et autres
Publié: (2024)
par: Yao, Haiming, et autres
Publié: (2024)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
par: Li, Shuang, et autres
Publié: (2024)
par: Li, Shuang, et autres
Publié: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
IAD-R1: Reinforcing Consistent Reasoning in Industrial Anomaly Detection
par: Li, Yanhui, et autres
Publié: (2025)
par: Li, Yanhui, et autres
Publié: (2025)
Learning to Tell Apart: Weakly Supervised Video Anomaly Detection via Disentangled Semantic Alignment
par: Yin, Wenti, et autres
Publié: (2025)
par: Yin, Wenti, et autres
Publié: (2025)
Towards Zero-shot Point Cloud Anomaly Detection: A Multi-View Projection Framework
par: Cheng, Yuqi, et autres
Publié: (2024)
par: Cheng, Yuqi, et autres
Publié: (2024)
RAD: A Comprehensive Dataset for Benchmarking the Robustness of Image Anomaly Detection
par: Cheng, Yuqi, et autres
Publié: (2024)
par: Cheng, Yuqi, et autres
Publié: (2024)
What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models
par: Zhang, Letian, et autres
Publié: (2023)
par: Zhang, Letian, et autres
Publié: (2023)
Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning
par: Chen, Peng, et autres
Publié: (2026)
par: Chen, Peng, et autres
Publié: (2026)
Segment Any Anomaly without Training via Hybrid Prompt Regularization
par: Cao, Yunkang, et autres
Publié: (2023)
par: Cao, Yunkang, et autres
Publié: (2023)
VTFusion: A Vision-Text Multimodal Fusion Network for Few-Shot Anomaly Detection
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
Photorealistic Phantom Roads in Real Scenes: Disentangling 3D Hallucinations from Physical Geometry
par: Nguyen, Hoang, et autres
Publié: (2025)
par: Nguyen, Hoang, et autres
Publié: (2025)
Documents similaires
-
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
par: Zhang, Huaxin, et autres
Publié: (2024) -
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
par: Zhang, Huaxin, et autres
Publié: (2024) -
A Survey on Visual Anomaly Detection: Challenge, Approach, and Prospect
par: Cao, Yunkang, et autres
Publié: (2024) -
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
par: Zhang, Huaxin, et autres
Publié: (2024) -
Complementary Pseudo Multimodal Feature for Point Cloud Anomaly Detection
par: Cao, Yunkang, et autres
Publié: (2023)