CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Appiani, Andrea, Beyan, Cigdem |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MadCLIP: Few-shot Medical Anomaly Detection with CLIP
di: Shiri, Mahshid, et al.
Pubblicazione: (2025)
di: Shiri, Mahshid, et al.
Pubblicazione: (2025)
MADPOT: Medical Anomaly Detection with CLIP Adaptation and Partial Optimal Transport
di: Shiri, Mahshid, et al.
Pubblicazione: (2025)
di: Shiri, Mahshid, et al.
Pubblicazione: (2025)
HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA
di: Dibitonto, Francesco, et al.
Pubblicazione: (2026)
di: Dibitonto, Francesco, et al.
Pubblicazione: (2026)
Upper-Body Pose-based Gaze Estimation for Privacy-Preserving 3D Gaze Target Detection
di: Toaiari, Andrea, et al.
Pubblicazione: (2024)
di: Toaiari, Andrea, et al.
Pubblicazione: (2024)
Discriminator-Guided Adaptive Diffusion for Source-Free Test-Time Adaptation under Image Corruptions
di: Olivato, Francesco, et al.
Pubblicazione: (2026)
di: Olivato, Francesco, et al.
Pubblicazione: (2026)
Geometry-Conditioned Diffusion for Occlusion-Robust In-Bed Pose Estimation
di: Khameneh, Navid Aslankhani, et al.
Pubblicazione: (2026)
di: Khameneh, Navid Aslankhani, et al.
Pubblicazione: (2026)
Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection
di: Tonini, Francesco, et al.
Pubblicazione: (2025)
di: Tonini, Francesco, et al.
Pubblicazione: (2025)
AL-GTD: Deep Active Learning for Gaze Target Detection
di: Tonini, Francesco, et al.
Pubblicazione: (2024)
di: Tonini, Francesco, et al.
Pubblicazione: (2024)
Exploring Fine-grained Retail Product Discrimination with Zero-shot Object Classification Using Vision-Language Models
di: Tur, Anil Osman, et al.
Pubblicazione: (2024)
di: Tur, Anil Osman, et al.
Pubblicazione: (2024)
Towards Unconstrained Human-Object Interaction
di: Tonini, Francesco, et al.
Pubblicazione: (2026)
di: Tonini, Francesco, et al.
Pubblicazione: (2026)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
di: Ding, Zongcan, et al.
Pubblicazione: (2025)
di: Ding, Zongcan, et al.
Pubblicazione: (2025)
Anticipating Next Active Objects for Egocentric Videos
di: Thakur, Sanket, et al.
Pubblicazione: (2023)
di: Thakur, Sanket, et al.
Pubblicazione: (2023)
Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment
di: Yu, Fanqi, et al.
Pubblicazione: (2026)
di: Yu, Fanqi, et al.
Pubblicazione: (2026)
ComplexVAD: Detecting Interaction Anomalies in Video
di: Mumcu, Furkan, et al.
Pubblicazione: (2025)
di: Mumcu, Furkan, et al.
Pubblicazione: (2025)
TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection
di: Chen, Hanning, et al.
Pubblicazione: (2024)
di: Chen, Hanning, et al.
Pubblicazione: (2024)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
di: Lan, Mengcheng, et al.
Pubblicazione: (2024)
di: Lan, Mengcheng, et al.
Pubblicazione: (2024)
EventVAD: Training-Free Event-Aware Video Anomaly Detection
di: Shao, Yihua, et al.
Pubblicazione: (2025)
di: Shao, Yihua, et al.
Pubblicazione: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
di: Gu, Zhaopeng, et al.
Pubblicazione: (2024)
di: Gu, Zhaopeng, et al.
Pubblicazione: (2024)
HyCoVAD: A Hybrid SSL-LLM Model for Complex Video Anomaly Detection
di: Hemmatyar, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Hemmatyar, Mohammad Mahdi, et al.
Pubblicazione: (2025)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
GlanceVAD: Exploring Glance Supervision for Label-efficient Video Anomaly Detection
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging
di: Imam, Raza, et al.
Pubblicazione: (2024)
di: Imam, Raza, et al.
Pubblicazione: (2024)
DUAL-VAD: Dual Benchmarks and Anomaly-Focused Sampling for Video Anomaly Detection
di: Jung, Seoik, et al.
Pubblicazione: (2025)
di: Jung, Seoik, et al.
Pubblicazione: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
di: Liu, Fan, et al.
Pubblicazione: (2023)
di: Liu, Fan, et al.
Pubblicazione: (2023)
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
di: Xiong, Zhitong, et al.
Pubblicazione: (2025)
di: Xiong, Zhitong, et al.
Pubblicazione: (2025)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
di: Gao, Peng, et al.
Pubblicazione: (2021)
di: Gao, Peng, et al.
Pubblicazione: (2021)
Joint Vision-Language Social Bias Removal for CLIP
di: Zhang, Haoyu, et al.
Pubblicazione: (2024)
di: Zhang, Haoyu, et al.
Pubblicazione: (2024)
FairCLIP: Harnessing Fairness in Vision-Language Learning
di: Luo, Yan, et al.
Pubblicazione: (2024)
di: Luo, Yan, et al.
Pubblicazione: (2024)
RefineVAD: Semantic-Guided Feature Recalibration for Weakly Supervised Video Anomaly Detection
di: Lee, Junhee, et al.
Pubblicazione: (2025)
di: Lee, Junhee, et al.
Pubblicazione: (2025)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
di: Jha, Saurav, et al.
Pubblicazione: (2024)
di: Jha, Saurav, et al.
Pubblicazione: (2024)
CLIP-HandID: Vision-Language Model for Hand-Based Person Identification
di: Baisa, Nathanael L., et al.
Pubblicazione: (2025)
di: Baisa, Nathanael L., et al.
Pubblicazione: (2025)
NudgeVAD: Language-Nudged End-to-End Driving via FiLM Residuals
di: Yang, Chieh-Chi, et al.
Pubblicazione: (2026)
di: Yang, Chieh-Chi, et al.
Pubblicazione: (2026)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
di: Zhu, Lei, et al.
Pubblicazione: (2025)
di: Zhu, Lei, et al.
Pubblicazione: (2025)
CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification
di: Zhao, Huazhong, et al.
Pubblicazione: (2025)
di: Zhao, Huazhong, et al.
Pubblicazione: (2025)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
RWKV-CLIP: A Robust Vision-Language Representation Learner
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
ProDisc-VAD: An Efficient System for Weakly-Supervised Anomaly Detection in Video Surveillance Applications
di: Zhu, Tao, et al.
Pubblicazione: (2025)
di: Zhu, Tao, et al.
Pubblicazione: (2025)
SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere
di: Huang, Chao, et al.
Pubblicazione: (2026)
di: Huang, Chao, et al.
Pubblicazione: (2026)
Envisioning MedCLIP: A Deep Dive into Explainability for Medical Vision-Language Models
di: Hashmi, Anees Ur Rehman, et al.
Pubblicazione: (2024)
di: Hashmi, Anees Ur Rehman, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MadCLIP: Few-shot Medical Anomaly Detection with CLIP
di: Shiri, Mahshid, et al.
Pubblicazione: (2025) -
MADPOT: Medical Anomaly Detection with CLIP Adaptation and Partial Optimal Transport
di: Shiri, Mahshid, et al.
Pubblicazione: (2025) -
HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA
di: Dibitonto, Francesco, et al.
Pubblicazione: (2026) -
Upper-Body Pose-based Gaze Estimation for Privacy-Preserving 3D Gaze Target Detection
di: Toaiari, Andrea, et al.
Pubblicazione: (2024) -
Discriminator-Guided Adaptive Diffusion for Source-Free Test-Time Adaptation under Image Corruptions
di: Olivato, Francesco, et al.
Pubblicazione: (2026)