Zero-shot image privacy classification with Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Baia, Alina Elena, Xompero, Alessio, Cavallaro, Andrea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-modal Counterfactual Explanations: Uncovering Decision Factors and Dataset Biases in Subjective Classification
di: Baia, Alina Elena, et al.
Pubblicazione: (2025)
di: Baia, Alina Elena, et al.
Pubblicazione: (2025)
Image-guided topic modeling for interpretable privacy classification
di: Baia, Alina Elena, et al.
Pubblicazione: (2024)
di: Baia, Alina Elena, et al.
Pubblicazione: (2024)
Learning Privacy from Visual Entities
di: Xompero, Alessio, et al.
Pubblicazione: (2025)
di: Xompero, Alessio, et al.
Pubblicazione: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
di: Farina, Matteo, et al.
Pubblicazione: (2025)
di: Farina, Matteo, et al.
Pubblicazione: (2025)
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
di: Tong, Yijie, et al.
Pubblicazione: (2026)
di: Tong, Yijie, et al.
Pubblicazione: (2026)
SIDA: Synthetic Image Driven Zero-shot Domain Adaptation
di: Kim, Ye-Chan, et al.
Pubblicazione: (2025)
di: Kim, Ye-Chan, et al.
Pubblicazione: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
Language Models as Black-Box Optimizers for Vision-Language Models
di: Liu, Shihong, et al.
Pubblicazione: (2023)
di: Liu, Shihong, et al.
Pubblicazione: (2023)
Detecting Content Rating Violations in Android Applications: A Vision-Language Approach
di: Denipitiyage, D., et al.
Pubblicazione: (2025)
di: Denipitiyage, D., et al.
Pubblicazione: (2025)
Explaining models relating objects and privacy
di: Xompero, Alessio, et al.
Pubblicazione: (2024)
di: Xompero, Alessio, et al.
Pubblicazione: (2024)
Modularized Zero-shot VQA with Pre-trained Models
di: Cao, Rui, et al.
Pubblicazione: (2023)
di: Cao, Rui, et al.
Pubblicazione: (2023)
Bridging Compressed Image Latents and Multimodal Large Language Models
di: Kao, Chia-Hao, et al.
Pubblicazione: (2024)
di: Kao, Chia-Hao, et al.
Pubblicazione: (2024)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
InvZW: Invariant Feature Learning via Noise-Adversarial Training for Robust Image Zero-Watermarking
di: Tanvir, Abdullah All, et al.
Pubblicazione: (2025)
di: Tanvir, Abdullah All, et al.
Pubblicazione: (2025)
Audio-visual Generalized Zero-shot Learning the Easy Way
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
di: Shen, Chengchao, et al.
Pubblicazione: (2025)
di: Shen, Chengchao, et al.
Pubblicazione: (2025)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
di: Lin, Xiang, et al.
Pubblicazione: (2025)
di: Lin, Xiang, et al.
Pubblicazione: (2025)
Reducing Hallucinations in Vision-Language Models via Latent Space Steering
di: Liu, Sheng, et al.
Pubblicazione: (2024)
di: Liu, Sheng, et al.
Pubblicazione: (2024)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
di: Zhang, Yabin, et al.
Pubblicazione: (2024)
Learning from Mistakes: Self-Regularizing Hierarchical Representations in Point Cloud Semantic Segmentation
di: Camuffo, Elena, et al.
Pubblicazione: (2023)
di: Camuffo, Elena, et al.
Pubblicazione: (2023)
Data relativistic uncertainty framework for low-illumination anime scenery image enhancement
di: Gao, Yiquan, et al.
Pubblicazione: (2025)
di: Gao, Yiquan, et al.
Pubblicazione: (2025)
CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language Alignment
di: Javed, Sajid, et al.
Pubblicazione: (2024)
di: Javed, Sajid, et al.
Pubblicazione: (2024)
GAIA: Zero-shot Talking Avatar Generation
di: He, Tianyu, et al.
Pubblicazione: (2023)
di: He, Tianyu, et al.
Pubblicazione: (2023)
The impact of abstract and object tags on image privacy classification
di: Baranouskaya, Darya, et al.
Pubblicazione: (2025)
di: Baranouskaya, Darya, et al.
Pubblicazione: (2025)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
di: Chen, Junyi, et al.
Pubblicazione: (2023)
di: Chen, Junyi, et al.
Pubblicazione: (2023)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
di: Deng, Ailin, et al.
Pubblicazione: (2025)
di: Deng, Ailin, et al.
Pubblicazione: (2025)
Black-box Attacks on Image Activity Prediction and its Natural Language Explanations
di: Baia, Alina Elena, et al.
Pubblicazione: (2023)
di: Baia, Alina Elena, et al.
Pubblicazione: (2023)
Who Brings the Frisbee: Probing Hidden Hallucination Factors in Large Vision-Language Model via Causality Analysis
di: Huang, Po-Hsuan, et al.
Pubblicazione: (2024)
di: Huang, Po-Hsuan, et al.
Pubblicazione: (2024)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
di: Zhang, Renrui, et al.
Pubblicazione: (2023)
di: Zhang, Renrui, et al.
Pubblicazione: (2023)
GroMo: Plant Growth Modeling with Multiview Images
di: Bhatt, Ruchi, et al.
Pubblicazione: (2025)
di: Bhatt, Ruchi, et al.
Pubblicazione: (2025)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024)
di: Liu, Luping, et al.
Pubblicazione: (2024)
Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies
di: Smith, Megan, et al.
Pubblicazione: (2026)
di: Smith, Megan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Cross-modal Counterfactual Explanations: Uncovering Decision Factors and Dataset Biases in Subjective Classification
di: Baia, Alina Elena, et al.
Pubblicazione: (2025) -
Image-guided topic modeling for interpretable privacy classification
di: Baia, Alina Elena, et al.
Pubblicazione: (2024) -
Learning Privacy from Visual Entities
di: Xompero, Alessio, et al.
Pubblicazione: (2025) -
Unveiling the Visual Counting Bottleneck in Vision-Language Models
di: Pang, Xingzhou, et al.
Pubblicazione: (2026) -
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
di: Farina, Matteo, et al.
Pubblicazione: (2025)