Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Spinaci, Gianmarco, Klic, Lukas, Colavizza, Giovanni |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Large Language Models for Handwritten Text Recognition
par: Crosilla, Giorgia, et autres
Publié: (2025)
par: Crosilla, Giorgia, et autres
Publié: (2025)
FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model
par: Li, Yuanwei, et autres
Publié: (2024)
par: Li, Yuanwei, et autres
Publié: (2024)
Making Large Vision Language Models to be Good Few-shot Learners
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Few-shot Adaptation of Medical Vision-Language Models
par: Shakeri, Fereshteh, et autres
Publié: (2024)
par: Shakeri, Fereshteh, et autres
Publié: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
par: Aklilu, Josiah, et autres
Publié: (2024)
par: Aklilu, Josiah, et autres
Publié: (2024)
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
par: He, Xuehai, et autres
Publié: (2023)
par: He, Xuehai, et autres
Publié: (2023)
What Makes Good Few-shot Examples for Vision-Language Models?
par: Guo, Zhaojun, et autres
Publié: (2024)
par: Guo, Zhaojun, et autres
Publié: (2024)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
par: Cheng, Cheng, et autres
Publié: (2023)
par: Cheng, Cheng, et autres
Publié: (2023)
DiffCLIP: Few-shot Language-driven Multimodal Classifier
par: Zhang, Jiaqing, et autres
Publié: (2024)
par: Zhang, Jiaqing, et autres
Publié: (2024)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
par: Sakurai, Kosuke, et autres
Publié: (2025)
par: Sakurai, Kosuke, et autres
Publié: (2025)
Selective Vision-Language Subspace Projection for Few-shot CLIP
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models
par: Huang, Hao, et autres
Publié: (2025)
par: Huang, Hao, et autres
Publié: (2025)
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model
par: An, Zhaochong, et autres
Publié: (2025)
par: An, Zhaochong, et autres
Publié: (2025)
Label Propagation for Zero-shot Classification with Vision-Language Models
par: Stojnić, Vladan, et autres
Publié: (2024)
par: Stojnić, Vladan, et autres
Publié: (2024)
Boosting Audio-visual Zero-shot Learning with Large Language Models
par: Chen, Haoxing, et autres
Publié: (2023)
par: Chen, Haoxing, et autres
Publié: (2023)
Manifold Induced Biases for Zero-shot and Few-shot Detection of Generated Images
par: Brokman, Jonathan, et autres
Publié: (2025)
par: Brokman, Jonathan, et autres
Publié: (2025)
Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection
par: Tang, Lv, et autres
Publié: (2023)
par: Tang, Lv, et autres
Publié: (2023)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Zero-shot Generalizable Incremental Learning for Vision-Language Object Detection
par: Deng, Jieren, et autres
Publié: (2024)
par: Deng, Jieren, et autres
Publié: (2024)
Zero-shot image privacy classification with Vision-Language Models
par: Baia, Alina Elena, et autres
Publié: (2025)
par: Baia, Alina Elena, et autres
Publié: (2025)
Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models
par: Ding, Guodong, et autres
Publié: (2026)
par: Ding, Guodong, et autres
Publié: (2026)
FLIER: Few-shot Language Image Models Embedded with Latent Representations
par: Zhou, Zhinuo, et autres
Publié: (2024)
par: Zhou, Zhinuo, et autres
Publié: (2024)
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
par: Erzurumlu, Yunus Talha, et autres
Publié: (2026)
par: Erzurumlu, Yunus Talha, et autres
Publié: (2026)
Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model
par: Bui, Phuoc-Nguyen, et autres
Publié: (2025)
par: Bui, Phuoc-Nguyen, et autres
Publié: (2025)
Zero-shot Hazard Identification in Autonomous Driving: A Case Study on the COOOL Benchmark
par: Picek, Lukas, et autres
Publié: (2024)
par: Picek, Lukas, et autres
Publié: (2024)
LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?
par: Li, Bangyan, et autres
Publié: (2025)
par: Li, Bangyan, et autres
Publié: (2025)
Unified Language-driven Zero-shot Domain Adaptation
par: Yang, Senqiao, et autres
Publié: (2024)
par: Yang, Senqiao, et autres
Publié: (2024)
Towards Zero-shot Human-Object Interaction Detection via Vision-Language Integration
par: Xue, Weiying, et autres
Publié: (2024)
par: Xue, Weiying, et autres
Publié: (2024)
RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Models
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation
par: Wang, Jin, et autres
Publié: (2025)
par: Wang, Jin, et autres
Publié: (2025)
Vocabulary-free few-shot learning for Vision-Language Models
par: Zanella, Maxime, et autres
Publié: (2025)
par: Zanella, Maxime, et autres
Publié: (2025)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
Zero-shot detection of buildings in mobile LiDAR using Language Vision Model
par: Goo, June Moh, et autres
Publié: (2024)
par: Goo, June Moh, et autres
Publié: (2024)
Vision-aware Multimodal Prompt Tuning for Uploadable Multi-source Few-shot Domain Adaptation
par: Liu, Kuanghong, et autres
Publié: (2025)
par: Liu, Kuanghong, et autres
Publié: (2025)
Language-Inspired Relation Transfer for Few-shot Class-Incremental Learning
par: Zhao, Yifan, et autres
Publié: (2025)
par: Zhao, Yifan, et autres
Publié: (2025)
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
Exploring Fine-grained Retail Product Discrimination with Zero-shot Object Classification Using Vision-Language Models
par: Tur, Anil Osman, et autres
Publié: (2024)
par: Tur, Anil Osman, et autres
Publié: (2024)
Few-shot Object Localization
par: Ren, Yunhan, et autres
Publié: (2024)
par: Ren, Yunhan, et autres
Publié: (2024)
Documents similaires
-
Benchmarking Large Language Models for Handwritten Text Recognition
par: Crosilla, Giorgia, et autres
Publié: (2025) -
FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model
par: Li, Yuanwei, et autres
Publié: (2024) -
Making Large Vision Language Models to be Good Few-shot Learners
par: Liu, Fan, et autres
Publié: (2024) -
Few-shot Adaptation of Medical Vision-Language Models
par: Shakeri, Fereshteh, et autres
Publié: (2024) -
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
par: Aklilu, Josiah, et autres
Publié: (2024)