Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zhenlin, Zhu, Yi, Deng, Tiffany, Mittal, Abhay, Chen, Yanbei, Wang, Manchen, Favaro, Paolo, Tighe, Joseph, Modolo, Davide |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Multi-Object Tracking with Path Consistency
di: Lu, Zijia, et al.
Pubblicazione: (2024)
di: Lu, Zijia, et al.
Pubblicazione: (2024)
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2026)
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2026)
Hyperbolic Learning with Synthetic Captions for Open-World Detection
di: Kong, Fanjie, et al.
Pubblicazione: (2024)
di: Kong, Fanjie, et al.
Pubblicazione: (2024)
Invert2Restore: Zero-Shot Degradation-Blind Image Restoration
di: Chihaoui, Hamadi, et al.
Pubblicazione: (2025)
di: Chihaoui, Hamadi, et al.
Pubblicazione: (2025)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
di: Zhu, Yinglian, et al.
Pubblicazione: (2025)
di: Zhu, Yinglian, et al.
Pubblicazione: (2025)
Visuo-Tactile Zero-Shot Object Recognition with Vision-Language Model
di: Ueda, Shiori, et al.
Pubblicazione: (2024)
di: Ueda, Shiori, et al.
Pubblicazione: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Continual Learning Improves Zero-Shot Action Recognition
di: Gowda, Shreyank N, et al.
Pubblicazione: (2024)
di: Gowda, Shreyank N, et al.
Pubblicazione: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
di: Wang, Ning, et al.
Pubblicazione: (2025)
di: Wang, Ning, et al.
Pubblicazione: (2025)
Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval
di: Jiang, Lin, et al.
Pubblicazione: (2026)
di: Jiang, Lin, et al.
Pubblicazione: (2026)
EmoCLIP: A Vision-Language Method for Zero-Shot Video Facial Expression Recognition
di: Foteinopoulou, Niki Maria, et al.
Pubblicazione: (2023)
di: Foteinopoulou, Niki Maria, et al.
Pubblicazione: (2023)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
di: Ranasinghe, Yasiru, et al.
Pubblicazione: (2025)
di: Ranasinghe, Yasiru, et al.
Pubblicazione: (2025)
Zero-Shot Goal Recognition with Large Language Models
di: Gusmão, Kin Max Piamolini, et al.
Pubblicazione: (2026)
di: Gusmão, Kin Max Piamolini, et al.
Pubblicazione: (2026)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
di: Deng, Hanqiu, et al.
Pubblicazione: (2023)
di: Deng, Hanqiu, et al.
Pubblicazione: (2023)
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
di: Sajib, Rakib Hossain, et al.
Pubblicazione: (2026)
di: Sajib, Rakib Hossain, et al.
Pubblicazione: (2026)
Computer Use at the Edge of the Statistical Precipice
di: D'Oro, Pierluca, et al.
Pubblicazione: (2026)
di: D'Oro, Pierluca, et al.
Pubblicazione: (2026)
Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance
di: Liu, Hui, et al.
Pubblicazione: (2025)
di: Liu, Hui, et al.
Pubblicazione: (2025)
SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models
di: Miller, Kevin, et al.
Pubblicazione: (2025)
di: Miller, Kevin, et al.
Pubblicazione: (2025)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
Open-Pose 3D Zero-Shot Learning: Benchmark and Challenges
di: Zhao, Weiguang, et al.
Pubblicazione: (2023)
di: Zhao, Weiguang, et al.
Pubblicazione: (2023)
Large Language Models for Zero-Shot Multicultural Name Recognition
di: Phonchai, Thanakorn, et al.
Pubblicazione: (2025)
di: Phonchai, Thanakorn, et al.
Pubblicazione: (2025)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
di: Chen, Kehan, et al.
Pubblicazione: (2024)
di: Chen, Kehan, et al.
Pubblicazione: (2024)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2023)
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2023)
BoostTaxo: Zero-Shot Taxonomy Induction via Boosting-Style Agentic Reasoning and Constraint-Aware Calibration
di: Ling, Yancheng, et al.
Pubblicazione: (2026)
di: Ling, Yancheng, et al.
Pubblicazione: (2026)
Text-Enhanced Zero-Shot Action Recognition: A training-free approach
di: Bosetti, Massimo, et al.
Pubblicazione: (2024)
di: Bosetti, Massimo, et al.
Pubblicazione: (2024)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
di: Zhu, Han, et al.
Pubblicazione: (2024)
di: Zhu, Han, et al.
Pubblicazione: (2024)
Grounding Descriptions in Images informs Zero-Shot Visual Recognition
di: Halbe, Shaunak, et al.
Pubblicazione: (2024)
di: Halbe, Shaunak, et al.
Pubblicazione: (2024)
Zero-Shot Underwater Gesture Recognition
di: Sarma, Sandipan, et al.
Pubblicazione: (2024)
di: Sarma, Sandipan, et al.
Pubblicazione: (2024)
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
di: Guang, Jiahui, et al.
Pubblicazione: (2026)
MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification
di: Nguyen, Anh-Tien, et al.
Pubblicazione: (2025)
di: Nguyen, Anh-Tien, et al.
Pubblicazione: (2025)
Chapter Libero riuso delle immagini del patrimonio culturale pubblico: profili di compatibilità con il codice dei beni culturali e del paesaggio
di: Modolo, Mirco
Pubblicazione: (2025)
di: Modolo, Mirco
Pubblicazione: (2025)
Participación política de los migrantes. Reflexiones sobre la extensión de la ciudadanía en Argentina
di: Vanina Modolo
Pubblicazione: (2014)
di: Vanina Modolo
Pubblicazione: (2014)
Agraciamento da Grande Medalha da Inconfidência a João Stédile sob a perspectiva da Linguística Sistêmico-funcional
di: Marcelo Módolo
Pubblicazione: (2016)
di: Marcelo Módolo
Pubblicazione: (2016)
Manuscrito setecentista da Vila Real de Sabará
di: Marcelo Módolo
Pubblicazione: (2023)
di: Marcelo Módolo
Pubblicazione: (2023)
Reseña de "A idade de ouro do Brasil: dores de crescimento de uma sociedade colonial" de Charles Ralph Boxer
di: Marcelo Módolo
Pubblicazione: (2002)
di: Marcelo Módolo
Pubblicazione: (2002)
Revisão sistemática sobre o processo de ensino e de análise do goleiro de handebol
di: Felipe Modolo
Pubblicazione: (2018)
di: Felipe Modolo
Pubblicazione: (2018)
Características técnico-táticas dos goleiros de handebol da categoria sub-16: opinião de treinadores brasileiros
di: F. Modolo
Pubblicazione: (2019)
di: F. Modolo
Pubblicazione: (2019)
Reseña de "La construcción social del sujeto migrante en América Latina. Prácticas, representaciones y categorías" de Bela Feldman-Bianco, Liliana Rivera Sánchez, Carolina Stefoni y Marta Inés Villa Martínez (COMPILADORAS)
di: Vanina Modolo
Pubblicazione: (2012)
di: Vanina Modolo
Pubblicazione: (2012)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Self-Supervised Multi-Object Tracking with Path Consistency
di: Lu, Zijia, et al.
Pubblicazione: (2024) -
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2026) -
Hyperbolic Learning with Synthetic Captions for Open-World Detection
di: Kong, Fanjie, et al.
Pubblicazione: (2024) -
Invert2Restore: Zero-Shot Degradation-Blind Image Restoration
di: Chihaoui, Hamadi, et al.
Pubblicazione: (2025) -
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
di: Zhu, Yinglian, et al.
Pubblicazione: (2025)