Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Zhenlin, Zhu, Yi, Deng, Tiffany, Mittal, Abhay, Chen, Yanbei, Wang, Manchen, Favaro, Paolo, Tighe, Joseph, Modolo, Davide |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised Multi-Object Tracking with Path Consistency
par: Lu, Zijia, et autres
Publié: (2024)
par: Lu, Zijia, et autres
Publié: (2024)
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
par: Yeh, Chun-Hsiao, et autres
Publié: (2026)
par: Yeh, Chun-Hsiao, et autres
Publié: (2026)
Hyperbolic Learning with Synthetic Captions for Open-World Detection
par: Kong, Fanjie, et autres
Publié: (2024)
par: Kong, Fanjie, et autres
Publié: (2024)
Invert2Restore: Zero-Shot Degradation-Blind Image Restoration
par: Chihaoui, Hamadi, et autres
Publié: (2025)
par: Chihaoui, Hamadi, et autres
Publié: (2025)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
par: Zhu, Yinglian, et autres
Publié: (2025)
par: Zhu, Yinglian, et autres
Publié: (2025)
Visuo-Tactile Zero-Shot Object Recognition with Vision-Language Model
par: Ueda, Shiori, et autres
Publié: (2024)
par: Ueda, Shiori, et autres
Publié: (2024)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
par: Nagar, Aishik, et autres
Publié: (2024)
par: Nagar, Aishik, et autres
Publié: (2024)
Continual Learning Improves Zero-Shot Action Recognition
par: Gowda, Shreyank N, et autres
Publié: (2024)
par: Gowda, Shreyank N, et autres
Publié: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
par: Wang, Ning, et autres
Publié: (2025)
par: Wang, Ning, et autres
Publié: (2025)
Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval
par: Jiang, Lin, et autres
Publié: (2026)
par: Jiang, Lin, et autres
Publié: (2026)
EmoCLIP: A Vision-Language Method for Zero-Shot Video Facial Expression Recognition
par: Foteinopoulou, Niki Maria, et autres
Publié: (2023)
par: Foteinopoulou, Niki Maria, et autres
Publié: (2023)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
par: Ranasinghe, Yasiru, et autres
Publié: (2025)
par: Ranasinghe, Yasiru, et autres
Publié: (2025)
Zero-Shot Goal Recognition with Large Language Models
par: Gusmão, Kin Max Piamolini, et autres
Publié: (2026)
par: Gusmão, Kin Max Piamolini, et autres
Publié: (2026)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
par: Deng, Hanqiu, et autres
Publié: (2023)
par: Deng, Hanqiu, et autres
Publié: (2023)
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
par: Sajib, Rakib Hossain, et autres
Publié: (2026)
par: Sajib, Rakib Hossain, et autres
Publié: (2026)
Computer Use at the Edge of the Statistical Precipice
par: D'Oro, Pierluca, et autres
Publié: (2026)
par: D'Oro, Pierluca, et autres
Publié: (2026)
Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models
par: Miller, Kevin, et autres
Publié: (2025)
par: Miller, Kevin, et autres
Publié: (2025)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
par: Sharma, Saurav, et autres
Publié: (2025)
par: Sharma, Saurav, et autres
Publié: (2025)
Open-Pose 3D Zero-Shot Learning: Benchmark and Challenges
par: Zhao, Weiguang, et autres
Publié: (2023)
par: Zhao, Weiguang, et autres
Publié: (2023)
Large Language Models for Zero-Shot Multicultural Name Recognition
par: Phonchai, Thanakorn, et autres
Publié: (2025)
par: Phonchai, Thanakorn, et autres
Publié: (2025)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
par: Chen, Kehan, et autres
Publié: (2024)
par: Chen, Kehan, et autres
Publié: (2024)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
par: Zhang, Zhaoyang, et autres
Publié: (2023)
par: Zhang, Zhaoyang, et autres
Publié: (2023)
BoostTaxo: Zero-Shot Taxonomy Induction via Boosting-Style Agentic Reasoning and Constraint-Aware Calibration
par: Ling, Yancheng, et autres
Publié: (2026)
par: Ling, Yancheng, et autres
Publié: (2026)
Text-Enhanced Zero-Shot Action Recognition: A training-free approach
par: Bosetti, Massimo, et autres
Publié: (2024)
par: Bosetti, Massimo, et autres
Publié: (2024)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
par: Zhu, Han, et autres
Publié: (2024)
par: Zhu, Han, et autres
Publié: (2024)
Grounding Descriptions in Images informs Zero-Shot Visual Recognition
par: Halbe, Shaunak, et autres
Publié: (2024)
par: Halbe, Shaunak, et autres
Publié: (2024)
Zero-Shot Underwater Gesture Recognition
par: Sarma, Sandipan, et autres
Publié: (2024)
par: Sarma, Sandipan, et autres
Publié: (2024)
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
par: Guang, Jiahui, et autres
Publié: (2026)
par: Guang, Jiahui, et autres
Publié: (2026)
MGPATH: Vision-Language Model with Multi-Granular Prompt Learning for Few-Shot WSI Classification
par: Nguyen, Anh-Tien, et autres
Publié: (2025)
par: Nguyen, Anh-Tien, et autres
Publié: (2025)
Chapter Libero riuso delle immagini del patrimonio culturale pubblico: profili di compatibilità con il codice dei beni culturali e del paesaggio
par: Modolo, Mirco
Publié: (2025)
par: Modolo, Mirco
Publié: (2025)
Participación política de los migrantes. Reflexiones sobre la extensión de la ciudadanía en Argentina
par: Vanina Modolo
Publié: (2014)
par: Vanina Modolo
Publié: (2014)
Agraciamento da Grande Medalha da Inconfidência a João Stédile sob a perspectiva da Linguística Sistêmico-funcional
par: Marcelo Módolo
Publié: (2016)
par: Marcelo Módolo
Publié: (2016)
Manuscrito setecentista da Vila Real de Sabará
par: Marcelo Módolo
Publié: (2023)
par: Marcelo Módolo
Publié: (2023)
Reseña de "A idade de ouro do Brasil: dores de crescimento de uma sociedade colonial" de Charles Ralph Boxer
par: Marcelo Módolo
Publié: (2002)
par: Marcelo Módolo
Publié: (2002)
Revisão sistemática sobre o processo de ensino e de análise do goleiro de handebol
par: Felipe Modolo
Publié: (2018)
par: Felipe Modolo
Publié: (2018)
Características técnico-táticas dos goleiros de handebol da categoria sub-16: opinião de treinadores brasileiros
par: F. Modolo
Publié: (2019)
par: F. Modolo
Publié: (2019)
Reseña de "La construcción social del sujeto migrante en América Latina. Prácticas, representaciones y categorías" de Bela Feldman-Bianco, Liliana Rivera Sánchez, Carolina Stefoni y Marta Inés Villa Martínez (COMPILADORAS)
par: Vanina Modolo
Publié: (2012)
par: Vanina Modolo
Publié: (2012)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
par: Salman, Shaeke, et autres
Publié: (2024)
par: Salman, Shaeke, et autres
Publié: (2024)
Documents similaires
-
Self-Supervised Multi-Object Tracking with Path Consistency
par: Lu, Zijia, et autres
Publié: (2024) -
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
par: Yeh, Chun-Hsiao, et autres
Publié: (2026) -
Hyperbolic Learning with Synthetic Captions for Open-World Detection
par: Kong, Fanjie, et autres
Publié: (2024) -
Invert2Restore: Zero-Shot Degradation-Blind Image Restoration
par: Chihaoui, Hamadi, et autres
Publié: (2025) -
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
par: Zhu, Yinglian, et autres
Publié: (2025)