Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Demidov, Dmitry, Zaheer, Zaigham, Thawakar, Omkar, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
par: Demidov, Dmitry, et autres
Publié: (2025)
par: Demidov, Dmitry, et autres
Publié: (2025)
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023)
par: Thawakar, Omkar, et autres
Publié: (2023)
Dynamic Pre-training: Towards Efficient and Scalable All-in-One Image Restoration
par: Dudhane, Akshay, et autres
Publié: (2024)
par: Dudhane, Akshay, et autres
Publié: (2024)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
par: Demidov, Dmitry, et autres
Publié: (2023)
par: Demidov, Dmitry, et autres
Publié: (2023)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
par: Nawaz, Umair, et autres
Publié: (2025)
par: Nawaz, Umair, et autres
Publié: (2025)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
How Good is my Histopathology Vision-Language Foundation Model? A Holistic Benchmark
par: Majzoub, Roba Al, et autres
Publié: (2025)
par: Majzoub, Roba Al, et autres
Publié: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024)
par: Chen, Shiming, et autres
Publié: (2024)
DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
par: Patle, Shubham, et autres
Publié: (2026)
par: Patle, Shubham, et autres
Publié: (2026)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Towards Evaluating the Robustness of Visual State Space Models
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
par: Ghaboura, Sara, et autres
Publié: (2025)
par: Ghaboura, Sara, et autres
Publié: (2025)
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
Enhancing Novel Object Detection via Cooperative Foundational Models
par: Bharadwaj, Rohit, et autres
Publié: (2023)
par: Bharadwaj, Rohit, et autres
Publié: (2023)
GroupMamba: Efficient Group-Based Visual State Space Model
par: Shaker, Abdelrahman, et autres
Publié: (2024)
par: Shaker, Abdelrahman, et autres
Publié: (2024)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
par: Li, Senmao, et autres
Publié: (2025)
par: Li, Senmao, et autres
Publié: (2025)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024)
par: Dharmasiri, Amaya, et autres
Publié: (2024)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
par: Dissanayake, Dinura, et autres
Publié: (2025)
par: Dissanayake, Dinura, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
Concept Drift and Long-Tailed Distribution in Fine-Grained Visual Categorization: Benchmark and Method
par: Ye, Shuo, et autres
Publié: (2023)
par: Ye, Shuo, et autres
Publié: (2023)
Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device
par: Shaker, Abdelrahman, et autres
Publié: (2026)
par: Shaker, Abdelrahman, et autres
Publié: (2026)
CoVR-R:Reason-Aware Composed Video Retrieval
par: Thawakar, Omkar, et autres
Publié: (2026)
par: Thawakar, Omkar, et autres
Publié: (2026)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024)
par: Watawana, Hasindri, et autres
Publié: (2024)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
Distilling Local Texture Features for Colorectal Tissue Classification in Low Data Regimes
par: Demidov, Dmitry, et autres
Publié: (2024)
par: Demidov, Dmitry, et autres
Publié: (2024)
OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents
par: Shabbir, Akashah, et autres
Publié: (2026)
par: Shabbir, Akashah, et autres
Publié: (2026)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
par: Gani, Hanan, et autres
Publié: (2024)
par: Gani, Hanan, et autres
Publié: (2024)
Documents similaires
-
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
par: Demidov, Dmitry, et autres
Publié: (2025) -
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
par: Thawakar, Omkar, et autres
Publié: (2025) -
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
par: Thawakar, Omkar, et autres
Publié: (2024) -
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023) -
Dynamic Pre-training: Towards Efficient and Scalable All-in-One Image Restoration
par: Dudhane, Akshay, et autres
Publié: (2024)