Infusing fine-grained visual knowledge to Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ypsilantis, Nikolaos-Antonios, Chen, Kaifeng, Araujo, André, Chum, Ondřej |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UDON: Universal Dynamic Online distillatioN for generic image representations
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024)
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024)
Co-Segmentation without any Pixel-level Supervision with Application to Large-Scale Sketch Classification
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024)
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024)
ILIAS: Instance-Level Image retrieval At Scale
di: Kordopatis-Zilos, Giorgos, et al.
Pubblicazione: (2025)
di: Kordopatis-Zilos, Giorgos, et al.
Pubblicazione: (2025)
Dark Side Augmentation: Generating Diverse Night Examples for Metric Learning
di: Mohwald, Albert, et al.
Pubblicazione: (2023)
di: Mohwald, Albert, et al.
Pubblicazione: (2023)
Crafting Distribution Shifts for Validation and Training in Single Source Domain Generalization
di: Efthymiadis, Nikos, et al.
Pubblicazione: (2024)
di: Efthymiadis, Nikos, et al.
Pubblicazione: (2024)
InPK: Infusing Prior Knowledge into Prompt for Vision-Language Models
di: Zhou, Shuchang, et al.
Pubblicazione: (2025)
di: Zhou, Shuchang, et al.
Pubblicazione: (2025)
Composed Image Retrieval for Training-Free Domain Conversion
di: Efthymiadis, Nikos, et al.
Pubblicazione: (2024)
di: Efthymiadis, Nikos, et al.
Pubblicazione: (2024)
Composed Image Retrieval for Remote Sensing
di: Psomas, Bill, et al.
Pubblicazione: (2024)
di: Psomas, Bill, et al.
Pubblicazione: (2024)
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
Learning Vision from Models Rivals Learning Vision from Data
di: Tian, Yonglong, et al.
Pubblicazione: (2023)
di: Tian, Yonglong, et al.
Pubblicazione: (2023)
Global-to-Local or Local-to-Global? Enhancing Image Retrieval with Efficient Local Search and Effective Global Re-ranking
di: Aiger, Dror, et al.
Pubblicazione: (2025)
di: Aiger, Dror, et al.
Pubblicazione: (2025)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
Instance-Level Composed Image Retrieval
di: Psomas, Bill, et al.
Pubblicazione: (2025)
di: Psomas, Bill, et al.
Pubblicazione: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
di: Chen, Honghao, et al.
Pubblicazione: (2025)
di: Chen, Honghao, et al.
Pubblicazione: (2025)
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Visual RAG: Expanding MLLM visual knowledge without fine-tuning
di: Bonomo, Mirco, et al.
Pubblicazione: (2025)
di: Bonomo, Mirco, et al.
Pubblicazione: (2025)
Koo-Fu CLIP: Closed-Form Adaptation of Vision-Language Models via Fukunaga-Koontz Linear Discriminant Analysis
di: Suchanek, Matej, et al.
Pubblicazione: (2026)
di: Suchanek, Matej, et al.
Pubblicazione: (2026)
Benchmarking Composed Image Retrieval for Applied Earth Observation
di: Psomas, Bill, et al.
Pubblicazione: (2026)
di: Psomas, Bill, et al.
Pubblicazione: (2026)
Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models
di: Sun, Yuhao, et al.
Pubblicazione: (2026)
di: Sun, Yuhao, et al.
Pubblicazione: (2026)
Demographic-aware fine-grained visual recognition of pediatric wrist pathologies
di: Ahmed, Ammar, et al.
Pubblicazione: (2025)
di: Ahmed, Ammar, et al.
Pubblicazione: (2025)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment
di: Cao, Bingyi, et al.
Pubblicazione: (2026)
di: Cao, Bingyi, et al.
Pubblicazione: (2026)
Yes, we CANN: Constrained Approximate Nearest Neighbors for local feature-based visual localization
di: Aiger, Dror, et al.
Pubblicazione: (2023)
di: Aiger, Dror, et al.
Pubblicazione: (2023)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
Vision Language Model for Interpretable and Fine-grained Detection of Safety Compliance in Diverse Workplaces
di: Chen, Zhiling, et al.
Pubblicazione: (2024)
di: Chen, Zhiling, et al.
Pubblicazione: (2024)
Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
Context-Infused Visual Grounding for Art
di: Khan, Selina, et al.
Pubblicazione: (2024)
di: Khan, Selina, et al.
Pubblicazione: (2024)
Is CLIP the main roadblock for fine-grained open-world perception?
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2024)
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
DAE-Net: Deforming Auto-Encoder for fine-grained shape co-segmentation
di: Chen, Zhiqin, et al.
Pubblicazione: (2023)
di: Chen, Zhiqin, et al.
Pubblicazione: (2023)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
di: Thoker, Fida Mohammad, et al.
Pubblicazione: (2025)
di: Thoker, Fida Mohammad, et al.
Pubblicazione: (2025)
Text-to-CAD Generation Through Infusing Visual Feedback in Large Language Models
di: Wang, Ruiyu, et al.
Pubblicazione: (2025)
di: Wang, Ruiyu, et al.
Pubblicazione: (2025)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
Specificity-aware reinforcement learning for fine-grained open-world classification
di: Angheben, Samuele, et al.
Pubblicazione: (2026)
di: Angheben, Samuele, et al.
Pubblicazione: (2026)
Large Language Models estimate fine-grained human color-concept associations
di: Mukherjee, Kushin, et al.
Pubblicazione: (2024)
di: Mukherjee, Kushin, et al.
Pubblicazione: (2024)
MExD: An Expert-Infused Diffusion Model for Whole-Slide Image Classification
di: Zhao, Jianwei, et al.
Pubblicazione: (2025)
di: Zhao, Jianwei, et al.
Pubblicazione: (2025)
Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention
di: Liu, Ying, et al.
Pubblicazione: (2024)
di: Liu, Ying, et al.
Pubblicazione: (2024)
An Inpainting-Infused Pipeline for Attire and Background Replacement
di: Perche-Mahlow, Felipe Rodrigues, et al.
Pubblicazione: (2024)
di: Perche-Mahlow, Felipe Rodrigues, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UDON: Universal Dynamic Online distillatioN for generic image representations
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024) -
Co-Segmentation without any Pixel-level Supervision with Application to Large-Scale Sketch Classification
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2024) -
ILIAS: Instance-Level Image retrieval At Scale
di: Kordopatis-Zilos, Giorgos, et al.
Pubblicazione: (2025) -
Dark Side Augmentation: Generating Diverse Night Examples for Metric Learning
di: Mohwald, Albert, et al.
Pubblicazione: (2023) -
Crafting Distribution Shifts for Validation and Training in Single Source Domain Generalization
di: Efthymiadis, Nikos, et al.
Pubblicazione: (2024)