Is CLIP the main roadblock for fine-grained open-world perception?
Fuente:
arXiv
Salvato in:
| Autori principali: | Bianchi, Lorenzo, Carrara, Fabio, Messina, Nicola, Falchi, Fabrizio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2023)
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2023)
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2025)
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
di: Barsellotti, Luca, et al.
Pubblicazione: (2024)
di: Barsellotti, Luca, et al.
Pubblicazione: (2024)
CountingDINO: A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones
di: Pacini, Giacomo, et al.
Pubblicazione: (2025)
di: Pacini, Giacomo, et al.
Pubblicazione: (2025)
Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations
di: Messina, Nicola, et al.
Pubblicazione: (2025)
di: Messina, Nicola, et al.
Pubblicazione: (2025)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
di: Messina, Nicola, et al.
Pubblicazione: (2024)
di: Messina, Nicola, et al.
Pubblicazione: (2024)
Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting
di: Pacini, Giacomo, et al.
Pubblicazione: (2026)
di: Pacini, Giacomo, et al.
Pubblicazione: (2026)
Mind the Prompt: A Novel Benchmark for Prompt-based Class-Agnostic Counting
di: Ciampi, Luca, et al.
Pubblicazione: (2024)
di: Ciampi, Luca, et al.
Pubblicazione: (2024)
Specificity-aware reinforcement learning for fine-grained open-world classification
di: Angheben, Samuele, et al.
Pubblicazione: (2026)
di: Angheben, Samuele, et al.
Pubblicazione: (2026)
Biologically-inspired Semi-supervised Semantic Segmentation for Biomedical Imaging
di: Ciampi, Luca, et al.
Pubblicazione: (2024)
di: Ciampi, Luca, et al.
Pubblicazione: (2024)
Semi-Supervised Biomedical Image Segmentation via Diffusion Models and Teacher-Student Co-Training
di: Ciampi, Luca, et al.
Pubblicazione: (2025)
di: Ciampi, Luca, et al.
Pubblicazione: (2025)
CA3D: Convolutional-Attentional 3D Nets for Efficient Video Activity Recognition on the Edge
di: Lagani, Gabriele, et al.
Pubblicazione: (2025)
di: Lagani, Gabriele, et al.
Pubblicazione: (2025)
CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation
di: Wysoczańska, Monika, et al.
Pubblicazione: (2023)
di: Wysoczańska, Monika, et al.
Pubblicazione: (2023)
MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP
di: Truong, Chau, et al.
Pubblicazione: (2025)
di: Truong, Chau, et al.
Pubblicazione: (2025)
From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
di: Gentile, Francesco, et al.
Pubblicazione: (2026)
di: Gentile, Francesco, et al.
Pubblicazione: (2026)
Adversarial Magnification to Deceive Deepfake Detection through Super Resolution
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
Exploring the Adversarial Robustness of CLIP for AI-generated Image Detection
di: De Rosa, Vincenzo, et al.
Pubblicazione: (2024)
di: De Rosa, Vincenzo, et al.
Pubblicazione: (2024)
Infusing fine-grained visual knowledge to Vision-Language Models
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2025)
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2025)
MFCLIP: Multi-modal Fine-grained CLIP for Generalizable Diffusion Face Forgery Detection
di: Zhang, Yaning, et al.
Pubblicazione: (2024)
di: Zhang, Yaning, et al.
Pubblicazione: (2024)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
Exploring Strengths and Weaknesses of Super-Resolution Attack in Deepfake Detection
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
Plant identification in an open-world (LifeCLEF 2016)
di: Goeau, Herve, et al.
Pubblicazione: (2025)
di: Goeau, Herve, et al.
Pubblicazione: (2025)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
Deepfake Detection without Deepfakes: Generalization via Synthetic Frequency Patterns Injection
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
di: Coccomini, Davide Alessandro, et al.
Pubblicazione: (2024)
CLIP-driven rain perception: Adaptive deraining with pattern-aware network routing and mask-guided cross-attention
di: Guan, Cong, et al.
Pubblicazione: (2025)
di: Guan, Cong, et al.
Pubblicazione: (2025)
LoomNet: Enhancing Multi-View Image Generation via Latent Space Weaving
di: Federico, Giulio, et al.
Pubblicazione: (2025)
di: Federico, Giulio, et al.
Pubblicazione: (2025)
Reviving ConvNeXt for Efficient Convolutional Diffusion Models
di: Kwon, Taesung, et al.
Pubblicazione: (2026)
di: Kwon, Taesung, et al.
Pubblicazione: (2026)
NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway
di: Jyhne, Sander Riisøen, et al.
Pubblicazione: (2025)
di: Jyhne, Sander Riisøen, et al.
Pubblicazione: (2025)
Are CLIP features all you need for Universal Synthetic Image Origin Attribution?
di: Cioni, Dario, et al.
Pubblicazione: (2024)
di: Cioni, Dario, et al.
Pubblicazione: (2024)
A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches
di: Ciampi, Luca, et al.
Pubblicazione: (2025)
di: Ciampi, Luca, et al.
Pubblicazione: (2025)
Location embedding based pairwise distance learning for fine-grained diagnosis of urinary stones
di: Jin, Qiangguo, et al.
Pubblicazione: (2024)
di: Jin, Qiangguo, et al.
Pubblicazione: (2024)
SuperCLIP: CLIP with Simple Classification Supervision
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
VectorGraphNET: Graph Attention Networks for Accurate Segmentation of Complex Technical Drawings
di: Carrara, Andrea, et al.
Pubblicazione: (2024)
di: Carrara, Andrea, et al.
Pubblicazione: (2024)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
CLIP-KD: An Empirical Study of CLIP Model Distillation
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
CLIP-IT: CLIP-based Pairing for Histology Images Classification
di: Karimian, Banafsheh, et al.
Pubblicazione: (2025)
di: Karimian, Banafsheh, et al.
Pubblicazione: (2025)
NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN
di: Guo, Yufei, et al.
Pubblicazione: (2023)
di: Guo, Yufei, et al.
Pubblicazione: (2023)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2024)
AD-CLIP: Adapting Domains in Prompt Space Using CLIP
di: Singha, Mainak, et al.
Pubblicazione: (2023)
di: Singha, Mainak, et al.
Pubblicazione: (2023)
Documenti analoghi
-
The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2023) -
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
di: Bianchi, Lorenzo, et al.
Pubblicazione: (2025) -
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
di: Barsellotti, Luca, et al.
Pubblicazione: (2024) -
CountingDINO: A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones
di: Pacini, Giacomo, et al.
Pubblicazione: (2025) -
Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations
di: Messina, Nicola, et al.
Pubblicazione: (2025)