Test-time Vocabulary Adaptation for Language-driven Object Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Mingxuan, Hayes, Tyler L., Mancini, Massimiliano, Ricci, Elisa, Volpi, Riccardo, Csurka, Gabriela |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
par: Liu, Mingxuan, et autres
Publié: (2024)
par: Liu, Mingxuan, et autres
Publié: (2024)
What could go wrong? Discovering and describing failure modes in computer vision
par: Csurka, Gabriela, et autres
Publié: (2024)
par: Csurka, Gabriela, et autres
Publié: (2024)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Vocabulary-free Image Classification
par: Conti, Alessandro, et autres
Publié: (2023)
par: Conti, Alessandro, et autres
Publié: (2023)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
par: Farina, Matteo, et autres
Publié: (2025)
par: Farina, Matteo, et autres
Publié: (2025)
Vocabulary-free Image Classification and Semantic Segmentation
par: Conti, Alessandro, et autres
Publié: (2024)
par: Conti, Alessandro, et autres
Publié: (2024)
Harnessing Large Language Models for Training-free Video Anomaly Detection
par: Zanella, Luca, et autres
Publié: (2024)
par: Zanella, Luca, et autres
Publié: (2024)
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
par: Caldarella, Simone, et autres
Publié: (2024)
par: Caldarella, Simone, et autres
Publié: (2024)
Compositional Caching for Training-free Open-vocabulary Attribute Detection
par: Garosi, Marco, et autres
Publié: (2025)
par: Garosi, Marco, et autres
Publié: (2025)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
par: De Min, Thomas, et autres
Publié: (2026)
par: De Min, Thomas, et autres
Publié: (2026)
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
par: Berasi, Davide, et autres
Publié: (2025)
par: Berasi, Davide, et autres
Publié: (2025)
Large Multimodal Models as General In-Context Classifiers
par: Garosi, Marco, et autres
Publié: (2026)
par: Garosi, Marco, et autres
Publié: (2026)
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
par: Das, Deepayan, et autres
Publié: (2024)
par: Das, Deepayan, et autres
Publié: (2024)
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
par: Das, Deepayan, et autres
Publié: (2025)
par: Das, Deepayan, et autres
Publié: (2025)
Training-free Online Video Step Grounding
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual Classifiers
par: Guimard, Quentin, et autres
Publié: (2025)
par: Guimard, Quentin, et autres
Publié: (2025)
FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection
par: Zhao, Kaixiang, et autres
Publié: (2026)
par: Zhao, Kaixiang, et autres
Publié: (2026)
PANDAS: Prototype-based Novel Class Discovery and Detection
par: Hayes, Tyler L., et autres
Publié: (2024)
par: Hayes, Tyler L., et autres
Publié: (2024)
Gaussian Splatting Feature Fields for Privacy-Preserving Visual Localization
par: Pietrantoni, Maxime, et autres
Publié: (2025)
par: Pietrantoni, Maxime, et autres
Publié: (2025)
Unlearning Personal Data from a Single Image
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Incremental Object-Based Novelty Detection with Feedback Loop
par: Caldarella, Simone, et autres
Publié: (2023)
par: Caldarella, Simone, et autres
Publié: (2023)
On Large Multimodal Models as Open-World Image Classifiers
par: Conti, Alessandro, et autres
Publié: (2025)
par: Conti, Alessandro, et autres
Publié: (2025)
COLA: Context-aware Language-driven Test-time Adaptation
par: Zhang, Aiming, et autres
Publié: (2025)
par: Zhang, Aiming, et autres
Publié: (2025)
From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
par: Gentile, Francesco, et autres
Publié: (2026)
par: Gentile, Francesco, et autres
Publié: (2026)
Organizing Unstructured Image Collections using Natural Language
par: Liu, Mingxuan, et autres
Publié: (2024)
par: Liu, Mingxuan, et autres
Publié: (2024)
Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models
par: Zhou, Lihua, et autres
Publié: (2025)
par: Zhou, Lihua, et autres
Publié: (2025)
Democratizing Fine-grained Visual Recognition with Large Language Models
par: Liu, Mingxuan, et autres
Publié: (2024)
par: Liu, Mingxuan, et autres
Publié: (2024)
Domain Adaptation for Large-Vocabulary Object Detectors
par: Jiang, Kai, et autres
Publié: (2024)
par: Jiang, Kai, et autres
Publié: (2024)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Can we make NeRF-based visual localization privacy-preserving?
par: Pietrantoni, Maxime, et autres
Publié: (2025)
par: Pietrantoni, Maxime, et autres
Publié: (2025)
Self-supervised Learning of Neural Implicit Feature Fields for Camera Pose Refinement
par: Pietrantoni, Maxime, et autres
Publié: (2024)
par: Pietrantoni, Maxime, et autres
Publié: (2024)
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
par: Guimard, Quentin, et autres
Publié: (2026)
par: Guimard, Quentin, et autres
Publié: (2026)
The Detector Teaches Itself: Lightweight Self-Supervised Adaptation for Open-Vocabulary Object Detection
par: Wan, Yazhe, et autres
Publié: (2026)
par: Wan, Yazhe, et autres
Publié: (2026)
Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
par: Noori, Mehrdad, et autres
Publié: (2025)
par: Noori, Mehrdad, et autres
Publié: (2025)
3D Object Detection from Images for Autonomous Driving: A Survey
par: Ma, Xinzhu, et autres
Publié: (2022)
par: Ma, Xinzhu, et autres
Publié: (2022)
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
par: Bonat, Laurence, et autres
Publié: (2026)
par: Bonat, Laurence, et autres
Publié: (2026)
Scaling Open-Vocabulary Object Detection
par: Minderer, Matthias, et autres
Publié: (2023)
par: Minderer, Matthias, et autres
Publié: (2023)
Documents similaires
-
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
par: Liu, Mingxuan, et autres
Publié: (2024) -
What could go wrong? Discovering and describing failure modes in computer vision
par: Csurka, Gabriela, et autres
Publié: (2024) -
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
par: Farina, Matteo, et autres
Publié: (2024) -
Vocabulary-free Image Classification
par: Conti, Alessandro, et autres
Publié: (2023) -
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
par: Farina, Matteo, et autres
Publié: (2025)