Revisiting Few-Shot Object Detection with Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Madan, Anish, Peri, Neehar, Kong, Shu, Ramanan, Deva |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025)
by: Robicheaux, Peter, et al.
Published: (2025)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024)
by: Khurana, Mehar, et al.
Published: (2024)
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025)
by: Davidson, Cainan, et al.
Published: (2025)
Long-Tailed 3D Detection via Multi-Modal Fusion
by: Ma, Yechi, et al.
Published: (2023)
by: Ma, Yechi, et al.
Published: (2023)
SMORE: Simultaneous Map and Object REconstruction
by: Chodosh, Nathaniel, et al.
Published: (2024)
by: Chodosh, Nathaniel, et al.
Published: (2024)
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
by: Robinson, Isaac, et al.
Published: (2025)
by: Robinson, Isaac, et al.
Published: (2025)
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
I Can't Believe It's Not Scene Flow!
by: Khatri, Ishan, et al.
Published: (2024)
by: Khatri, Ishan, et al.
Published: (2024)
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
by: Li, Siyi, et al.
Published: (2025)
by: Li, Siyi, et al.
Published: (2025)
Better Call SAL: Towards Learning to Segment Anything in Lidar
by: Ošep, Aljoša, et al.
Published: (2024)
by: Ošep, Aljoša, et al.
Published: (2024)
Revisiting the Role of Language Priors in Vision-Language Models
by: Lin, Zhiqiu, et al.
Published: (2023)
by: Lin, Zhiqiu, et al.
Published: (2023)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
by: Mitra, Chancharik, et al.
Published: (2025)
by: Mitra, Chancharik, et al.
Published: (2025)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
by: Mitra, Chancharik, et al.
Published: (2024)
by: Mitra, Chancharik, et al.
Published: (2024)
The Neglected Tails in Vision-Language Models
by: Parashar, Shubham, et al.
Published: (2024)
by: Parashar, Shubham, et al.
Published: (2024)
Neural Eulerian Scene Flow Fields
by: Vedder, Kyle, et al.
Published: (2024)
by: Vedder, Kyle, et al.
Published: (2024)
ZeroFlow: Scalable Scene Flow via Distillation
by: Vedder, Kyle, et al.
Published: (2023)
by: Vedder, Kyle, et al.
Published: (2023)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024)
by: Khurana, Tarasha, et al.
Published: (2024)
RaySt3R: Predicting Novel Depth Maps for Zero-Shot Object Completion
by: Duisterhof, Bardienus P., et al.
Published: (2025)
by: Duisterhof, Bardienus P., et al.
Published: (2025)
Activation Reward Models for Few-Shot Model Alignment
by: Chai, Tianning, et al.
Published: (2025)
by: Chai, Tianning, et al.
Published: (2025)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
by: Lin, Zhiqiu, et al.
Published: (2023)
by: Lin, Zhiqiu, et al.
Published: (2023)
FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion
by: Feng, Chen-Bin, et al.
Published: (2026)
by: Feng, Chen-Bin, et al.
Published: (2026)
Decoupled Prototype Matching with Vision Foundation Models for Few-Shot Industrial Object Detection
by: M., Hari Prasanth S., et al.
Published: (2026)
by: M., Hari Prasanth S., et al.
Published: (2026)
Enabling Validation for Robust Few-Shot Recognition
by: Wang, Hanxin, et al.
Published: (2025)
by: Wang, Hanxin, et al.
Published: (2025)
Using Diffusion Priors for Video Amodal Segmentation
by: Chen, Kaihua, et al.
Published: (2024)
by: Chen, Kaihua, et al.
Published: (2024)
Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
by: Chen, Kaihua, et al.
Published: (2025)
by: Chen, Kaihua, et al.
Published: (2025)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
by: Kumar, Yogesh, et al.
Published: (2025)
by: Kumar, Yogesh, et al.
Published: (2025)
Language Models as Black-Box Optimizers for Vision-Language Models
by: Liu, Shihong, et al.
Published: (2023)
by: Liu, Shihong, et al.
Published: (2023)
Semi-Supervised Few-Shot Adaptation of Vision-Language Models
by: Silva-Rodríguez, Julio, et al.
Published: (2026)
by: Silva-Rodríguez, Julio, et al.
Published: (2026)
Low-Rank Few-Shot Adaptation of Vision-Language Models
by: Zanella, Maxime, et al.
Published: (2024)
by: Zanella, Maxime, et al.
Published: (2024)
Few-Shot Object Detection: Research Advances and Challenges
by: Xin, Zhimeng, et al.
Published: (2024)
by: Xin, Zhimeng, et al.
Published: (2024)
Few-Shot Object Detection with Sparse Context Transformers
by: Mei, Jie, et al.
Published: (2024)
by: Mei, Jie, et al.
Published: (2024)
Prototype-Driven Adaptation for Few-Shot Object Detection
by: Huang, Yushen, et al.
Published: (2025)
by: Huang, Yushen, et al.
Published: (2025)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection
by: Fan, Yuanting, et al.
Published: (2025)
by: Fan, Yuanting, et al.
Published: (2025)
Few-Shot Object Detection via Spatial-Channel State Space Model
by: Xin, Zhimeng, et al.
Published: (2025)
by: Xin, Zhimeng, et al.
Published: (2025)
Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models
by: Khoury, Karim El, et al.
Published: (2025)
by: Khoury, Karim El, et al.
Published: (2025)
Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model
by: Lee, SuBeen, et al.
Published: (2025)
by: Lee, SuBeen, et al.
Published: (2025)
Towards Generalized Few-Shot Open-Set Object Detection
by: Su, Binyi, et al.
Published: (2022)
by: Su, Binyi, et al.
Published: (2022)
Fine-Grained Prototypes Distillation for Few-Shot Object Detection
by: Wang, Zichen, et al.
Published: (2024)
by: Wang, Zichen, et al.
Published: (2024)
Similar Items
-
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025) -
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026) -
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024) -
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025) -
Long-Tailed 3D Detection via Multi-Modal Fusion
by: Ma, Yechi, et al.
Published: (2023)