Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Meng, Tian, Tao, Yang, Lyu, Ruilin, Yin, Wuliang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
von: Awal, Rabiul, et al.
Veröffentlicht: (2023)
von: Awal, Rabiul, et al.
Veröffentlicht: (2023)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
von: Shah, Monika, et al.
Veröffentlicht: (2025)
von: Shah, Monika, et al.
Veröffentlicht: (2025)
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025)
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025)
Balancing Conservatism and Aggressiveness: Prototype-Affinity Hybrid Network for Few-Shot Segmentation
von: Zou, Tianyu, et al.
Veröffentlicht: (2025)
von: Zou, Tianyu, et al.
Veröffentlicht: (2025)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
von: Ding, Kun, et al.
Veröffentlicht: (2024)
von: Ding, Kun, et al.
Veröffentlicht: (2024)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
von: Dong, Fuyu, et al.
Veröffentlicht: (2025)
von: Dong, Fuyu, et al.
Veröffentlicht: (2025)
Zero-Shot Anomaly Detection in Battery Thermal Images Using Visual Question Answering with Prior Knowledge
von: Astrid, Marcella, et al.
Veröffentlicht: (2025)
von: Astrid, Marcella, et al.
Veröffentlicht: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
von: Romero, David, et al.
Veröffentlicht: (2024)
von: Romero, David, et al.
Veröffentlicht: (2024)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
von: Gupta, Akash, et al.
Veröffentlicht: (2025)
von: Gupta, Akash, et al.
Veröffentlicht: (2025)
Zero-Shot Prompting and Few-Shot Fine-Tuning: Revisiting Document Image Classification Using Large Language Models
von: Scius-Bertrand, Anna, et al.
Veröffentlicht: (2024)
von: Scius-Bertrand, Anna, et al.
Veröffentlicht: (2024)
Vision-Language In-Context Learning Driven Few-Shot Visual Inspection Model
von: Ueno, Shiryu, et al.
Veröffentlicht: (2025)
von: Ueno, Shiryu, et al.
Veröffentlicht: (2025)
Contrastive Graph Modeling for Cross-Domain Few-Shot Medical Image Segmentation
von: Bo, Yuntian, et al.
Veröffentlicht: (2025)
von: Bo, Yuntian, et al.
Veröffentlicht: (2025)
Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot Classification
von: Wang, Zhongqi, et al.
Veröffentlicht: (2025)
von: Wang, Zhongqi, et al.
Veröffentlicht: (2025)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
von: Ha, Cuong Nhat, et al.
Veröffentlicht: (2024)
Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images
von: Tosato, Lucrezia, et al.
Veröffentlicht: (2024)
von: Tosato, Lucrezia, et al.
Veröffentlicht: (2024)
Improved Few-Shot Image Classification Through Multiple-Choice Questions
von: Khullar, Dipika, et al.
Veröffentlicht: (2024)
von: Khullar, Dipika, et al.
Veröffentlicht: (2024)
Adapting Foundation Models for Few-Shot Medical Image Segmentation: Actively and Sequentially
von: Yang, Jingyun, et al.
Veröffentlicht: (2025)
von: Yang, Jingyun, et al.
Veröffentlicht: (2025)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
von: Shourya, Aditya, et al.
Veröffentlicht: (2025)
Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation
von: Chen, Zhi, et al.
Veröffentlicht: (2025)
von: Chen, Zhi, et al.
Veröffentlicht: (2025)
Low-Rank Few-Shot Adaptation of Vision-Language Models
von: Zanella, Maxime, et al.
Veröffentlicht: (2024)
von: Zanella, Maxime, et al.
Veröffentlicht: (2024)
Semi-Supervised Few-Shot Adaptation of Vision-Language Models
von: Silva-Rodríguez, Julio, et al.
Veröffentlicht: (2026)
von: Silva-Rodríguez, Julio, et al.
Veröffentlicht: (2026)
Revisiting Few-Shot Object Detection with Vision-Language Models
von: Madan, Anish, et al.
Veröffentlicht: (2023)
von: Madan, Anish, et al.
Veröffentlicht: (2023)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
von: Cho, Yeongjae, et al.
Veröffentlicht: (2024)
von: Cho, Yeongjae, et al.
Veröffentlicht: (2024)
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
von: Shi, Kexuan, et al.
Veröffentlicht: (2025)
von: Shi, Kexuan, et al.
Veröffentlicht: (2025)
Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling
von: Wong, Bryan, et al.
Veröffentlicht: (2025)
von: Wong, Bryan, et al.
Veröffentlicht: (2025)
Learning to Obstruct Few-Shot Image Classification over Restricted Classes
von: Zheng, Amber Yijia, et al.
Veröffentlicht: (2024)
von: Zheng, Amber Yijia, et al.
Veröffentlicht: (2024)
Frozen Feature Augmentation for Few-Shot Image Classification
von: Bär, Andreas, et al.
Veröffentlicht: (2024)
von: Bär, Andreas, et al.
Veröffentlicht: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
von: Lee, Jusung, et al.
Veröffentlicht: (2024)
von: Lee, Jusung, et al.
Veröffentlicht: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
von: Mitra, Chancharik, et al.
Veröffentlicht: (2024)
von: Mitra, Chancharik, et al.
Veröffentlicht: (2024)
Bayesian Evidential Learning for Few-Shot Classification
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2022)
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2022)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
von: Hartsock, Iryna, et al.
Veröffentlicht: (2024)
von: Hartsock, Iryna, et al.
Veröffentlicht: (2024)
Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation
von: Ma, Junyuan, et al.
Veröffentlicht: (2026)
von: Ma, Junyuan, et al.
Veröffentlicht: (2026)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
von: Zou, Bo, et al.
Veröffentlicht: (2024)
von: Zou, Bo, et al.
Veröffentlicht: (2024)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
von: Mohamud, Safaa Abdullahi Moallim, et al.
Veröffentlicht: (2025)
von: Mohamud, Safaa Abdullahi Moallim, et al.
Veröffentlicht: (2025)
Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models
von: Khoury, Karim El, et al.
Veröffentlicht: (2025)
von: Khoury, Karim El, et al.
Veröffentlicht: (2025)
Auxiliary Descriptive Knowledge for Few-Shot Adaptation of Vision-Language Model
von: Lee, SuBeen, et al.
Veröffentlicht: (2025)
von: Lee, SuBeen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
von: Awal, Rabiul, et al.
Veröffentlicht: (2023) -
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
von: Shah, Monika, et al.
Veröffentlicht: (2025) -
VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering
von: Nguyen, Hai-Dang, et al.
Veröffentlicht: (2025) -
Balancing Conservatism and Aggressiveness: Prototype-Affinity Hybrid Network for Few-Shot Segmentation
von: Zou, Tianyu, et al.
Veröffentlicht: (2025) -
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
von: Ding, Kun, et al.
Veröffentlicht: (2024)