Making Large Vision Language Models to be Good Few-shot Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Fan, Cai, Wenwen, Huo, Jian, Zhang, Chuanyi, Chen, Delong, Zhou, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Few-shot Adaptation of Multi-modal Foundation Models: A Survey
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
What Makes Good Few-shot Examples for Vision-Language Models?
di: Guo, Zhaojun, et al.
Pubblicazione: (2024)
di: Guo, Zhaojun, et al.
Pubblicazione: (2024)
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
di: He, Xuehai, et al.
Pubblicazione: (2023)
di: He, Xuehai, et al.
Pubblicazione: (2023)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation
di: Wang, Jin, et al.
Pubblicazione: (2025)
di: Wang, Jin, et al.
Pubblicazione: (2025)
Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images
di: Miao, Shiyu, et al.
Pubblicazione: (2024)
di: Miao, Shiyu, et al.
Pubblicazione: (2024)
Off-the-shelf ChatGPT is a Good Few-shot Human Motion Predictor
di: Qu, Haoxuan, et al.
Pubblicazione: (2024)
di: Qu, Haoxuan, et al.
Pubblicazione: (2024)
Few-shot Learner Parameterization by Diffusion Time-steps
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
di: Liu, Fan, et al.
Pubblicazione: (2023)
di: Liu, Fan, et al.
Pubblicazione: (2023)
FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model
di: Li, Yuanwei, et al.
Pubblicazione: (2024)
di: Li, Yuanwei, et al.
Pubblicazione: (2024)
Few-shot Adaptation of Medical Vision-Language Models
di: Shakeri, Fereshteh, et al.
Pubblicazione: (2024)
di: Shakeri, Fereshteh, et al.
Pubblicazione: (2024)
What Makes for Good Image Captions?
di: Chen, Delong, et al.
Pubblicazione: (2024)
di: Chen, Delong, et al.
Pubblicazione: (2024)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
di: Spinaci, Gianmarco, et al.
Pubblicazione: (2025)
di: Spinaci, Gianmarco, et al.
Pubblicazione: (2025)
Make It Up: Fake Images, Real Gains in Generalized Few-shot Semantic Segmentation
di: Xie, Guohuan, et al.
Pubblicazione: (2026)
di: Xie, Guohuan, et al.
Pubblicazione: (2026)
Few to Big: Prototype Expansion Network via Diffusion Learner for Point Cloud Few-shot Semantic Segmentation
di: Zhao, Qianguang, et al.
Pubblicazione: (2025)
di: Zhao, Qianguang, et al.
Pubblicazione: (2025)
Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model
di: An, Zhaochong, et al.
Pubblicazione: (2025)
di: An, Zhaochong, et al.
Pubblicazione: (2025)
Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection
di: Fan, Yuanting, et al.
Pubblicazione: (2025)
di: Fan, Yuanting, et al.
Pubblicazione: (2025)
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
di: Liu, Mushui, et al.
Pubblicazione: (2024)
di: Liu, Mushui, et al.
Pubblicazione: (2024)
FLIER: Few-shot Language Image Models Embedded with Latent Representations
di: Zhou, Zhinuo, et al.
Pubblicazione: (2024)
di: Zhou, Zhinuo, et al.
Pubblicazione: (2024)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
di: Sakurai, Kosuke, et al.
Pubblicazione: (2025)
di: Sakurai, Kosuke, et al.
Pubblicazione: (2025)
Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Large Language Models are Good Prompt Learners for Low-Shot Image Classification
di: Zheng, Zhaoheng, et al.
Pubblicazione: (2023)
di: Zheng, Zhaoheng, et al.
Pubblicazione: (2023)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
di: Shen, Yijun, et al.
Pubblicazione: (2025)
di: Shen, Yijun, et al.
Pubblicazione: (2025)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models
di: Huang, Hao, et al.
Pubblicazione: (2025)
di: Huang, Hao, et al.
Pubblicazione: (2025)
Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
di: Xie, Ming-Kun, et al.
Pubblicazione: (2025)
di: Xie, Ming-Kun, et al.
Pubblicazione: (2025)
Noise is an Efficient Learner for Zero-Shot Vision-Language Models
di: Imam, Raza, et al.
Pubblicazione: (2025)
di: Imam, Raza, et al.
Pubblicazione: (2025)
The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning
di: Li, Yaohui, et al.
Pubblicazione: (2024)
di: Li, Yaohui, et al.
Pubblicazione: (2024)
Clustered-patch Element Connection for Few-shot Learning
di: Lai, Jinxiang, et al.
Pubblicazione: (2023)
di: Lai, Jinxiang, et al.
Pubblicazione: (2023)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
di: Vedernikov, Alexander, et al.
Pubblicazione: (2025)
di: Vedernikov, Alexander, et al.
Pubblicazione: (2025)
RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation
di: Min, Rui, et al.
Pubblicazione: (2026)
di: Min, Rui, et al.
Pubblicazione: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
RemoteSAM: Towards Segment Anything for Earth Observation
di: Yao, Liang, et al.
Pubblicazione: (2025)
di: Yao, Liang, et al.
Pubblicazione: (2025)
UEMM-Air: Make Unmanned Aerial Vehicles Perform More Multi-modal Tasks
di: Yao, Liang, et al.
Pubblicazione: (2024)
di: Yao, Liang, et al.
Pubblicazione: (2024)
Few-shot Image Generation via Masked Discrimination
di: Zhu, Jingyuan, et al.
Pubblicazione: (2022)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2022)
Next-Embedding Prediction Makes Strong Vision Learners
di: Xu, Sihan, et al.
Pubblicazione: (2025)
di: Xu, Sihan, et al.
Pubblicazione: (2025)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Few-shot Adaptation of Multi-modal Foundation Models: A Survey
di: Liu, Fan, et al.
Pubblicazione: (2024) -
What Makes Good Few-shot Examples for Vision-Language Models?
di: Guo, Zhaojun, et al.
Pubblicazione: (2024) -
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
di: He, Xuehai, et al.
Pubblicazione: (2023) -
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
di: Cheng, Cheng, et al.
Pubblicazione: (2023) -
Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation
di: Wang, Jin, et al.
Pubblicazione: (2025)