Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Cheng, Song, Lin, Xue, Ruoyi, Wang, Hang, Sun, Hongbin, Ge, Yixiao, Shan, Ying |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model
by: Bui, Phuoc-Nguyen, et al.
Published: (2025)
by: Bui, Phuoc-Nguyen, et al.
Published: (2025)
ST-LLM: Large Language Models Are Effective Temporal Learners
by: Liu, Ruyang, et al.
Published: (2024)
by: Liu, Ruyang, et al.
Published: (2024)
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
by: He, Xuehai, et al.
Published: (2023)
by: He, Xuehai, et al.
Published: (2023)
Making Large Vision Language Models to be Good Few-shot Learners
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
by: Liu, Ruyang, et al.
Published: (2023)
by: Liu, Ruyang, et al.
Published: (2023)
YOLO-World: Real-Time Open-Vocabulary Object Detection
by: Cheng, Tianheng, et al.
Published: (2024)
by: Cheng, Tianheng, et al.
Published: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
by: Cheng, Junhao, et al.
Published: (2025)
by: Cheng, Junhao, et al.
Published: (2025)
Few-shot Learner Parameterization by Diffusion Time-steps
by: Yue, Zhongqi, et al.
Published: (2024)
by: Yue, Zhongqi, et al.
Published: (2024)
Activating Wider Areas in Image Super-Resolution
by: Cheng, Cheng, et al.
Published: (2024)
by: Cheng, Cheng, et al.
Published: (2024)
From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation
by: Cheng, Cheng, et al.
Published: (2025)
by: Cheng, Cheng, et al.
Published: (2025)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
by: Ma, Shijie, et al.
Published: (2025)
by: Ma, Shijie, et al.
Published: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
by: Li, Yizhuo, et al.
Published: (2024)
by: Li, Yizhuo, et al.
Published: (2024)
Few-shot Adaptation of Medical Vision-Language Models
by: Shakeri, Fereshteh, et al.
Published: (2024)
by: Shakeri, Fereshteh, et al.
Published: (2024)
Pre-trained Vision and Language Transformers Are Few-Shot Incremental Learners
by: Park, Keon-Hee, et al.
Published: (2024)
by: Park, Keon-Hee, et al.
Published: (2024)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
by: Cheng, Junhao, et al.
Published: (2025)
by: Cheng, Junhao, et al.
Published: (2025)
A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models
by: Huang, Hao, et al.
Published: (2025)
by: Huang, Hao, et al.
Published: (2025)
Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model
by: An, Zhaochong, et al.
Published: (2025)
by: An, Zhaochong, et al.
Published: (2025)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
by: Li, Bohao, et al.
Published: (2024)
by: Li, Bohao, et al.
Published: (2024)
Task-Adapter: Task-specific Adaptation of Image Models for Few-shot Action Recognition
by: Cao, Congqi, et al.
Published: (2024)
by: Cao, Congqi, et al.
Published: (2024)
D$^2$ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-shot Action Recognition
by: Pei, Wenjie, et al.
Published: (2023)
by: Pei, Wenjie, et al.
Published: (2023)
What Makes Good Few-shot Examples for Vision-Language Models?
by: Guo, Zhaojun, et al.
Published: (2024)
by: Guo, Zhaojun, et al.
Published: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
by: Ge, Yuying, et al.
Published: (2024)
by: Ge, Yuying, et al.
Published: (2024)
Noise-Tolerant Few-Shot Unsupervised Adapter for Vision-Language Models
by: Ali, Eman, et al.
Published: (2023)
by: Ali, Eman, et al.
Published: (2023)
SEED-Story: Multimodal Long Story Generation with Large Language Model
by: Yang, Shuai, et al.
Published: (2024)
by: Yang, Shuai, et al.
Published: (2024)
FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model
by: Li, Yuanwei, et al.
Published: (2024)
by: Li, Yuanwei, et al.
Published: (2024)
OFL-SAM2: Prompt SAM2 with Online Few-shot Learner for Efficient Medical Image Segmentation
by: Lan, Meng, et al.
Published: (2025)
by: Lan, Meng, et al.
Published: (2025)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
by: Tong, Baoshun, et al.
Published: (2024)
by: Tong, Baoshun, et al.
Published: (2024)
E2MPL:An Enduring and Efficient Meta Prompt Learning Framework for Few-shot Unsupervised Domain Adaptation
by: Yang, Wanqi, et al.
Published: (2024)
by: Yang, Wanqi, et al.
Published: (2024)
Vision and Language Reference Prompt into SAM for Few-shot Segmentation
by: Sakurai, Kosuke, et al.
Published: (2025)
by: Sakurai, Kosuke, et al.
Published: (2025)
Hierarchical Process Reward Models are Symbolic Vision Learners
by: Zhang, Shan, et al.
Published: (2025)
by: Zhang, Shan, et al.
Published: (2025)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
by: Spinaci, Gianmarco, et al.
Published: (2025)
by: Spinaci, Gianmarco, et al.
Published: (2025)
Dual-Adapter: Training-free Dual Adaptation for Few-shot Out-of-Distribution Detection
by: Chen, Xinyi, et al.
Published: (2024)
by: Chen, Xinyi, et al.
Published: (2024)
Few-shot Online Anomaly Detection and Segmentation
by: Wei, Shenxing, et al.
Published: (2024)
by: Wei, Shenxing, et al.
Published: (2024)
DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models
by: Qin, Mengxin, et al.
Published: (2026)
by: Qin, Mengxin, et al.
Published: (2026)
Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation
by: Liu, Jie, et al.
Published: (2025)
by: Liu, Jie, et al.
Published: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
by: Qiu, Lu, et al.
Published: (2024)
by: Qiu, Lu, et al.
Published: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
by: Zhu, Xingyu, et al.
Published: (2024)
by: Zhu, Xingyu, et al.
Published: (2024)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
by: Xiao, Yicheng, et al.
Published: (2025)
by: Xiao, Yicheng, et al.
Published: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
by: Ge, Yuying, et al.
Published: (2024)
by: Ge, Yuying, et al.
Published: (2024)
DiffCLIP: Few-shot Language-driven Multimodal Classifier
by: Zhang, Jiaqing, et al.
Published: (2024)
by: Zhang, Jiaqing, et al.
Published: (2024)
Similar Items
-
Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model
by: Bui, Phuoc-Nguyen, et al.
Published: (2025) -
ST-LLM: Large Language Models Are Effective Temporal Learners
by: Liu, Ruyang, et al.
Published: (2024) -
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
by: He, Xuehai, et al.
Published: (2023) -
Making Large Vision Language Models to be Good Few-shot Learners
by: Liu, Fan, et al.
Published: (2024) -
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
by: Liu, Ruyang, et al.
Published: (2023)