Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ming, Yifei, Li, Yixuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
par: Ming, Yifei, et autres
Publié: (2023)
par: Ming, Yifei, et autres
Publié: (2023)
Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
par: Kim, Gahyeon, et autres
Publié: (2025)
par: Kim, Gahyeon, et autres
Publié: (2025)
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025)
par: Mei, Jingbiao, et autres
Publié: (2025)
Vision-Language Models Unlock Task-Centric Latent Actions
par: Nikulin, Alexander, et autres
Publié: (2026)
par: Nikulin, Alexander, et autres
Publié: (2026)
Prismer: A Vision-Language Model with Multi-Task Experts
par: Liu, Shikun, et autres
Publié: (2023)
par: Liu, Shikun, et autres
Publié: (2023)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
par: Park, Jihwan, et autres
Publié: (2025)
par: Park, Jihwan, et autres
Publié: (2025)
HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model
par: Xi, Yuanhao, et autres
Publié: (2025)
par: Xi, Yuanhao, et autres
Publié: (2025)
How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks
par: Ramachandran, Rahul, et autres
Publié: (2025)
par: Ramachandran, Rahul, et autres
Publié: (2025)
Composition Vision-Language Understanding via Segment and Depth Anything Model
par: Huo, Mingxiao, et autres
Publié: (2024)
par: Huo, Mingxiao, et autres
Publié: (2024)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
par: Ma, Huan, et autres
Publié: (2024)
par: Ma, Huan, et autres
Publié: (2024)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
par: Hao, Haoran, et autres
Publié: (2024)
par: Hao, Haoran, et autres
Publié: (2024)
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
par: Yang, Jingcheng, et autres
Publié: (2026)
par: Yang, Jingcheng, et autres
Publié: (2026)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
par: Zhu, Mengdan, et autres
Publié: (2025)
par: Zhu, Mengdan, et autres
Publié: (2025)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
par: Bae, Jiyun, et autres
Publié: (2025)
par: Bae, Jiyun, et autres
Publié: (2025)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models
par: Bendou, Yassir, et autres
Publié: (2025)
par: Bendou, Yassir, et autres
Publié: (2025)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
par: Gao, Haoxiang, et autres
Publié: (2025)
par: Gao, Haoxiang, et autres
Publié: (2025)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
par: Ghosh, Dhruba, et autres
Publié: (2026)
par: Ghosh, Dhruba, et autres
Publié: (2026)
RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
par: Moshtaghi, Mehdi, et autres
Publié: (2025)
par: Moshtaghi, Mehdi, et autres
Publié: (2025)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2024)
par: Zhang, Yabin, et autres
Publié: (2024)
A Large-scale Medical Visual Task Adaptation Benchmark
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Hierarchically Robust Zero-shot Vision-language Models
par: Dong, Junhao, et autres
Publié: (2026)
par: Dong, Junhao, et autres
Publié: (2026)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks
par: Matsuishi, Koki, et autres
Publié: (2025)
par: Matsuishi, Koki, et autres
Publié: (2025)
The Underappreciated Power of Vision Models for Graph Structural Understanding
par: Zhao, Xinjian, et autres
Publié: (2025)
par: Zhao, Xinjian, et autres
Publié: (2025)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
par: Maharana, Adyasha, et autres
Publié: (2023)
par: Maharana, Adyasha, et autres
Publié: (2023)
FastVLM: Efficient Vision Encoding for Vision Language Models
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
par: Lee, Jewon, et autres
Publié: (2025)
par: Lee, Jewon, et autres
Publié: (2025)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
par: Fei, Junjie, et autres
Publié: (2026)
par: Fei, Junjie, et autres
Publié: (2026)
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
par: Moon, Jihyun, et autres
Publié: (2025)
par: Moon, Jihyun, et autres
Publié: (2025)
Continual Adaptation of Vision Transformers for Federated Learning
par: Halbe, Shaunak, et autres
Publié: (2023)
par: Halbe, Shaunak, et autres
Publié: (2023)
Tree of Attributes Prompt Learning for Vision-Language Models
par: Ding, Tong, et autres
Publié: (2024)
par: Ding, Tong, et autres
Publié: (2024)
TTA-DAME: Test-Time Adaptation with Domain Augmentation and Model Ensemble for Dynamic Driving Conditions
par: Jeon, Dongjae, et autres
Publié: (2025)
par: Jeon, Dongjae, et autres
Publié: (2025)
Towards Long-window Anchoring in Vision-Language Model Distillation
par: Zhou, Haoyi, et autres
Publié: (2025)
par: Zhou, Haoyi, et autres
Publié: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
par: Azulay, Aharon, et autres
Publié: (2026)
par: Azulay, Aharon, et autres
Publié: (2026)
Do Language Models Understand Time?
par: Ding, Xi, et autres
Publié: (2024)
par: Ding, Xi, et autres
Publié: (2024)
Documents similaires
-
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
par: Miyai, Atsuyuki, et autres
Publié: (2024) -
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
par: Ming, Yifei, et autres
Publié: (2023) -
Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
par: Miyai, Atsuyuki, et autres
Publié: (2024) -
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
par: Kim, Gahyeon, et autres
Publié: (2025) -
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025)