Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sterner, Igor, Lin, Weizhe, Chen, Jinghong, Byrne, Bill |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Hateful Meme Detection through Retrieval-Guided Contrastive Learning
par: Mei, Jingbiao, et autres
Publié: (2023)
par: Mei, Jingbiao, et autres
Publié: (2023)
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025)
par: Mei, Jingbiao, et autres
Publié: (2025)
According to Me: Long-Term Personalized Referential Memory QA
par: Mei, Jingbiao, et autres
Publié: (2026)
par: Mei, Jingbiao, et autres
Publié: (2026)
Evaluating Linguistic Capabilities of Multimodal LLMs in the Lens of Few-Shot Learning
par: Dogan, Mustafa, et autres
Publié: (2024)
par: Dogan, Mustafa, et autres
Publié: (2024)
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
par: Hou, Wenjun, et autres
Publié: (2024)
par: Hou, Wenjun, et autres
Publié: (2024)
Frozen Feature Augmentation for Few-Shot Image Classification
par: Bär, Andreas, et autres
Publié: (2024)
par: Bär, Andreas, et autres
Publié: (2024)
Multi-Level Correlation Network For Few-Shot Image Classification
par: Dang, Yunkai, et autres
Publié: (2024)
par: Dang, Yunkai, et autres
Publié: (2024)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
par: Su, Xin, et autres
Publié: (2024)
par: Su, Xin, et autres
Publié: (2024)
Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA
par: Li, Zhuowan, et autres
Publié: (2024)
par: Li, Zhuowan, et autres
Publié: (2024)
Few-Shot Relation Extraction with Hybrid Visual Evidence
par: Gong, Jiaying, et autres
Publié: (2024)
par: Gong, Jiaying, et autres
Publié: (2024)
Pose2Gest: A Few-Shot Model-Free Approach Applied In South Indian Classical Dance Gesture Recognition
par: Raju, Kavitha, et autres
Publié: (2024)
par: Raju, Kavitha, et autres
Publié: (2024)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
par: Han, Bin, et autres
Publié: (2024)
par: Han, Bin, et autres
Publié: (2024)
PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers
par: Lin, Weizhe, et autres
Publié: (2024)
par: Lin, Weizhe, et autres
Publié: (2024)
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
par: Yang, Guangyu, et autres
Publié: (2023)
par: Yang, Guangyu, et autres
Publié: (2023)
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
par: Zhang, Ce, et autres
Publié: (2024)
par: Zhang, Ce, et autres
Publié: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
Efficient Whole Slide Pathology VQA via Token Compression
par: Lyu, Weimin, et autres
Publié: (2025)
par: Lyu, Weimin, et autres
Publié: (2025)
A Tale of Two Languages: Large-Vocabulary Continuous Sign Language Recognition from Spoken Language Supervision
par: Raude, Charles, et autres
Publié: (2024)
par: Raude, Charles, et autres
Publié: (2024)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
GRAM: Global Reasoning for Multi-Page VQA
par: Blau, Tsachi, et autres
Publié: (2024)
par: Blau, Tsachi, et autres
Publié: (2024)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
par: Ge, Jinchao, et autres
Publié: (2025)
par: Ge, Jinchao, et autres
Publié: (2025)
See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation
par: Rizwan, Naquee, et autres
Publié: (2026)
par: Rizwan, Naquee, et autres
Publié: (2026)
Control-DAG: Constrained Decoding for Non-Autoregressive Directed Acyclic T5 using Weighted Finite State Automata
par: Chen, Jinghong, et autres
Publié: (2024)
par: Chen, Jinghong, et autres
Publié: (2024)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
par: Rostamkhani, Mohammadmostafa, et autres
Publié: (2024)
par: Rostamkhani, Mohammadmostafa, et autres
Publié: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
par: Naik, Nandita Shankar, et autres
Publié: (2024)
par: Naik, Nandita Shankar, et autres
Publié: (2024)
Efficient Few-Shot Medical Image Analysis via Hierarchical Contrastive Vision-Language Learning
par: Fuller, Harrison, et autres
Publié: (2025)
par: Fuller, Harrison, et autres
Publié: (2025)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
par: Ma, Dongsheng, et autres
Publié: (2026)
par: Ma, Dongsheng, et autres
Publié: (2026)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
par: Shahgir, Haz Sameen, et autres
Publié: (2024)
par: Shahgir, Haz Sameen, et autres
Publié: (2024)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
par: Yu, Suhao, et autres
Publié: (2025)
par: Yu, Suhao, et autres
Publié: (2025)
Verbalized Representation Learning for Interpretable Few-Shot Generalization
par: Yang, Cheng-Fu, et autres
Publié: (2024)
par: Yang, Cheng-Fu, et autres
Publié: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
par: Mitra, Chancharik, et autres
Publié: (2024)
par: Mitra, Chancharik, et autres
Publié: (2024)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI
par: Vepa, Arvind Murari, et autres
Publié: (2025)
par: Vepa, Arvind Murari, et autres
Publié: (2025)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
par: Hwang, Taebaek, et autres
Publié: (2025)
par: Hwang, Taebaek, et autres
Publié: (2025)
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
par: Irawan, Patrick Amadeus, et autres
Publié: (2024)
par: Irawan, Patrick Amadeus, et autres
Publié: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
par: Moratelli, Nicholas, et autres
Publié: (2026)
par: Moratelli, Nicholas, et autres
Publié: (2026)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
par: Sarwar, Nobin
Publié: (2025)
par: Sarwar, Nobin
Publié: (2025)
Documents similaires
-
Improving Hateful Meme Detection through Retrieval-Guided Contrastive Learning
par: Mei, Jingbiao, et autres
Publié: (2023) -
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025) -
According to Me: Long-Term Personalized Referential Memory QA
par: Mei, Jingbiao, et autres
Publié: (2026) -
Evaluating Linguistic Capabilities of Multimodal LLMs in the Lens of Few-Shot Learning
par: Dogan, Mustafa, et autres
Publié: (2024) -
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
par: Hou, Wenjun, et autres
Publié: (2024)