How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Yang, Zheng, Zangwei, Zhu, Zirui, You, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
par: Qin, Libo, et autres
Publié: (2024)
par: Qin, Libo, et autres
Publié: (2024)
Retrieving Counterfactuals Improves Visual In-Context Learning
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
par: Verma, Gaurav, et autres
Publié: (2024)
par: Verma, Gaurav, et autres
Publié: (2024)
Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation
par: Jia, Sihang, et autres
Publié: (2026)
par: Jia, Sihang, et autres
Publié: (2026)
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
par: Yue, Yang, et autres
Publié: (2025)
par: Yue, Yang, et autres
Publié: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025)
par: You, Liangliang, et autres
Publié: (2025)
Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
par: Zheng, Ge, et autres
Publié: (2025)
par: Zheng, Ge, et autres
Publié: (2025)
Nearest Neighbor Normalization Improves Multimodal Retrieval
par: Chowdhury, Neil, et autres
Publié: (2024)
par: Chowdhury, Neil, et autres
Publié: (2024)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)
par: Li, Yanshu
Publié: (2025)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
par: Yan, An, et autres
Publié: (2024)
par: Yan, An, et autres
Publié: (2024)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
par: Zhao, Zihui, et autres
Publié: (2025)
par: Zhao, Zihui, et autres
Publié: (2025)
See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
par: Ananthram, Amith, et autres
Publié: (2024)
par: Ananthram, Amith, et autres
Publié: (2024)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
LAViTeR: Learning Aligned Visual and Textual Representations Assisted by Image and Caption Generation
par: Hashemi, Mohammad Abuzar, et autres
Publié: (2021)
par: Hashemi, Mohammad Abuzar, et autres
Publié: (2021)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
par: Karim, A H M Rezaul, et autres
Publié: (2025)
par: Karim, A H M Rezaul, et autres
Publié: (2025)
How to Train Your Long-Context Visual Document Model
par: Veselka, Austin
Publié: (2026)
par: Veselka, Austin
Publié: (2026)
Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation
par: Shalabi, Fatma, et autres
Publié: (2024)
par: Shalabi, Fatma, et autres
Publié: (2024)
MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training
par: Luo, Yang, et autres
Publié: (2025)
par: Luo, Yang, et autres
Publié: (2025)
Progressive Multimodal Reasoning via Active Retrieval
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
Explaining How Visual, Textual and Multimodal Encoders Share Concepts
par: Cornet, Clément, et autres
Publié: (2025)
par: Cornet, Clément, et autres
Publié: (2025)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
Efficient Personalized Text-to-image Generation by Leveraging Textual Subspace
par: Du, Shian, et autres
Publié: (2024)
par: Du, Shian, et autres
Publié: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
par: Zhu, Zichen, et autres
Publié: (2024)
par: Zhu, Zichen, et autres
Publié: (2024)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
par: Lu, Liming, et autres
Publié: (2025)
par: Lu, Liming, et autres
Publié: (2025)
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
par: Chen, Haonan, et autres
Publié: (2025)
par: Chen, Haonan, et autres
Publié: (2025)
Many-Shot In-Context Learning in Multimodal Foundation Models
par: Jiang, Yixing, et autres
Publié: (2024)
par: Jiang, Yixing, et autres
Publié: (2024)
Recurrence Meets Transformers for Universal Multimodal Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
par: Zheng, Sipeng, et autres
Publié: (2024)
par: Zheng, Sipeng, et autres
Publié: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
MLLM-CL: Continual Learning for Multimodal Large Language Models
par: Zhao, Hongbo, et autres
Publié: (2025)
par: Zhao, Hongbo, et autres
Publié: (2025)
Generative Universal Verifier as Multimodal Meta-Reasoner
par: Zhang, Xinchen, et autres
Publié: (2025)
par: Zhang, Xinchen, et autres
Publié: (2025)
MLLMReID: Multimodal Large Language Model-based Person Re-identification
par: Yang, Shan, et autres
Publié: (2024)
par: Yang, Shan, et autres
Publié: (2024)
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
par: Mei, Jingbiao, et autres
Publié: (2025)
par: Mei, Jingbiao, et autres
Publié: (2025)
Figuring out Figures: Using Textual References to Caption Scientific Figures
par: Cao, Stanley, et autres
Publié: (2024)
par: Cao, Stanley, et autres
Publié: (2024)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Documents similaires
-
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
par: Qin, Libo, et autres
Publié: (2024) -
Retrieving Counterfactuals Improves Visual In-Context Learning
par: Xiong, Guangzhi, et autres
Publié: (2026) -
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
par: Verma, Gaurav, et autres
Publié: (2024) -
Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation
par: Jia, Sihang, et autres
Publié: (2026) -
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
par: Yue, Yang, et autres
Publié: (2025)