What Makes Multimodal In-Context Learning Work?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Baldassini, Folco Bertini, Shukor, Mustafa, Cord, Matthieu, Soulier, Laure, Piwowarski, Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
par: Khayatan, Pegah, et autres
Publié: (2025)
par: Khayatan, Pegah, et autres
Publié: (2025)
Skipping Computations in Multimodal LLMs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
A Concept-Based Explainability Framework for Large Multimodal Models
par: Parekh, Jayneel, et autres
Publié: (2024)
par: Parekh, Jayneel, et autres
Publié: (2024)
Learning to Steer: Input-dependent Steering for Multimodal LLMs
par: Parekh, Jayneel, et autres
Publié: (2025)
par: Parekh, Jayneel, et autres
Publié: (2025)
Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning
par: Shukor, Mustafa, et autres
Publié: (2023)
par: Shukor, Mustafa, et autres
Publié: (2023)
When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
par: Khayatan, Pegah, et autres
Publié: (2026)
par: Khayatan, Pegah, et autres
Publié: (2026)
Improved Baselines for Data-efficient Perceptual Augmentation of LLMs
par: Vallaeys, Théophane, et autres
Publié: (2024)
par: Vallaeys, Théophane, et autres
Publié: (2024)
What matters when building vision-language models?
par: Laurençon, Hugo, et autres
Publié: (2024)
par: Laurençon, Hugo, et autres
Publié: (2024)
Investigating the impact of 2D gesture representation on co-speech gesture generation
par: Guichoux, Teo, et autres
Publié: (2024)
par: Guichoux, Teo, et autres
Publié: (2024)
DiffCut: Catalyzing Zero-Shot Semantic Segmentation with Diffusion Features and Recursive Normalized Cut
par: Couairon, Paul, et autres
Publié: (2024)
par: Couairon, Paul, et autres
Publié: (2024)
Scaling Laws for Native Multimodal Models
par: Shukor, Mustafa, et autres
Publié: (2025)
par: Shukor, Mustafa, et autres
Publié: (2025)
FreeSeg-Diff: Training-Free Open-Vocabulary Segmentation with Diffusion Models
par: Corradini, Barbara Toniella, et autres
Publié: (2024)
par: Corradini, Barbara Toniella, et autres
Publié: (2024)
True Multimodal In-Context Learning Needs Attention to the Visual Context
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
Zero-Shot Refinement of Buildings' Segmentation Models using SAM
par: Mayladan, Ali, et autres
Publié: (2023)
par: Mayladan, Ali, et autres
Publié: (2023)
Few-shot Writer Adaptation via Multimodal In-Context Learning
par: Simon, Tom, et autres
Publié: (2026)
par: Simon, Tom, et autres
Publié: (2026)
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
par: Wang, Haoyu, et autres
Publié: (2026)
par: Wang, Haoyu, et autres
Publié: (2026)
MOCA: Self-supervised Representation Learning by Predicting Masked Online Codebook Assignments
par: Gidaris, Spyros, et autres
Publié: (2023)
par: Gidaris, Spyros, et autres
Publié: (2023)
Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization
par: Chen, Huiyi, et autres
Publié: (2025)
par: Chen, Huiyi, et autres
Publié: (2025)
MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence
par: Chen, Yifan, et autres
Publié: (2026)
par: Chen, Yifan, et autres
Publié: (2026)
Region-Level Context-Aware Multimodal Understanding
par: Wei, Hongliang, et autres
Publié: (2025)
par: Wei, Hongliang, et autres
Publié: (2025)
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
par: Qin, Libo, et autres
Publié: (2024)
par: Qin, Libo, et autres
Publié: (2024)
Cross-Attention Watermarking of Large Language Models
par: Baldassini, Folco Bertini, et autres
Publié: (2024)
par: Baldassini, Folco Bertini, et autres
Publié: (2024)
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation
par: Dai, Dawei, et autres
Publié: (2025)
par: Dai, Dawei, et autres
Publié: (2025)
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness
par: He, Yusheng, et autres
Publié: (2026)
par: He, Yusheng, et autres
Publié: (2026)
ManiPose: Manifold-Constrained Multi-Hypothesis 3D Human Pose Estimation
par: Rommel, Cédric, et autres
Publié: (2023)
par: Rommel, Cédric, et autres
Publié: (2023)
Person Re-ID in 2025: Supervised, Self-Supervised, and Language-Aligned. What Works?
par: Balasubramanian, Lakshman
Publié: (2026)
par: Balasubramanian, Lakshman
Publié: (2026)
Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making
par: Dai, Siyuan, et autres
Publié: (2025)
par: Dai, Siyuan, et autres
Publié: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
DeepJIVE: Learning Joint and Individual Variation Explained from Multimodal Data Using Deep Learning
par: Drexler, Matthew, et autres
Publié: (2025)
par: Drexler, Matthew, et autres
Publié: (2025)
PromptDx: Differentiable Prompt Tuning for Multimodal In-Context Alzheimer's Diagnosis
par: Zhong, Lujia, et autres
Publié: (2026)
par: Zhong, Lujia, et autres
Publié: (2026)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
par: Jung, Chaeyoung, et autres
Publié: (2026)
par: Jung, Chaeyoung, et autres
Publié: (2026)
See What You Are Told: Visual Attention Sink in Large Multimodal Models
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
par: Wang, Bingli, et autres
Publié: (2026)
par: Wang, Bingli, et autres
Publié: (2026)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
par: Chen, Junkai, et autres
Publié: (2026)
par: Chen, Junkai, et autres
Publié: (2026)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
par: Li, Yanshu
Publié: (2025)
par: Li, Yanshu
Publié: (2025)
Fuzzy-Logic and Deep Learning for Environmental Condition-Aware Road Surface Classification
par: Demetgul, Mustafa, et autres
Publié: (2025)
par: Demetgul, Mustafa, et autres
Publié: (2025)
Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge Distillation
par: Mistretta, Marco, et autres
Publié: (2024)
par: Mistretta, Marco, et autres
Publié: (2024)
Documents similaires
-
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
par: Khayatan, Pegah, et autres
Publié: (2025) -
Skipping Computations in Multimodal LLMs
par: Shukor, Mustafa, et autres
Publié: (2024) -
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024) -
A Concept-Based Explainability Framework for Large Multimodal Models
par: Parekh, Jayneel, et autres
Publié: (2024) -
Learning to Steer: Input-dependent Steering for Multimodal LLMs
par: Parekh, Jayneel, et autres
Publié: (2025)