CaMML: Context-Aware Multimodal Learner for Large Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yixin, Zhang, Shuai, Han, Boran, He, Tong, Li, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Instruction Tuning with Chain of Region-of-Interest
par: Chen, Yixin, et autres
Publié: (2025)
par: Chen, Yixin, et autres
Publié: (2025)
Generative Multimodal Models are In-Context Learners
par: Sun, Quan, et autres
Publié: (2023)
par: Sun, Quan, et autres
Publié: (2023)
Hallucination of Multimodal Large Language Models: A Survey
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
par: Sun, Jingchen, et autres
Publié: (2026)
par: Sun, Jingchen, et autres
Publié: (2026)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
Bridging Remote Sensors with Multisensor Geospatial Foundation Models
par: Han, Boran, et autres
Publié: (2024)
par: Han, Boran, et autres
Publié: (2024)
CAST: Collapse-Aware multi-Scale Topology Fusion for Multimodal Coreset Selection
par: Zhao, Boran, et autres
Publié: (2026)
par: Zhao, Boran, et autres
Publié: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Emu3.5: Native Multimodal Models are World Learners
par: Cui, Yufeng, et autres
Publié: (2025)
par: Cui, Yufeng, et autres
Publié: (2025)
Large Multimodal Models as General In-Context Classifiers
par: Garosi, Marco, et autres
Publié: (2026)
par: Garosi, Marco, et autres
Publié: (2026)
Video Diffusion Transformers are In-Context Learners
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024)
par: Liu, Ruyang, et autres
Publié: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
SEED-Story: Multimodal Long Story Generation with Large Language Model
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
par: Hu, Lulu, et autres
Publié: (2026)
par: Hu, Lulu, et autres
Publié: (2026)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
Personal Visual Context Learning in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2026)
par: Xue, Zihui, et autres
Publié: (2026)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
MMaDA: Multimodal Large Diffusion Language Models
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
3D CoCa: Contrastive Learners are 3D Captioners
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
par: Lei, Yuxuan, et autres
Publié: (2024)
par: Lei, Yuxuan, et autres
Publié: (2024)
Making Large Vision Language Models to be Good Few-shot Learners
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos
par: Kumar, Deepak, et autres
Publié: (2026)
par: Kumar, Deepak, et autres
Publié: (2026)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
par: Tong, Bo, et autres
Publié: (2024)
par: Tong, Bo, et autres
Publié: (2024)
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
par: Tian, Ye, et autres
Publié: (2025)
par: Tian, Ye, et autres
Publié: (2025)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
par: Chen, Junkai, et autres
Publié: (2026)
par: Chen, Junkai, et autres
Publié: (2026)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
par: Ye, Junyan, et autres
Publié: (2024)
par: Ye, Junyan, et autres
Publié: (2024)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
par: Xu, Run, et autres
Publié: (2026)
par: Xu, Run, et autres
Publié: (2026)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
par: Luo, Katie, et autres
Publié: (2025)
par: Luo, Katie, et autres
Publié: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
MAD: Makeup All-in-One with Cross-Domain Diffusion Model
par: Ruan, Bo-Kai, et autres
Publié: (2025)
par: Ruan, Bo-Kai, et autres
Publié: (2025)
Measuring Epistemic Humility in Multimodal Large Language Models
par: Tong, Bingkui, et autres
Publié: (2025)
par: Tong, Bingkui, et autres
Publié: (2025)
Enhancing Explainability in Multimodal Large Language Models Using Ontological Context
par: Amara, Jihen, et autres
Publié: (2024)
par: Amara, Jihen, et autres
Publié: (2024)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
par: Zhang, Zefeng, et autres
Publié: (2025)
par: Zhang, Zefeng, et autres
Publié: (2025)
Documents similaires
-
Visual Instruction Tuning with Chain of Region-of-Interest
par: Chen, Yixin, et autres
Publié: (2025) -
Generative Multimodal Models are In-Context Learners
par: Sun, Quan, et autres
Publié: (2023) -
Hallucination of Multimodal Large Language Models: A Survey
par: Bai, Zechen, et autres
Publié: (2024) -
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025) -
Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
par: Sun, Jingchen, et autres
Publié: (2026)