Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Xiaoyu, Lu, Jie, Yu, En |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Resilient Contrastive Pre-training under Non-Stationary Drift
por: Yang, Xiaoyu, et al.
Publicado: (2025)
por: Yang, Xiaoyu, et al.
Publicado: (2025)
Walking the Tightrope: Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning
por: Yang, Xiaoyu, et al.
Publicado: (2025)
por: Yang, Xiaoyu, et al.
Publicado: (2025)
Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments
por: Yang, Xiaoyu, et al.
Publicado: (2025)
por: Yang, Xiaoyu, et al.
Publicado: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
por: Jin, Xiaoyu, et al.
Publicado: (2024)
por: Jin, Xiaoyu, et al.
Publicado: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
por: Miao, Yongzhu, et al.
Publicado: (2023)
por: Miao, Yongzhu, et al.
Publicado: (2023)
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
por: Liu, Liwen, et al.
Publicado: (2025)
por: Liu, Liwen, et al.
Publicado: (2025)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
por: Yang, Bufang, et al.
Publicado: (2024)
por: Yang, Bufang, et al.
Publicado: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Unified Multi-modal Diagnostic Framework with Reconstruction Pre-training and Heterogeneity-combat Tuning
por: Zhang, Yupei, et al.
Publicado: (2024)
por: Zhang, Yupei, et al.
Publicado: (2024)
Incorporating Clinical Guidelines through Adapting Multi-modal Large Language Model for Prostate Cancer PI-RADS Scoring
por: Zhang, Tiantian, et al.
Publicado: (2024)
por: Zhang, Tiantian, et al.
Publicado: (2024)
RAW-Adapter: Adapting Pre-trained Visual Model to Camera RAW Images and A Benchmark
por: Cui, Ziteng, et al.
Publicado: (2025)
por: Cui, Ziteng, et al.
Publicado: (2025)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
por: Chen, Haokun, et al.
Publicado: (2025)
por: Chen, Haokun, et al.
Publicado: (2025)
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis
por: Bi, Tianci, et al.
Publicado: (2024)
por: Bi, Tianci, et al.
Publicado: (2024)
RAW-Adapter: Adapting Pre-trained Visual Model to Camera RAW Images
por: Cui, Ziteng, et al.
Publicado: (2024)
por: Cui, Ziteng, et al.
Publicado: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
VILA: On Pre-training for Visual Language Models
por: Lin, Ji, et al.
Publicado: (2023)
por: Lin, Ji, et al.
Publicado: (2023)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
por: Jiang, Dongsheng, et al.
Publicado: (2023)
por: Jiang, Dongsheng, et al.
Publicado: (2023)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking
por: Xuan, Shiyu, et al.
Publicado: (2025)
por: Xuan, Shiyu, et al.
Publicado: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
por: Zhang, Zijian, et al.
Publicado: (2024)
por: Zhang, Zijian, et al.
Publicado: (2024)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
por: Oi, Masanari, et al.
Publicado: (2026)
por: Oi, Masanari, et al.
Publicado: (2026)
Q-VLM: Post-training Quantization for Large Vision-Language Models
por: Wang, Changyuan, et al.
Publicado: (2024)
por: Wang, Changyuan, et al.
Publicado: (2024)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
por: Liao, Pan, et al.
Publicado: (2026)
por: Liao, Pan, et al.
Publicado: (2026)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
por: Kim, Donghoon, et al.
Publicado: (2024)
por: Kim, Donghoon, et al.
Publicado: (2024)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
por: Chen, Xuezheng, et al.
Publicado: (2025)
por: Chen, Xuezheng, et al.
Publicado: (2025)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
por: Wang, Yeyuan, et al.
Publicado: (2024)
por: Wang, Yeyuan, et al.
Publicado: (2024)
Enhancing Biomedical Multi-modal Representation Learning with Multi-scale Pre-training and Perturbed Report Discrimination
por: Zhong, Xinliu, et al.
Publicado: (2025)
por: Zhong, Xinliu, et al.
Publicado: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
MultiMAE Meets Earth Observation: Pre-training Multi-modal Multi-task Masked Autoencoders for Earth Observation Tasks
por: Sosa, Jose, et al.
Publicado: (2025)
por: Sosa, Jose, et al.
Publicado: (2025)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
por: Cao, Anjia, et al.
Publicado: (2024)
por: Cao, Anjia, et al.
Publicado: (2024)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
por: Peng, Zelin, et al.
Publicado: (2025)
por: Peng, Zelin, et al.
Publicado: (2025)
Anomaly Detection by Adapting a pre-trained Vision Language Model
por: Cai, Yuxuan, et al.
Publicado: (2024)
por: Cai, Yuxuan, et al.
Publicado: (2024)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
por: Paul, Sneha, et al.
Publicado: (2026)
por: Paul, Sneha, et al.
Publicado: (2026)
Adapting Pre-Trained Vision Models for Novel Instance Detection and Segmentation
por: Lu, Yangxiao, et al.
Publicado: (2024)
por: Lu, Yangxiao, et al.
Publicado: (2024)
Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Ejemplares similares
-
Resilient Contrastive Pre-training under Non-Stationary Drift
por: Yang, Xiaoyu, et al.
Publicado: (2025) -
Walking the Tightrope: Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning
por: Yang, Xiaoyu, et al.
Publicado: (2025) -
Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments
por: Yang, Xiaoyu, et al.
Publicado: (2025) -
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023) -
LLMRA: Multi-modal Large Language Model based Restoration Assistant
por: Jin, Xiaoyu, et al.
Publicado: (2024)