Progressive Local Alignment for Medical Multimodal Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Huimin, Yang, Xian, Bai, Liang, Liang, Jiye |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
par: Yan, Huimin, et autres
Publié: (2026)
par: Yan, Huimin, et autres
Publié: (2026)
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
par: Lee, Jaewoo, et autres
Publié: (2023)
par: Lee, Jaewoo, et autres
Publié: (2023)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
par: Liu, Che, et autres
Publié: (2023)
par: Liu, Che, et autres
Publié: (2023)
Multimodal Autoregressive Pre-training of Large Vision Encoders
par: Fini, Enrico, et autres
Publié: (2024)
par: Fini, Enrico, et autres
Publié: (2024)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
par: Shuai, Zitao, et autres
Publié: (2024)
par: Shuai, Zitao, et autres
Publié: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
par: Ding, Yuhe, et autres
Publié: (2024)
par: Ding, Yuhe, et autres
Publié: (2024)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
A Medical Data-Effective Learning Benchmark for Highly Efficient Pre-training of Foundation Models
par: Yang, Wenxuan, et autres
Publié: (2024)
par: Yang, Wenxuan, et autres
Publié: (2024)
Machine Unlearning on Pre-trained Models by Residual Feature Alignment Using LoRA
par: Qin, Laiqiao, et autres
Publié: (2024)
par: Qin, Laiqiao, et autres
Publié: (2024)
MMGPL: Multimodal Medical Data Analysis with Graph Prompt Learning
par: Peng, Liang, et autres
Publié: (2023)
par: Peng, Liang, et autres
Publié: (2023)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
par: Liu, Che, et autres
Publié: (2023)
par: Liu, Che, et autres
Publié: (2023)
Self-Supervised Learning for Pre-training Capsule Networks: Overcoming Medical Imaging Dataset Challenges
par: El-Shimy, Heba, et autres
Publié: (2025)
par: El-Shimy, Heba, et autres
Publié: (2025)
Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy
par: Roth, Marcel, et autres
Publié: (2024)
par: Roth, Marcel, et autres
Publié: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
par: McKinzie, Brandon, et autres
Publié: (2024)
par: McKinzie, Brandon, et autres
Publié: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
par: Rui, Shaohao, et autres
Publié: (2024)
par: Rui, Shaohao, et autres
Publié: (2024)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
par: Shi, Yukai, et autres
Publié: (2025)
par: Shi, Yukai, et autres
Publié: (2025)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
par: Han, Xu, et autres
Publié: (2024)
par: Han, Xu, et autres
Publié: (2024)
Resilient Contrastive Pre-training under Non-Stationary Drift
par: Yang, Xiaoyu, et autres
Publié: (2025)
par: Yang, Xiaoyu, et autres
Publié: (2025)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
par: Zhang, Haiming, et autres
Publié: (2024)
par: Zhang, Haiming, et autres
Publié: (2024)
Vehicle-centric Perception via Multimodal Structured Pre-training
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
FORESEE: Multimodal and Multi-view Representation Learning for Robust Prediction of Cancer Survival
par: Pan, Liangrui, et autres
Publié: (2024)
par: Pan, Liangrui, et autres
Publié: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training
par: Liu, Che, et autres
Publié: (2023)
par: Liu, Che, et autres
Publié: (2023)
Split Adaptation for Pre-trained Vision Transformers
par: Wang, Lixu, et autres
Publié: (2025)
par: Wang, Lixu, et autres
Publié: (2025)
Feature Unlearning for Pre-trained GANs and VAEs
par: Moon, Saemi, et autres
Publié: (2023)
par: Moon, Saemi, et autres
Publié: (2023)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
par: Zhan, Xuhui, et autres
Publié: (2025)
par: Zhan, Xuhui, et autres
Publié: (2025)
Multi-View and Multi-Scale Alignment for Contrastive Language-Image Pre-training in Mammography
par: Du, Yuexi, et autres
Publié: (2024)
par: Du, Yuexi, et autres
Publié: (2024)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
par: Wang, Yongxin, et autres
Publié: (2024)
par: Wang, Yongxin, et autres
Publié: (2024)
Efficient Pre-training for Localized Instruction Generation of Videos
par: Batra, Anil, et autres
Publié: (2023)
par: Batra, Anil, et autres
Publié: (2023)
Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers
par: Yang, Sheng, et autres
Publié: (2024)
par: Yang, Sheng, et autres
Publié: (2024)
Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
par: Cai, Xu, et autres
Publié: (2025)
par: Cai, Xu, et autres
Publié: (2025)
Epistemic Uncertainty Quantification For Pre-trained Neural Network
par: Wang, Hanjing, et autres
Publié: (2024)
par: Wang, Hanjing, et autres
Publié: (2024)
Centered Masking for Language-Image Pre-Training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
par: Liu, Jiarun, et autres
Publié: (2024)
par: Liu, Jiarun, et autres
Publié: (2024)
Contrastive Localized Language-Image Pre-Training
par: Chen, Hong-You, et autres
Publié: (2024)
par: Chen, Hong-You, et autres
Publié: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
par: Lian, Chenyu, et autres
Publié: (2025)
par: Lian, Chenyu, et autres
Publié: (2025)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
par: Seo, Ara, et autres
Publié: (2025)
par: Seo, Ara, et autres
Publié: (2025)
MultiMed: Massively Multimodal and Multitask Medical Understanding
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Progressive Compositionality in Text-to-Image Generative Models
par: Han, Evans Xu, et autres
Publié: (2024)
par: Han, Evans Xu, et autres
Publié: (2024)
Documents similaires
-
LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
par: Yan, Huimin, et autres
Publié: (2026) -
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
par: Lee, Jaewoo, et autres
Publié: (2023) -
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
par: Liu, Che, et autres
Publié: (2023) -
Multimodal Autoregressive Pre-training of Large Vision Encoders
par: Fini, Enrico, et autres
Publié: (2024) -
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
par: Shuai, Zitao, et autres
Publié: (2024)