Progressive Local Alignment for Medical Multimodal Pre-training
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Huimin, Yang, Xian, Bai, Liang, Liang, Jiye |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
por: Yan, Huimin, et al.
Publicado: (2026)
por: Yan, Huimin, et al.
Publicado: (2026)
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
por: Lee, Jaewoo, et al.
Publicado: (2023)
por: Lee, Jaewoo, et al.
Publicado: (2023)
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
por: Liu, Che, et al.
Publicado: (2023)
por: Liu, Che, et al.
Publicado: (2023)
Multimodal Autoregressive Pre-training of Large Vision Encoders
por: Fini, Enrico, et al.
Publicado: (2024)
por: Fini, Enrico, et al.
Publicado: (2024)
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
por: Ding, Yuhe, et al.
Publicado: (2024)
por: Ding, Yuhe, et al.
Publicado: (2024)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
A Medical Data-Effective Learning Benchmark for Highly Efficient Pre-training of Foundation Models
por: Yang, Wenxuan, et al.
Publicado: (2024)
por: Yang, Wenxuan, et al.
Publicado: (2024)
Machine Unlearning on Pre-trained Models by Residual Feature Alignment Using LoRA
por: Qin, Laiqiao, et al.
Publicado: (2024)
por: Qin, Laiqiao, et al.
Publicado: (2024)
MMGPL: Multimodal Medical Data Analysis with Graph Prompt Learning
por: Peng, Liang, et al.
Publicado: (2023)
por: Peng, Liang, et al.
Publicado: (2023)
IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training
por: Liu, Che, et al.
Publicado: (2023)
por: Liu, Che, et al.
Publicado: (2023)
Self-Supervised Learning for Pre-training Capsule Networks: Overcoming Medical Imaging Dataset Challenges
por: El-Shimy, Heba, et al.
Publicado: (2025)
por: El-Shimy, Heba, et al.
Publicado: (2025)
Domain-Adaptive Pre-training of Self-Supervised Foundation Models for Medical Image Classification in Gastrointestinal Endoscopy
por: Roth, Marcel, et al.
Publicado: (2024)
por: Roth, Marcel, et al.
Publicado: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
por: McKinzie, Brandon, et al.
Publicado: (2024)
por: McKinzie, Brandon, et al.
Publicado: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
por: Rui, Shaohao, et al.
Publicado: (2024)
por: Rui, Shaohao, et al.
Publicado: (2024)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
por: Shi, Yukai, et al.
Publicado: (2025)
por: Shi, Yukai, et al.
Publicado: (2025)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
por: Han, Xu, et al.
Publicado: (2024)
por: Han, Xu, et al.
Publicado: (2024)
Resilient Contrastive Pre-training under Non-Stationary Drift
por: Yang, Xiaoyu, et al.
Publicado: (2025)
por: Yang, Xiaoyu, et al.
Publicado: (2025)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
por: Zhang, Haiming, et al.
Publicado: (2024)
por: Zhang, Haiming, et al.
Publicado: (2024)
Vehicle-centric Perception via Multimodal Structured Pre-training
por: Wu, Wentao, et al.
Publicado: (2025)
por: Wu, Wentao, et al.
Publicado: (2025)
FORESEE: Multimodal and Multi-view Representation Learning for Robust Prediction of Cancer Survival
por: Pan, Liangrui, et al.
Publicado: (2024)
por: Pan, Liangrui, et al.
Publicado: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training
por: Liu, Che, et al.
Publicado: (2023)
por: Liu, Che, et al.
Publicado: (2023)
Split Adaptation for Pre-trained Vision Transformers
por: Wang, Lixu, et al.
Publicado: (2025)
por: Wang, Lixu, et al.
Publicado: (2025)
Feature Unlearning for Pre-trained GANs and VAEs
por: Moon, Saemi, et al.
Publicado: (2023)
por: Moon, Saemi, et al.
Publicado: (2023)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
por: Lai, Zhengfeng, et al.
Publicado: (2024)
por: Lai, Zhengfeng, et al.
Publicado: (2024)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
por: Zhan, Xuhui, et al.
Publicado: (2025)
por: Zhan, Xuhui, et al.
Publicado: (2025)
Multi-View and Multi-Scale Alignment for Contrastive Language-Image Pre-training in Mammography
por: Du, Yuexi, et al.
Publicado: (2024)
por: Du, Yuexi, et al.
Publicado: (2024)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
por: Wang, Yongxin, et al.
Publicado: (2024)
por: Wang, Yongxin, et al.
Publicado: (2024)
Efficient Pre-training for Localized Instruction Generation of Videos
por: Batra, Anil, et al.
Publicado: (2023)
por: Batra, Anil, et al.
Publicado: (2023)
Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers
por: Yang, Sheng, et al.
Publicado: (2024)
por: Yang, Sheng, et al.
Publicado: (2024)
Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
por: Cai, Xu, et al.
Publicado: (2025)
por: Cai, Xu, et al.
Publicado: (2025)
Epistemic Uncertainty Quantification For Pre-trained Neural Network
por: Wang, Hanjing, et al.
Publicado: (2024)
por: Wang, Hanjing, et al.
Publicado: (2024)
Centered Masking for Language-Image Pre-Training
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
por: Liu, Jiarun, et al.
Publicado: (2024)
por: Liu, Jiarun, et al.
Publicado: (2024)
Contrastive Localized Language-Image Pre-Training
por: Chen, Hong-You, et al.
Publicado: (2024)
por: Chen, Hong-You, et al.
Publicado: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
por: Lian, Chenyu, et al.
Publicado: (2025)
por: Lian, Chenyu, et al.
Publicado: (2025)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
por: Seo, Ara, et al.
Publicado: (2025)
por: Seo, Ara, et al.
Publicado: (2025)
MultiMed: Massively Multimodal and Multitask Medical Understanding
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
Progressive Compositionality in Text-to-Image Generative Models
por: Han, Evans Xu, et al.
Publicado: (2024)
por: Han, Evans Xu, et al.
Publicado: (2024)
Ejemplares similares
-
LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing
por: Yan, Huimin, et al.
Publicado: (2026) -
STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment
por: Lee, Jaewoo, et al.
Publicado: (2023) -
Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images
por: Liu, Che, et al.
Publicado: (2023) -
Multimodal Autoregressive Pre-training of Large Vision Encoders
por: Fini, Enrico, et al.
Publicado: (2024) -
Distributionally Robust Alignment for Medical Federated Vision-Language Pre-training Under Data Heterogeneity
por: Shuai, Zitao, et al.
Publicado: (2024)