MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Biao, Xie, Yutong, Zhang, Zeyu, Phan, Minh Hieu, Chen, Qi, Chen, Ling, Wu, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
A Survey of Medical Vision-and-Language Applications and Their Techniques
por: Chen, Qi, et al.
Publicado: (2024)
por: Chen, Qi, et al.
Publicado: (2024)
Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
A Comprehensive Analysis of Mamba for 3D Volumetric Medical Image Segmentation
por: Wang, Chaohan, et al.
Publicado: (2025)
por: Wang, Chaohan, et al.
Publicado: (2025)
Act Like a Radiologist: Radiology Report Generation across Anatomical Regions
por: Chen, Qi, et al.
Publicado: (2023)
por: Chen, Qi, et al.
Publicado: (2023)
Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning
por: Guan, Jinquan, et al.
Publicado: (2025)
por: Guan, Jinquan, et al.
Publicado: (2025)
MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis
por: Zhuang, Jiaxin, et al.
Publicado: (2024)
por: Zhuang, Jiaxin, et al.
Publicado: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
OVG-HQ: Online Video Grounding with Hybrid-modal Queries
por: Zeng, Runhao, et al.
Publicado: (2025)
por: Zeng, Runhao, et al.
Publicado: (2025)
MedCutMix: A Data-Centric Approach to Improve Radiology Vision-Language Pre-training with Disease Awareness
por: Wang, Sinuo, et al.
Publicado: (2025)
por: Wang, Sinuo, et al.
Publicado: (2025)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
por: Bhaila, Karuna, et al.
Publicado: (2025)
por: Bhaila, Karuna, et al.
Publicado: (2025)
Masked Contrastive Reconstruction for Cross-modal Medical Image-Report Retrieval
por: Wei, Zeqiang, et al.
Publicado: (2023)
por: Wei, Zeqiang, et al.
Publicado: (2023)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
por: Gong, Biao, et al.
Publicado: (2023)
por: Gong, Biao, et al.
Publicado: (2023)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
por: Gao, Jin, et al.
Publicado: (2024)
por: Gao, Jin, et al.
Publicado: (2024)
PairAug: What Can Augmented Image-Text Pairs Do for Radiology?
por: Xie, Yutong, et al.
Publicado: (2024)
por: Xie, Yutong, et al.
Publicado: (2024)
Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding
por: Huy, Ta Duc, et al.
Publicado: (2025)
por: Huy, Ta Duc, et al.
Publicado: (2025)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
por: Zhao, Zhiyu, et al.
Publicado: (2023)
por: Zhao, Zhiyu, et al.
Publicado: (2023)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
por: Liu, Jiarun, et al.
Publicado: (2024)
por: Liu, Jiarun, et al.
Publicado: (2024)
CIT: Rethinking Class-incremental Semantic Segmentation with a Class Independent Transformation
por: Ge, Jinchao, et al.
Publicado: (2024)
por: Ge, Jinchao, et al.
Publicado: (2024)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
por: Xiao, Changming, et al.
Publicado: (2023)
por: Xiao, Changming, et al.
Publicado: (2023)
Pre-trained Models Succeed in Medical Imaging with Representation Similarity Degradation
por: Zu, Wenqiang, et al.
Publicado: (2025)
por: Zu, Wenqiang, et al.
Publicado: (2025)
Centered Masking for Language-Image Pre-Training
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
por: Shoby, Abin, et al.
Publicado: (2026)
por: Shoby, Abin, et al.
Publicado: (2026)
AdaCBM: An Adaptive Concept Bottleneck Model for Explainable and Accurate Diagnosis
por: Chowdhury, Townim F., et al.
Publicado: (2024)
por: Chowdhury, Townim F., et al.
Publicado: (2024)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
por: Zhang, Yudong, et al.
Publicado: (2024)
por: Zhang, Yudong, et al.
Publicado: (2024)
Pre-Trained Masked Image Model for Mobile Robot Navigation
por: Sharma, Vishnu Dutt, et al.
Publicado: (2023)
por: Sharma, Vishnu Dutt, et al.
Publicado: (2023)
On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
por: Van, Minh-Hao, et al.
Publicado: (2024)
por: Van, Minh-Hao, et al.
Publicado: (2024)
DGRNet: Disagreement-Guided Refinement for Uncertainty-Aware Brain Tumor Segmentation
por: Mohammadi, Bahram, et al.
Publicado: (2026)
por: Mohammadi, Bahram, et al.
Publicado: (2026)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
por: Ma, Shuailei, et al.
Publicado: (2023)
por: Ma, Shuailei, et al.
Publicado: (2023)
Polyline Path Masked Attention for Vision Transformer
por: Zhao, Zhongchen, et al.
Publicado: (2025)
por: Zhao, Zhongchen, et al.
Publicado: (2025)
MaskMed: Decoupled Mask and Class Prediction for Medical Image Segmentation
por: Xie, Bin, et al.
Publicado: (2025)
por: Xie, Bin, et al.
Publicado: (2025)
SelfMedHPM: Self Pre-training With Hard Patches Mining Masked Autoencoders For Medical Image Segmentation
por: Lv, Yunhao, et al.
Publicado: (2025)
por: Lv, Yunhao, et al.
Publicado: (2025)
CmFNet: Cross-modal Fusion Network for Weakly-supervised Segmentation of Medical Images
por: Meng, Dongdong, et al.
Publicado: (2025)
por: Meng, Dongdong, et al.
Publicado: (2025)
Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image Restoration
por: Qin, Chu-Jie, et al.
Publicado: (2024)
por: Qin, Chu-Jie, et al.
Publicado: (2024)
UniVid: The Open-Source Unified Video Model
por: Luo, Jiabin, et al.
Publicado: (2025)
por: Luo, Jiabin, et al.
Publicado: (2025)
AnatoMask: Enhancing Medical Image Segmentation with Reconstruction-guided Self-masking
por: Li, Yuheng, et al.
Publicado: (2024)
por: Li, Yuheng, et al.
Publicado: (2024)
Few-Shot Medical Image Segmentation with Large Kernel Attention
por: Wu, Xiaoxiao, et al.
Publicado: (2024)
por: Wu, Xiaoxiao, et al.
Publicado: (2024)
DALIP: Distribution Alignment-based Language-Image Pre-Training for Domain-Specific Data
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
Medical Graph RAG: Towards Safe Medical Large Language Model via Graph Retrieval-Augmented Generation
por: Wu, Junde, et al.
Publicado: (2024)
por: Wu, Junde, et al.
Publicado: (2024)
Hierarchical Text-Guided Brain Tumor Segmentation via Sub-Region-Aware Prompts
por: Mohammadi, Bahram, et al.
Publicado: (2026)
por: Mohammadi, Bahram, et al.
Publicado: (2026)
Ejemplares similares
-
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024) -
A Survey of Medical Vision-and-Language Applications and Their Techniques
por: Chen, Qi, et al.
Publicado: (2024) -
Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024) -
A Comprehensive Analysis of Mamba for 3D Volumetric Medical Image Segmentation
por: Wang, Chaohan, et al.
Publicado: (2025) -
Act Like a Radiologist: Radiology Report Generation across Anatomical Regions
por: Chen, Qi, et al.
Publicado: (2023)