RET-CLIP: A Retinal Image Foundation Model Pre-trained with Clinical Diagnostic Reports
Fuente:
arXiv
Saved in:
| Main Authors: | Du, Jiawei, Guo, Jia, Zhang, Weihang, Yang, Shengzhu, Liu, Hanruo, Li, Huiqi, Wang, Ningli |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
by: Yang, Shengzhu, et al.
Published: (2024)
by: Yang, Shengzhu, et al.
Published: (2024)
CLIPin: A Non-contrastive Plug-in to CLIP for Multimodal Semantic Alignment
by: Yang, Shengzhu, et al.
Published: (2025)
by: Yang, Shengzhu, et al.
Published: (2025)
Native Intelligence Emerges from Large-Scale Clinical Practice: A Retinal Foundation Model with Deployment Efficiency
by: Guo, Jia, et al.
Published: (2025)
by: Guo, Jia, et al.
Published: (2025)
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
by: Lu, Shuai, et al.
Published: (2026)
by: Lu, Shuai, et al.
Published: (2026)
RetSTA: An LLM-Based Approach for Standardizing Clinical Fundus Image Reports
by: Cai, Jiushen, et al.
Published: (2025)
by: Cai, Jiushen, et al.
Published: (2025)
Absolute-Unified Multi-Class Anomaly Detection via Class-Agnostic Distribution Alignment
by: Guo, Jia, et al.
Published: (2024)
by: Guo, Jia, et al.
Published: (2024)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
by: Yao, Xin, et al.
Published: (2025)
by: Yao, Xin, et al.
Published: (2025)
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
by: Jin, Jiayun, et al.
Published: (2026)
by: Jin, Jiayun, et al.
Published: (2026)
Dinomaly: The Less Is More Philosophy in Multi-Class Unsupervised Anomaly Detection
by: Guo, Jia, et al.
Published: (2024)
by: Guo, Jia, et al.
Published: (2024)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
by: Yao, Yuang, et al.
Published: (2025)
by: Yao, Yuang, et al.
Published: (2025)
PROMPT-IML: Image Manipulation Localization with Pre-trained Foundation Models Through Prompt Tuning
by: Liu, Xuntao, et al.
Published: (2024)
by: Liu, Xuntao, et al.
Published: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
by: Zhu, Lei, et al.
Published: (2025)
by: Zhu, Lei, et al.
Published: (2025)
Bi-CRCL: Bidirectional Conservative-Radical Complementary Learning with Pre-trained Foundation Models for Class-incremental Medical Image Analysis
by: Wu, Xinyao, et al.
Published: (2026)
by: Wu, Xinyao, et al.
Published: (2026)
Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models
by: Orlova, Svetlana, et al.
Published: (2026)
by: Orlova, Svetlana, et al.
Published: (2026)
RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding
by: Fang, Tianchen, et al.
Published: (2025)
by: Fang, Tianchen, et al.
Published: (2025)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
by: Zhao, Shuai, et al.
Published: (2023)
by: Zhao, Shuai, et al.
Published: (2023)
Boosting the Generalization Ability for Hyperspectral Image Classification using Spectral-spatial Axial Aggregation Transformer
by: Zhao, Enzhe, et al.
Published: (2023)
by: Zhao, Enzhe, et al.
Published: (2023)
RadCLIP: Enhancing Radiologic Image Analysis through Contrastive Language-Image Pre-training
by: Lu, Zhixiu, et al.
Published: (2024)
by: Lu, Zhixiu, et al.
Published: (2024)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
by: Tian, Qingyao, et al.
Published: (2025)
by: Tian, Qingyao, et al.
Published: (2025)
AdFair-CLIP: Adversarial Fair Contrastive Language-Image Pre-training for Chest X-rays
by: Yi, Chenlang, et al.
Published: (2025)
by: Yi, Chenlang, et al.
Published: (2025)
Teach CLIP to Develop a Number Sense for Ordinal Regression
by: Du, Yao, et al.
Published: (2024)
by: Du, Yao, et al.
Published: (2024)
Endo-CLIP: Progressive Self-Supervised Pre-training on Raw Colonoscopy Records
by: He, Yili, et al.
Published: (2025)
by: He, Yili, et al.
Published: (2025)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
by: Chen, Yitong, et al.
Published: (2025)
by: Chen, Yitong, et al.
Published: (2025)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
by: Wang, Hengkang, et al.
Published: (2025)
by: Wang, Hengkang, et al.
Published: (2025)
Large-scale DSM registration via motion averaging
by: Xu, Ningli, et al.
Published: (2024)
by: Xu, Ningli, et al.
Published: (2024)
Geospecific View Generation -- Geometry-Context Aware High-resolution Ground View Inference from Satellite Views
by: Xu, Ningli, et al.
Published: (2024)
by: Xu, Ningli, et al.
Published: (2024)
Satellite to GroundScape -- Large-scale Consistent Ground View Generation from Satellite Views
by: Xu, Ningli, et al.
Published: (2025)
by: Xu, Ningli, et al.
Published: (2025)
Cross-view Localization and Synthesis -- Datasets, Challenges and Opportunities
by: Xu, Ningli, et al.
Published: (2025)
by: Xu, Ningli, et al.
Published: (2025)
Re-initialization-free Level Set Method via Molecular Beam Epitaxy Equation Regularization for Image Segmentation
by: Song, Fanghui, et al.
Published: (2023)
by: Song, Fanghui, et al.
Published: (2023)
Universal Image Restoration Pre-training via Degradation Classification
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
by: Wang, Zhao, et al.
Published: (2023)
by: Wang, Zhao, et al.
Published: (2023)
Unified Multi-modal Diagnostic Framework with Reconstruction Pre-training and Heterogeneity-combat Tuning
by: Zhang, Yupei, et al.
Published: (2024)
by: Zhang, Yupei, et al.
Published: (2024)
CLAPS: A CLIP-Unified Auto-Prompt Segmentation for Multi-Modal Retinal Imaging
by: Zhao, Zhihao, et al.
Published: (2025)
by: Zhao, Zhihao, et al.
Published: (2025)
Scalable Pre-training of Large Autoregressive Image Models
by: El-Nouby, Alaaeldin, et al.
Published: (2024)
by: El-Nouby, Alaaeldin, et al.
Published: (2024)
Boosting Image Restoration via Priors from Pre-trained Models
by: Xu, Xiaogang, et al.
Published: (2024)
by: Xu, Xiaogang, et al.
Published: (2024)
CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner
by: Du, Yao, et al.
Published: (2025)
by: Du, Yao, et al.
Published: (2025)
Evaluating Pre-trained Convolutional Neural Networks and Foundation Models as Feature Extractors for Content-based Medical Image Retrieval
by: Mahbod, Amirreza, et al.
Published: (2024)
by: Mahbod, Amirreza, et al.
Published: (2024)
Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images
by: Fang, Donghai, et al.
Published: (2026)
by: Fang, Donghai, et al.
Published: (2026)
Mammo-CLIP: Leveraging Contrastive Language-Image Pre-training (CLIP) for Enhanced Breast Cancer Diagnosis with Multi-view Mammography
by: Chen, Xuxin, et al.
Published: (2024)
by: Chen, Xuxin, et al.
Published: (2024)
MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
by: Yang, Min, et al.
Published: (2025)
by: Yang, Min, et al.
Published: (2025)
Similar Items
-
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
by: Yang, Shengzhu, et al.
Published: (2024) -
CLIPin: A Non-contrastive Plug-in to CLIP for Multimodal Semantic Alignment
by: Yang, Shengzhu, et al.
Published: (2025) -
Native Intelligence Emerges from Large-Scale Clinical Practice: A Retinal Foundation Model with Deployment Efficiency
by: Guo, Jia, et al.
Published: (2025) -
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
by: Lu, Shuai, et al.
Published: (2026) -
RetSTA: An LLM-Based Approach for Standardizing Clinical Fundus Image Reports
by: Cai, Jiushen, et al.
Published: (2025)