VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Jianing, Wu, Jian, Wei, Hao, Shi, Peilun, Zhang, Minqing, Sun, Yunyun, Li, Lin, Liu, Hanruo, Liu, Hongyi, Hou, Simeng, Zhao, Yuyang, Shi, Xuehui, Xian, Junfang, Qu, Xiaoxia, Zhu, Sirui, Pan, Lijie, Chen, Xiaoniao, Zhang, Xiaojia, Jiang, Shuai, Wang, Kebing, Yang, Chenlong, Chen, Mingqiang, Fan, Sujie, Hu, Jianhua, Lv, Aiguo, Miao, Hui, Guo, Li, Zhang, Shujun, Pei, Cheng, Fan, Xiaojuan, Lei, Jianqin, Wei, Ting, Duan, Junguo, Liu, Chun, Xia, Xiaobo, Xiong, Siqi, Li, Junhong, Lo, Benny, Tham, Yih Chung, Wong, Tien Yin, Wang, Ningli, Yuan, Wu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
di: Wei, Hao, et al.
Pubblicazione: (2024)
di: Wei, Hao, et al.
Pubblicazione: (2024)
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
di: Yang, Shengzhu, et al.
Pubblicazione: (2024)
di: Yang, Shengzhu, et al.
Pubblicazione: (2024)
RetSTA: An LLM-Based Approach for Standardizing Clinical Fundus Image Reports
di: Cai, Jiushen, et al.
Pubblicazione: (2025)
di: Cai, Jiushen, et al.
Pubblicazione: (2025)
RET-CLIP: A Retinal Image Foundation Model Pre-trained with Clinical Diagnostic Reports
di: Du, Jiawei, et al.
Pubblicazione: (2024)
di: Du, Jiawei, et al.
Pubblicazione: (2024)
Planning with Logical Graph-based Language Model for Instruction Generation
di: Zhang, Fan, et al.
Pubblicazione: (2023)
di: Zhang, Fan, et al.
Pubblicazione: (2023)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
Journal of Ophthalmic & Vision Research
Pubblicazione: (2009)
Pubblicazione: (2009)
Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
di: Chen, Jiankang, et al.
Pubblicazione: (2025)
di: Chen, Jiankang, et al.
Pubblicazione: (2025)
Complex Neutrosophic α-Discounting Method for Multi-Criteria Risk Assessment under Periodic and Indeterminate Comprehensive Agro-Meteorological Hazards
di: Qiang Li, et al.
Pubblicazione: (2025)
di: Qiang Li, et al.
Pubblicazione: (2025)
A Labeled Ophthalmic Ultrasound Dataset with Medical Report Generation Based on Cross-modal Deep Learning
di: Wang, Jing, et al.
Pubblicazione: (2024)
di: Wang, Jing, et al.
Pubblicazione: (2024)
SCRWKV: Ultra-Compact Structure-Calibrated Vision-RWKV for Topological Crack Segmentation
di: Zhang, Hanxu, et al.
Pubblicazione: (2026)
di: Zhang, Hanxu, et al.
Pubblicazione: (2026)
Distinct spatiotemporal patterns of juxtacortical microstructure in Alzheimer's Disease
di: Binyin Li, et al.
Pubblicazione: (2025)
di: Binyin Li, et al.
Pubblicazione: (2025)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
LaMOT: Language-Guided Multi-Object Tracking
di: Li, Yunhao, et al.
Pubblicazione: (2024)
di: Li, Yunhao, et al.
Pubblicazione: (2024)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
di: Zhang, Chunhui, et al.
Pubblicazione: (2023)
WDMamba: When Wavelet Degradation Prior Meets Vision Mamba for Image Dehazing
di: Sun, Jie, et al.
Pubblicazione: (2025)
di: Sun, Jie, et al.
Pubblicazione: (2025)
Dynamics and Control of Vision-Aided Multi-UAV-tethered Netted System Capturing Non-Cooperative Target
di: Liu, Runhan, et al.
Pubblicazione: (2025)
di: Liu, Runhan, et al.
Pubblicazione: (2025)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
IBGP: Imperfect Byzantine Generals Problem for Zero-Shot Robustness in Communicative Multi-Agent Systems
di: Mao, Yihuan, et al.
Pubblicazione: (2024)
di: Mao, Yihuan, et al.
Pubblicazione: (2024)
Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
di: Shi, Mingjia, et al.
Pubblicazione: (2026)
di: Shi, Mingjia, et al.
Pubblicazione: (2026)
Exact CHY Integrand Construction Using Combinatorial Neural Networks and Discrete Optimization
di: Li, Simeng, et al.
Pubblicazione: (2025)
di: Li, Simeng, et al.
Pubblicazione: (2025)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
di: Yan, Yu, et al.
Pubblicazione: (2024)
di: Yan, Yu, et al.
Pubblicazione: (2024)
Prismer: A Vision-Language Model with Multi-Task Experts
di: Liu, Shikun, et al.
Pubblicazione: (2023)
di: Liu, Shikun, et al.
Pubblicazione: (2023)
SGW-based Multi-Task Learning in Vision Tasks
di: Zhang, Ruiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyuan, et al.
Pubblicazione: (2024)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
di: Fan, Jiawei, et al.
Pubblicazione: (2024)
di: Fan, Jiawei, et al.
Pubblicazione: (2024)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
di: Xue, Haotian, et al.
Pubblicazione: (2025)
di: Xue, Haotian, et al.
Pubblicazione: (2025)
SCSegamba: Lightweight Structure-Aware Vision Mamba for Crack Segmentation in Structures
di: Liu, Hui, et al.
Pubblicazione: (2025)
di: Liu, Hui, et al.
Pubblicazione: (2025)
Research on Constructing a Competency Model for Ophthalmic Nurses Based on Delphi Method
di: Sumei Liu, et al.
Pubblicazione: (2025)
di: Sumei Liu, et al.
Pubblicazione: (2025)
From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models
di: Fan, Zicheng, et al.
Pubblicazione: (2025)
di: Fan, Zicheng, et al.
Pubblicazione: (2025)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
di: Ye, Yaoqin, et al.
Pubblicazione: (2024)
Summit Vitals: Multi-Camera and Multi-Signal Biosensing at High Altitudes
di: Liu, Ke, et al.
Pubblicazione: (2024)
di: Liu, Ke, et al.
Pubblicazione: (2024)
Multi-modal Attribute Prompting for Vision-Language Models
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Short‐Peptide‐Induced Diffusion‐limited Plasmonic Aggregation with Broad Spectral Tunability for Wearable Ophthalmic Devices in Color Vision Deficiency Correction
di: Shengdong Ran, et al.
Pubblicazione: (2024)
di: Shengdong Ran, et al.
Pubblicazione: (2024)
SPIRIT: Adapting Vision Foundation Models for Unified Single- and Multi-Frame Infrared Small Target Detection
di: Xu, Qian, et al.
Pubblicazione: (2026)
di: Xu, Qian, et al.
Pubblicazione: (2026)
ADM-DP: Adaptive Dynamic Modality Diffusion Policy through Vision-Tactile-Graph Fusion for Multi-Agent Manipulation
di: Wang, Enyi, et al.
Pubblicazione: (2026)
di: Wang, Enyi, et al.
Pubblicazione: (2026)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
di: Choi, In Chong, et al.
Pubblicazione: (2026)
di: Choi, In Chong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
di: Wei, Hao, et al.
Pubblicazione: (2024) -
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
di: Yang, Shengzhu, et al.
Pubblicazione: (2024) -
RetSTA: An LLM-Based Approach for Standardizing Clinical Fundus Image Reports
di: Cai, Jiushen, et al.
Pubblicazione: (2025) -
RET-CLIP: A Retinal Image Foundation Model Pre-trained with Clinical Diagnostic Reports
di: Du, Jiawei, et al.
Pubblicazione: (2024) -
Planning with Logical Graph-based Language Model for Instruction Generation
di: Zhang, Fan, et al.
Pubblicazione: (2023)