A Novel Ophthalmic Benchmark for Evaluating Multimodal Large Language Models with Fundus Photographs and OCT Images
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liang, Xiaoyi, Bian, Mouxiao, Chen, Moxin, Liu, Lihao, He, Junjun, Xu, Jie, Li, Lin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine
von: Huang, Tianai, et al.
Veröffentlicht: (2025)
von: Huang, Tianai, et al.
Veröffentlicht: (2025)
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
von: He, Zhichao, et al.
Veröffentlicht: (2025)
von: He, Zhichao, et al.
Veröffentlicht: (2025)
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
von: Bian, Mouxiao, et al.
Veröffentlicht: (2025)
von: Bian, Mouxiao, et al.
Veröffentlicht: (2025)
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
von: Zhu, Siyu, et al.
Veröffentlicht: (2025)
von: Zhu, Siyu, et al.
Veröffentlicht: (2025)
Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation
von: Qin, Zhi, et al.
Veröffentlicht: (2025)
von: Qin, Zhi, et al.
Veröffentlicht: (2025)
EyeGPT: Ophthalmic Assistant with Large Language Models
von: Chen, Xiaolan, et al.
Veröffentlicht: (2024)
von: Chen, Xiaolan, et al.
Veröffentlicht: (2024)
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
von: Jiang, Luyi, et al.
Veröffentlicht: (2025)
von: Jiang, Luyi, et al.
Veröffentlicht: (2025)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
von: Ding, Jinru, et al.
Veröffentlicht: (2025)
von: Ding, Jinru, et al.
Veröffentlicht: (2025)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
von: Yang, Yan, et al.
Veröffentlicht: (2025)
von: Yang, Yan, et al.
Veröffentlicht: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
von: Mao, Kangkun, et al.
Veröffentlicht: (2025)
von: Mao, Kangkun, et al.
Veröffentlicht: (2025)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
von: Chen, Kedi, et al.
Veröffentlicht: (2024)
von: Chen, Kedi, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models for Multimodal Simulated Ophthalmic Decision-Making in Diabetic Retinopathy and Glaucoma Screening
von: Tabuse, Cindy Lie, et al.
Veröffentlicht: (2025)
von: Tabuse, Cindy Lie, et al.
Veröffentlicht: (2025)
MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
von: Dong, Xuanzhao, et al.
Veröffentlicht: (2026)
von: Dong, Xuanzhao, et al.
Veröffentlicht: (2026)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model Evaluation
von: Yin, Xunjian, et al.
Veröffentlicht: (2024)
von: Yin, Xunjian, et al.
Veröffentlicht: (2024)
IPEval: A Bilingual Intellectual Property Agency Consultation Evaluation Benchmark for Large Language Models
von: Wang, Qiyao, et al.
Veröffentlicht: (2024)
von: Wang, Qiyao, et al.
Veröffentlicht: (2024)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models
von: Chen, Kai, et al.
Veröffentlicht: (2025)
von: Chen, Kai, et al.
Veröffentlicht: (2025)
TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2024)
von: Zhang, Xue, et al.
Veröffentlicht: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
von: He, Bowei, et al.
Veröffentlicht: (2025)
von: He, Bowei, et al.
Veröffentlicht: (2025)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
von: Liu, Ziqiang, et al.
Veröffentlicht: (2024)
von: Liu, Ziqiang, et al.
Veröffentlicht: (2024)
A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding
von: Shen, Yiqing, et al.
Veröffentlicht: (2024)
von: Shen, Yiqing, et al.
Veröffentlicht: (2024)
MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
von: Ji, Yiyan, et al.
Veröffentlicht: (2025)
von: Ji, Yiyan, et al.
Veröffentlicht: (2025)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
von: Liu, Wentao, et al.
Veröffentlicht: (2024)
von: Liu, Wentao, et al.
Veröffentlicht: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
von: Hong, Jindong, et al.
Veröffentlicht: (2025)
von: Hong, Jindong, et al.
Veröffentlicht: (2025)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
von: Xu, Xinzhe, et al.
Veröffentlicht: (2025)
von: Xu, Xinzhe, et al.
Veröffentlicht: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
von: Hu, He, et al.
Veröffentlicht: (2025)
von: Hu, He, et al.
Veröffentlicht: (2025)
Evaluating Accounting Reasoning Capabilities of Large Language Models
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
von: Zhou, Jie, et al.
Veröffentlicht: (2026)
MultiEYE: Dataset and Benchmark for OCT-Enhanced Retinal Disease Recognition from Fundus Images
von: Wang, Lehan, et al.
Veröffentlicht: (2024)
von: Wang, Lehan, et al.
Veröffentlicht: (2024)
Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
von: Wang, Shuai, et al.
Veröffentlicht: (2024)
von: Wang, Shuai, et al.
Veröffentlicht: (2024)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
von: Yan, Yibo, et al.
Veröffentlicht: (2024)
von: Yan, Yibo, et al.
Veröffentlicht: (2024)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
von: Li, Moxin, et al.
Veröffentlicht: (2023)
von: Li, Moxin, et al.
Veröffentlicht: (2023)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine
von: Huang, Tianai, et al.
Veröffentlicht: (2025) -
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
von: He, Zhichao, et al.
Veröffentlicht: (2025) -
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
von: Bian, Mouxiao, et al.
Veröffentlicht: (2025) -
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
von: Zhu, Siyu, et al.
Veröffentlicht: (2025) -
Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation
von: Qin, Zhi, et al.
Veröffentlicht: (2025)