Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Pusheng, Gong, Xia, Chen, Xiaolan, Zhang, Weiyi, Yang, Jiancheng, Yan, Bingjie, Yuan, Meng, Zheng, Yalin, He, Mingguang, Shi, Danli |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
por: Chen, Xiaolan, et al.
Publicado: (2024)
por: Chen, Xiaolan, et al.
Publicado: (2024)
EyeGPT: Ophthalmic Assistant with Large Language Models
por: Chen, Xiaolan, et al.
Publicado: (2024)
por: Chen, Xiaolan, et al.
Publicado: (2024)
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
por: Shi, Danli, et al.
Publicado: (2024)
por: Shi, Danli, et al.
Publicado: (2024)
DeepSeek-R1 Outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in Bilingual Complex Ophthalmology Reasoning
por: Xu, Pusheng, et al.
Publicado: (2025)
por: Xu, Pusheng, et al.
Publicado: (2025)
EyeDiff: text-to-image diffusion model improves rare eye disease diagnosis
por: Chen, Ruoyu, et al.
Publicado: (2024)
por: Chen, Ruoyu, et al.
Publicado: (2024)
Fundus to Fluorescein Angiography Video Generation as a Retinal Generative Foundation Model
por: Zhang, Weiyi, et al.
Publicado: (2024)
por: Zhang, Weiyi, et al.
Publicado: (2024)
EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology
por: Shi, Danli, et al.
Publicado: (2025)
por: Shi, Danli, et al.
Publicado: (2025)
Empowering Locally Deployable Medical Agent via State Enhanced Logical Skills for FHIR-based Clinical Tasks
por: Yang, Wanrong, et al.
Publicado: (2026)
por: Yang, Wanrong, et al.
Publicado: (2026)
Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance
por: Zhang, Weiyi, et al.
Publicado: (2024)
por: Zhang, Weiyi, et al.
Publicado: (2024)
ChatMyopia: An AI Agent for Pre-consultation Education in Primary Eye Care Settings
por: Wu, Yue, et al.
Publicado: (2025)
por: Wu, Yue, et al.
Publicado: (2025)
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
por: Shi, Danli, et al.
Publicado: (2024)
por: Shi, Danli, et al.
Publicado: (2024)
Evaluating large language models in medical applications: a survey
por: Chen, Xiaolan, et al.
Publicado: (2024)
por: Chen, Xiaolan, et al.
Publicado: (2024)
UWF-RI2FA: Generating Multi-frame Ultrawide-field Fluorescein Angiography from Ultrawide-field Retinal Imaging Improves Diabetic Retinopathy Stratification
por: Chen, Ruoyu, et al.
Publicado: (2024)
por: Chen, Ruoyu, et al.
Publicado: (2024)
EyeWorld: A Generative World Model of Ocular State and Dynamics
por: Gao, Ziyu, et al.
Publicado: (2026)
por: Gao, Ziyu, et al.
Publicado: (2026)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
por: Chen, Zixin, et al.
Publicado: (2025)
por: Chen, Zixin, et al.
Publicado: (2025)
Predicting Diabetic Macular Edema Treatment Responses Using OCT: Dataset and Methods of APTOS Competition
por: Zhang, Weiyi, et al.
Publicado: (2025)
por: Zhang, Weiyi, et al.
Publicado: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
AI-powered virtual eye: perspective, challenges and opportunities
por: Wu, Yue, et al.
Publicado: (2025)
por: Wu, Yue, et al.
Publicado: (2025)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
por: Song, Seokwon, et al.
Publicado: (2025)
por: Song, Seokwon, et al.
Publicado: (2025)
Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan
por: Yao, Jui-Ming, et al.
Publicado: (2025)
por: Yao, Jui-Ming, et al.
Publicado: (2025)
FFA Sora, video generation as fundus fluorescein angiography simulator
por: Wu, Xinyuan, et al.
Publicado: (2024)
por: Wu, Xinyuan, et al.
Publicado: (2024)
Fundus2Globe: Generative AI-Driven 3D Digital Twins for Personalized Myopia Management
por: Shi, Danli, et al.
Publicado: (2025)
por: Shi, Danli, et al.
Publicado: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
por: Chen, Zhuo, et al.
Publicado: (2026)
por: Chen, Zhuo, et al.
Publicado: (2026)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
por: Wen, Haoyang, et al.
Publicado: (2024)
por: Wen, Haoyang, et al.
Publicado: (2024)
Multimodal Commonsense Knowledge Distillation for Visual Question Answering
por: Yang, Shuo, et al.
Publicado: (2024)
por: Yang, Shuo, et al.
Publicado: (2024)
OWLViz: An Open-World Benchmark for Visual Question Answering
por: Nguyen, Thuy, et al.
Publicado: (2025)
por: Nguyen, Thuy, et al.
Publicado: (2025)
Incomplete Modality Disentangled Representation for Ophthalmic Disease Grading and Diagnosis
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
por: Zhang, Chengyi, et al.
Publicado: (2026)
por: Zhang, Chengyi, et al.
Publicado: (2026)
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
por: Park, Jean, et al.
Publicado: (2024)
por: Park, Jean, et al.
Publicado: (2024)
Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering
por: Chen, Xupeng, et al.
Publicado: (2026)
por: Chen, Xupeng, et al.
Publicado: (2026)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
por: Dong, Kuicai, et al.
Publicado: (2025)
por: Dong, Kuicai, et al.
Publicado: (2025)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
por: Fan, Lin, et al.
Publicado: (2024)
por: Fan, Lin, et al.
Publicado: (2024)
Choroidal Vessel Segmentation on Indocyanine Green Angiography Images via Human-in-the-Loop Labeling
por: Chen, Ruoyu, et al.
Publicado: (2024)
por: Chen, Ruoyu, et al.
Publicado: (2024)
Ejemplares similares
-
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
por: Chen, Xiaolan, et al.
Publicado: (2024) -
EyeGPT: Ophthalmic Assistant with Large Language Models
por: Chen, Xiaolan, et al.
Publicado: (2024) -
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
por: Shi, Danli, et al.
Publicado: (2024) -
DeepSeek-R1 Outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in Bilingual Complex Ophthalmology Reasoning
por: Xu, Pusheng, et al.
Publicado: (2025) -
EyeDiff: text-to-image diffusion model improves rare eye disease diagnosis
por: Chen, Ruoyu, et al.
Publicado: (2024)