Saved in:
| Main Authors: | Chen, Zhen, Fu, Yihang, Madera, Gabriel, Giuffre, Mauro, Applebaum, Serina, Kim, Hyunjae, Xu, Hua, Chen, Qingyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2511.22232 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
by: Kim, Dain, et al.
Published: (2026)
by: Kim, Dain, et al.
Published: (2026)
Humans and Large Language Models in Clinical Decision Support: A Study with Medical Calculators
by: Wan, Nicholas, et al.
Published: (2024)
by: Wan, Nicholas, et al.
Published: (2024)
Augmenting Biomedical Named Entity Recognition with General-domain Resources
by: Yin, Yu, et al.
Published: (2024)
by: Yin, Yu, et al.
Published: (2024)
On the Wasserstein median of probability measures
by: You, Kisung, et al.
Published: (2022)
by: You, Kisung, et al.
Published: (2022)
LEME: Open Large Language Models for Ophthalmology with Advanced Reasoning and Clinical Validation
by: Kim, Hyunjae, et al.
Published: (2024)
by: Kim, Hyunjae, et al.
Published: (2024)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
by: Liu, Jie, et al.
Published: (2024)
by: Liu, Jie, et al.
Published: (2024)
ChatBench: From Static Benchmarks to Human-AI Evaluation
by: Chang, Serina, et al.
Published: (2025)
by: Chang, Serina, et al.
Published: (2025)
BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks
by: Li, Loka, et al.
Published: (2026)
by: Li, Loka, et al.
Published: (2026)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models
by: Ondov, Brian, et al.
Published: (2026)
by: Ondov, Brian, et al.
Published: (2026)
Learning from Negative Samples in Biomedical Generative Entity Linking
by: Kim, Chanhwi, et al.
Published: (2024)
by: Kim, Chanhwi, et al.
Published: (2024)
Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards
by: Yun, Jaehoon, et al.
Published: (2025)
by: Yun, Jaehoon, et al.
Published: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
PubTator 3.0: an AI-powered Literature Resource for Unlocking Biomedical Knowledge
by: Wei, Chih-Hsuan, et al.
Published: (2024)
by: Wei, Chih-Hsuan, et al.
Published: (2024)
MedINST: Meta Dataset of Biomedical Instructions
by: Han, Wenhan, et al.
Published: (2024)
by: Han, Wenhan, et al.
Published: (2024)
Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants
by: Suh, Joseph, et al.
Published: (2026)
by: Suh, Joseph, et al.
Published: (2026)
Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
by: Krsteski, Stefan, et al.
Published: (2025)
by: Krsteski, Stefan, et al.
Published: (2025)
GeneGPT: Augmenting Large Language Models with Domain Tools for Improved Access to Biomedical Information
by: Jin, Qiao, et al.
Published: (2023)
by: Jin, Qiao, et al.
Published: (2023)
EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records
by: Qian, Lingfei, et al.
Published: (2026)
by: Qian, Lingfei, et al.
Published: (2026)
Lagrange Duality and Compound Multi-Attention Transformer for Semi-Supervised Medical Image Segmentation
by: Zheng, Fuchen, et al.
Published: (2024)
by: Zheng, Fuchen, et al.
Published: (2024)
Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions
by: Hou, Yutao, et al.
Published: (2024)
by: Hou, Yutao, et al.
Published: (2024)
Med-CoReasoner: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning
by: Gao, Fan, et al.
Published: (2026)
by: Gao, Fan, et al.
Published: (2026)
Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights
by: Kim, Hyunjae, et al.
Published: (2025)
by: Kim, Hyunjae, et al.
Published: (2025)
Pub-Guard-LLM: Detecting Retracted Biomedical Articles with Reliable Explanations
by: Chen, Lihu, et al.
Published: (2025)
by: Chen, Lihu, et al.
Published: (2025)
Foundation Models to Unlock Real-World Evidence from Nationwide Medical Claims
by: Ma, Fan, et al.
Published: (2026)
by: Ma, Fan, et al.
Published: (2026)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
by: Ye, Hanrong, et al.
Published: (2025)
by: Ye, Hanrong, et al.
Published: (2025)
Benchmarking Next-Generation Reasoning-Focused Large Language Models in Ophthalmology: A Head-to-Head Evaluation on 5,888 Items
by: Zou, Minjie, et al.
Published: (2025)
by: Zou, Minjie, et al.
Published: (2025)
From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks
by: Ren, Qingyu, et al.
Published: (2026)
by: Ren, Qingyu, et al.
Published: (2026)
BDIViz: An Interactive Visualization System for Biomedical Schema Matching with LLM-Powered Validation
by: Wu, Eden, et al.
Published: (2025)
by: Wu, Eden, et al.
Published: (2025)
Fair Text to Medical Image Diffusion Model with Subgroup Distribution Aligned Tuning
by: Han, Xu, et al.
Published: (2024)
by: Han, Xu, et al.
Published: (2024)
Graph-Based Alternatives to LLMs for Human Simulation
by: Suh, Joseph, et al.
Published: (2025)
by: Suh, Joseph, et al.
Published: (2025)
Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
by: Jiang, Roy, et al.
Published: (2026)
by: Jiang, Roy, et al.
Published: (2026)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
by: Liu, Shaonan, et al.
Published: (2026)
by: Liu, Shaonan, et al.
Published: (2026)
DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain
by: Labrak, Yanis, et al.
Published: (2024)
by: Labrak, Yanis, et al.
Published: (2024)
Rationale-Guided Retrieval Augmented Generation for Medical Question Answering
by: Sohn, Jiwoong, et al.
Published: (2024)
by: Sohn, Jiwoong, et al.
Published: (2024)
From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
by: Yuan, Kun, et al.
Published: (2025)
by: Yuan, Kun, et al.
Published: (2025)
Augmenting Black-box LLMs with Medical Textbooks for Biomedical Question Answering
by: Wang, Yubo, et al.
Published: (2023)
by: Wang, Yubo, et al.
Published: (2023)
SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis
by: Cai, Hengxing, et al.
Published: (2024)
by: Cai, Hengxing, et al.
Published: (2024)
Accurate Measures of Vaccination and Concerns of Vaccine Holdouts from Web Search Logs
by: Chang, Serina, et al.
Published: (2023)
by: Chang, Serina, et al.
Published: (2023)
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
by: Liu, Yihang, et al.
Published: (2026)
by: Liu, Yihang, et al.
Published: (2026)
Similar Items
-
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
by: Kim, Dain, et al.
Published: (2026) -
Humans and Large Language Models in Clinical Decision Support: A Study with Medical Calculators
by: Wan, Nicholas, et al.
Published: (2024) -
Augmenting Biomedical Named Entity Recognition with General-domain Resources
by: Yin, Yu, et al.
Published: (2024) -
On the Wasserstein median of probability measures
by: You, Kisung, et al.
Published: (2022) -
LEME: Open Large Language Models for Ophthalmology with Advanced Reasoning and Clinical Validation
by: Kim, Hyunjae, et al.
Published: (2024)