Evaluating the Feasibility and Accuracy of Large Language Models for Medical History-Taking in Obstetrics and Gynecology
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Dou, Long, Ying, Zuoqiu, Sophia, Tang, Tian, Yin, Rong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study
von: Liu, Dou, et al.
Veröffentlicht: (2025)
von: Liu, Dou, et al.
Veröffentlicht: (2025)
The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality
von: Liu, Dou, et al.
Veröffentlicht: (2025)
von: Liu, Dou, et al.
Veröffentlicht: (2025)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
von: Mondorf, Philipp, et al.
Veröffentlicht: (2024)
von: Mondorf, Philipp, et al.
Veröffentlicht: (2024)
Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology
von: D'Amario, Vanessa, et al.
Veröffentlicht: (2025)
von: D'Amario, Vanessa, et al.
Veröffentlicht: (2025)
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
Zero, Finite, and Infinite Belief History of Theory of Mind Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
von: Huang, Liangjie, et al.
Veröffentlicht: (2025)
von: Huang, Liangjie, et al.
Veröffentlicht: (2025)
Towards Coarse-to-Fine Evaluation of Inference Efficiency for Large Language Models
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
von: Chen, Yushuo, et al.
Veröffentlicht: (2024)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
von: Khandekar, Nikhil, et al.
Veröffentlicht: (2024)
von: Khandekar, Nikhil, et al.
Veröffentlicht: (2024)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
von: Zheng, Tianpeng, et al.
Veröffentlicht: (2026)
von: Zheng, Tianpeng, et al.
Veröffentlicht: (2026)
Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models
von: Mohammadi, Seyedali, et al.
Veröffentlicht: (2026)
von: Mohammadi, Seyedali, et al.
Veröffentlicht: (2026)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice
von: Doshi, Savan
Veröffentlicht: (2026)
von: Doshi, Savan
Veröffentlicht: (2026)
AlpaCare:Instruction-tuned Large Language Models for Medical Application
von: Zhang, Xinlu, et al.
Veröffentlicht: (2023)
von: Zhang, Xinlu, et al.
Veröffentlicht: (2023)
Can Language Models Take A Hint? Prompting for Controllable Contextualized Commonsense Inference
von: Colon-Hernandez, Pedro, et al.
Veröffentlicht: (2024)
von: Colon-Hernandez, Pedro, et al.
Veröffentlicht: (2024)
Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models
von: Tang, Xushuo, et al.
Veröffentlicht: (2025)
von: Tang, Xushuo, et al.
Veröffentlicht: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
von: Vladika, Juraj, et al.
Veröffentlicht: (2025)
von: Vladika, Juraj, et al.
Veröffentlicht: (2025)
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
von: Yan, Shaotian, et al.
Veröffentlicht: (2025)
von: Yan, Shaotian, et al.
Veröffentlicht: (2025)
Visuospatial Perspective Taking in Multimodal Language Models
von: Prunty, Jonathan, et al.
Veröffentlicht: (2026)
von: Prunty, Jonathan, et al.
Veröffentlicht: (2026)
UrbanGPT: Spatio-Temporal Large Language Models
von: Li, Zhonghang, et al.
Veröffentlicht: (2024)
von: Li, Zhonghang, et al.
Veröffentlicht: (2024)
Synthesis and Evaluation of Long-term History-aware Medical Dialogue
von: Hu, Hebin, et al.
Veröffentlicht: (2026)
von: Hu, Hebin, et al.
Veröffentlicht: (2026)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
CriticEval: Evaluating Large Language Model as Critic
von: Lan, Tian, et al.
Veröffentlicht: (2024)
von: Lan, Tian, et al.
Veröffentlicht: (2024)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
Set-Valued Prediction for Large Language Models with Feasibility-Aware Coverage Guarantees
von: Li, Ye, et al.
Veröffentlicht: (2026)
von: Li, Ye, et al.
Veröffentlicht: (2026)
Large Language Models-Enabled Digital Twins for Precision Medicine in Rare Gynecological Tumors
von: Lammert, Jacqueline, et al.
Veröffentlicht: (2024)
von: Lammert, Jacqueline, et al.
Veröffentlicht: (2024)
Genshin: General Shield for Natural Language Processing with Large Language Models
von: Peng, Xiao, et al.
Veröffentlicht: (2024)
von: Peng, Xiao, et al.
Veröffentlicht: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
An Empirical Analysis on Large Language Models in Debate Evaluation
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
Evaluating the Application of ChatGPT in Outpatient Triage Guidance: A Comparative Study
von: Liu, Dou, et al.
Veröffentlicht: (2024)
von: Liu, Dou, et al.
Veröffentlicht: (2024)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
von: Malghan, Arjun R.
Veröffentlicht: (2025)
von: Malghan, Arjun R.
Veröffentlicht: (2025)
Evaluating Quantized Large Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
Automatic Transmission for LLM Tiers: Optimizing Cost and Accuracy in Large Language Models
von: Na, Injae, et al.
Veröffentlicht: (2025)
von: Na, Injae, et al.
Veröffentlicht: (2025)
Large Language Model-Driven Dynamic Assessment of Grammatical Accuracy in English Language Learner Writing
von: Jaganov, Timur, et al.
Veröffentlicht: (2025)
von: Jaganov, Timur, et al.
Veröffentlicht: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
von: Bao, Rong, et al.
Veröffentlicht: (2024)
von: Bao, Rong, et al.
Veröffentlicht: (2024)
Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models in Analysing Classroom Dialogue
von: Long, Yun, et al.
Veröffentlicht: (2024)
von: Long, Yun, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study
von: Liu, Dou, et al.
Veröffentlicht: (2025) -
The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality
von: Liu, Dou, et al.
Veröffentlicht: (2025) -
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
von: Mondorf, Philipp, et al.
Veröffentlicht: (2024) -
Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology
von: D'Amario, Vanessa, et al.
Veröffentlicht: (2025) -
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)