MedPI: Evaluating AI Systems in Medical Patient-facing Interactions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | V., Diego Fajardo, Proniakin, Oleksii, Gruber, Victoria-Elisabeth, Marinescu, Razvan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning
par: Ahmed, Md Shamim, et autres
Publié: (2026)
par: Ahmed, Md Shamim, et autres
Publié: (2026)
VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation
par: Kiet, Huynh Trung, et autres
Publié: (2026)
par: Kiet, Huynh Trung, et autres
Publié: (2026)
Automatic Replication of LLM Mistakes in Medical Conversations
par: Proniakin, Oleksii, et autres
Publié: (2025)
par: Proniakin, Oleksii, et autres
Publié: (2025)
MedHal: An Evaluation Dataset for Medical Hallucination Detection
par: Mehenni, Gaya, et autres
Publié: (2025)
par: Mehenni, Gaya, et autres
Publié: (2025)
Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages
par: Anyaegbuna, Chukwuebuka, et autres
Publié: (2026)
par: Anyaegbuna, Chukwuebuka, et autres
Publié: (2026)
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
par: Krolik, Jack, et autres
Publié: (2024)
par: Krolik, Jack, et autres
Publié: (2024)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
Evaluating the Challenges of LLMs in Real-world Medical Follow-up: A Comparative Study and An Optimized Framework
par: Liu, Jinyan, et autres
Publié: (2025)
par: Liu, Jinyan, et autres
Publié: (2025)
Shallow Robustness, Deep Vulnerabilities: Multi-Turn Evaluation of Medical LLMs
par: Manczak, Blazej, et autres
Publié: (2025)
par: Manczak, Blazej, et autres
Publié: (2025)
How to Evaluate Medical AI
par: Kopanichuk, Ilia, et autres
Publié: (2025)
par: Kopanichuk, Ilia, et autres
Publié: (2025)
Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
par: Shah, Aaryan, et autres
Publié: (2026)
par: Shah, Aaryan, et autres
Publié: (2026)
The Foundational Capabilities of Large Language Models in Predicting Postoperative Risks Using Clinical Notes
par: Alba, Charles, et autres
Publié: (2024)
par: Alba, Charles, et autres
Publié: (2024)
How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues
par: Petrova, Tatiana, et autres
Publié: (2026)
par: Petrova, Tatiana, et autres
Publié: (2026)
Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction
par: Ketir, Si-Belkacem Yamine, et autres
Publié: (2026)
par: Ketir, Si-Belkacem Yamine, et autres
Publié: (2026)
What distinguishes conspiracy from critical narratives? A computational analysis of oppositional discourse
par: Korenčić, Damir, et autres
Publié: (2024)
par: Korenčić, Damir, et autres
Publié: (2024)
Using Letter Positional Probabilities to Assess Word Complexity
par: Dalvean, Michael
Publié: (2024)
par: Dalvean, Michael
Publié: (2024)
Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis
par: Purushothama, Abhishek, et autres
Publié: (2025)
par: Purushothama, Abhishek, et autres
Publié: (2025)
BenCSSmark: Making the Social Sciences Count in LLM Research
par: Chatelain, Arnault, et autres
Publié: (2026)
par: Chatelain, Arnault, et autres
Publié: (2026)
LLMs Generate Kitsch
par: Klinge, Xenia, et autres
Publié: (2026)
par: Klinge, Xenia, et autres
Publié: (2026)
Integrating clinical reasoning into large language model-based diagnosis through etiology-aware attention steering
par: Li, Peixian, et autres
Publié: (2025)
par: Li, Peixian, et autres
Publié: (2025)
The Representational Alignment between Humans and Language Models is implicitly driven by a Concreteness Effect
par: Iaia, Cosimo, et autres
Publié: (2025)
par: Iaia, Cosimo, et autres
Publié: (2025)
Cheap Learning: Maximising Performance of Language Models for Social Data Science Using Minimal Data
par: Castro-Gonzalez, Leonardo, et autres
Publié: (2024)
par: Castro-Gonzalez, Leonardo, et autres
Publié: (2024)
Comparative Study of Large Language Models on Chinese Film Script Continuation: An Empirical Analysis Based on GPT-5.2 and Qwen-Max
par: Cao, Yuxuan, et autres
Publié: (2026)
par: Cao, Yuxuan, et autres
Publié: (2026)
Forgotten Words: Benchmarking NeoBERT for Dementia Detection in Low-Resource Conversational Filipino and English Speech
par: Floresca, Rez Samantha Z., et autres
Publié: (2026)
par: Floresca, Rez Samantha Z., et autres
Publié: (2026)
Collective Memory and Narrative Cohesion: A Computational Study of Palestinian Refugee Oral Histories in Lebanon
par: Awwad, Ghadeer, et autres
Publié: (2025)
par: Awwad, Ghadeer, et autres
Publié: (2025)
PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
par: Zhang, Yiqing, et autres
Publié: (2026)
par: Zhang, Yiqing, et autres
Publié: (2026)
ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning
par: Ahmed, Md Shamim, et autres
Publié: (2026)
par: Ahmed, Md Shamim, et autres
Publié: (2026)
A Method for the Architecture of a Medical Vertical Large Language Model Based on Deepseek R1
par: Zhang, Mingda, et autres
Publié: (2025)
par: Zhang, Mingda, et autres
Publié: (2025)
Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization
par: Elganayni, Mohamed Hesham, et autres
Publié: (2026)
par: Elganayni, Mohamed Hesham, et autres
Publié: (2026)
CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification
par: Ye, Severin, et autres
Publié: (2026)
par: Ye, Severin, et autres
Publié: (2026)
Where is my Glass Slipper? AI, Poetry and Art
par: Pagiaslis, Anastasios P.
Publié: (2025)
par: Pagiaslis, Anastasios P.
Publié: (2025)
Continuous Predictive Modeling of Clinical Notes and ICD Codes in Patient Health Records
par: Caralt, Mireia Hernandez, et autres
Publié: (2024)
par: Caralt, Mireia Hernandez, et autres
Publié: (2024)
MedFuzz: Exploring the Robustness of Large Language Models in Medical Question Answering
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents
par: Ge, Zhuohan, et autres
Publié: (2025)
par: Ge, Zhuohan, et autres
Publié: (2025)
AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment
par: Linzmayer, Robin, et autres
Publié: (2026)
par: Linzmayer, Robin, et autres
Publié: (2026)
Reasoning Over the Glyphs: Evaluation of LLM's Decipherment of Rare Scripts
par: Shih, Yu-Fei, et autres
Publié: (2025)
par: Shih, Yu-Fei, et autres
Publié: (2025)
MedAide: Leveraging Large Language Models for On-Premise Medical Assistance on Edge Devices
par: Basit, Abdul, et autres
Publié: (2024)
par: Basit, Abdul, et autres
Publié: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
BLT: Can Large Language Models Handle Basic Legal Text?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
How BERT Speaks Shakespearean English? Evaluating Historical Bias in Contextual Language Models
par: Cuscito, Miriam, et autres
Publié: (2024)
par: Cuscito, Miriam, et autres
Publié: (2024)
Documents similaires
-
The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning
par: Ahmed, Md Shamim, et autres
Publié: (2026) -
VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation
par: Kiet, Huynh Trung, et autres
Publié: (2026) -
Automatic Replication of LLM Mistakes in Medical Conversations
par: Proniakin, Oleksii, et autres
Publié: (2025) -
MedHal: An Evaluation Dataset for Medical Hallucination Detection
par: Mehenni, Gaya, et autres
Publié: (2025) -
Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages
par: Anyaegbuna, Chukwuebuka, et autres
Publié: (2026)