Evaluating Large Language Models for Health-related Queries with Presuppositions
Fuente:
arXiv
Saved in:
| Main Authors: | Kaur, Navreet, Choudhury, Monojit, Pruthi, Danish |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation
by: Kaur, Navreet, et al.
Published: (2025)
by: Kaur, Navreet, et al.
Published: (2025)
Knowledge Graph Guided Evaluation of Abstention Techniques
by: Vasisht, Kinshuk, et al.
Published: (2024)
by: Vasisht, Kinshuk, et al.
Published: (2024)
"They are uncultured": Unveiling Covert Harms and Social Threats in LLM Generated Conversations
by: Dammu, Preetam Prabhu Srikar, et al.
Published: (2024)
by: Dammu, Preetam Prabhu Srikar, et al.
Published: (2024)
Heterogeneous Value Alignment Evaluation for Large Language Models
by: Zhang, Zhaowei, et al.
Published: (2023)
by: Zhang, Zhaowei, et al.
Published: (2023)
MythTriage: Scalable Detection of Opioid Use Disorder Myths on a Video-Sharing Platform
by: Jung, Hayoung, et al.
Published: (2025)
by: Jung, Hayoung, et al.
Published: (2025)
Who We Are, Where We Are: Mental Health at the Intersection of Person, Situation, and Large Language Models
by: Soni, Nikita, et al.
Published: (2026)
by: Soni, Nikita, et al.
Published: (2026)
LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models
by: Kahng, Minsuk, et al.
Published: (2024)
by: Kahng, Minsuk, et al.
Published: (2024)
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
by: Mittal, Avni, et al.
Published: (2026)
by: Mittal, Avni, et al.
Published: (2026)
How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI
by: Saha, Agnik, et al.
Published: (2025)
by: Saha, Agnik, et al.
Published: (2025)
Benchmarking Gender and Political Bias in Large Language Models
by: Yang, Jinrui, et al.
Published: (2025)
by: Yang, Jinrui, et al.
Published: (2025)
Wordflow: Social Prompt Engineering for Large Language Models
by: Wang, Zijie J., et al.
Published: (2024)
by: Wang, Zijie J., et al.
Published: (2024)
Morse Code-Enabled Speech Recognition for Individuals with Visual and Hearing Impairments
by: Choudhury, Ritabrata Roy
Published: (2024)
by: Choudhury, Ritabrata Roy
Published: (2024)
What Large Language Models Know and What People Think They Know
by: Steyvers, Mark, et al.
Published: (2024)
by: Steyvers, Mark, et al.
Published: (2024)
SPRIG: Improving Large Language Model Performance by System Prompt Optimization
by: Zhang, Lechen, et al.
Published: (2024)
by: Zhang, Lechen, et al.
Published: (2024)
An Empirical Categorization of Prompting Techniques for Large Language Models: A Practitioner's Guide
by: Fagbohun, Oluwole, et al.
Published: (2024)
by: Fagbohun, Oluwole, et al.
Published: (2024)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
by: Chen, Guanyu, et al.
Published: (2026)
by: Chen, Guanyu, et al.
Published: (2026)
Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models
by: Naderi, Nariman, et al.
Published: (2025)
by: Naderi, Nariman, et al.
Published: (2025)
Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review
by: Ye, Rui, et al.
Published: (2024)
by: Ye, Rui, et al.
Published: (2024)
Automating Customer Needs Analysis: A Comparative Study of Large Language Models in the Travel Industry
by: Barandoni, Simone, et al.
Published: (2024)
by: Barandoni, Simone, et al.
Published: (2024)
Building Trust in Mental Health Chatbots: Safety Metrics and LLM-Based Evaluation Tools
by: Park, Jung In, et al.
Published: (2024)
by: Park, Jung In, et al.
Published: (2024)
Open-Source Large Language Models as Multilingual Crowdworkers: Synthesizing Open-Domain Dialogues in Several Languages With No Examples in Targets and No Machine Translation
by: Njifenjou, Ahmed, et al.
Published: (2025)
by: Njifenjou, Ahmed, et al.
Published: (2025)
ParlAI Vote: A Web Platform for Analyzing Gender and Political Bias in Large Language Models
by: Lin, Wenjie, et al.
Published: (2025)
by: Lin, Wenjie, et al.
Published: (2025)
Silencing Empowerment, Allowing Bigotry: Auditing the Moderation of Hate Speech on Twitch
by: Shukla, Prarabdh, et al.
Published: (2025)
by: Shukla, Prarabdh, et al.
Published: (2025)
UniAutoML: A Human-Centered Framework for Unified Discriminative and Generative AutoML with Large Language Models
by: Guo, Jiayi, et al.
Published: (2024)
by: Guo, Jiayi, et al.
Published: (2024)
Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications
by: Sakib, Abu Noman Md, et al.
Published: (2026)
by: Sakib, Abu Noman Md, et al.
Published: (2026)
TALES: A Taxonomy and Analysis of Cultural Representations in LLM-generated Stories
by: Bhagat, Kirti, et al.
Published: (2025)
by: Bhagat, Kirti, et al.
Published: (2025)
Prediction-Powered Ranking of Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024)
by: Chatzi, Ivi, et al.
Published: (2024)
Linear Representations of Political Perspective Emerge in Large Language Models
by: Kim, Junsol, et al.
Published: (2025)
by: Kim, Junsol, et al.
Published: (2025)
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
by: Karamolegkou, Antonia, et al.
Published: (2025)
by: Karamolegkou, Antonia, et al.
Published: (2025)
Cross-Lingual Consistency of Factual Knowledge in Multilingual Language Models
by: Qi, Jirui, et al.
Published: (2023)
by: Qi, Jirui, et al.
Published: (2023)
Can Large Language Models Unlock Novel Scientific Research Ideas?
by: Kumar, Sandeep, et al.
Published: (2024)
by: Kumar, Sandeep, et al.
Published: (2024)
Computational Approaches to Understanding Large Language Model Impact on Writing and Information Ecosystems
by: Liang, Weixin
Published: (2025)
by: Liang, Weixin
Published: (2025)
Large Language Models Can Infer Personality from Free-Form User Interactions
by: Peters, Heinrich, et al.
Published: (2024)
by: Peters, Heinrich, et al.
Published: (2024)
TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models
by: Abbas, Ammar N., et al.
Published: (2024)
by: Abbas, Ammar N., et al.
Published: (2024)
LLM4PM: A case study on using Large Language Models for Process Modeling in Enterprise Organizations
by: Ziche, Clara, et al.
Published: (2024)
by: Ziche, Clara, et al.
Published: (2024)
MotionTeller: Multi-modal Integration of Wearable Time-Series with LLMs for Health and Behavioral Understanding
by: Zhang, Aiwei, et al.
Published: (2025)
by: Zhang, Aiwei, et al.
Published: (2025)
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes
by: Chiu, Yu Ying, et al.
Published: (2025)
by: Chiu, Yu Ying, et al.
Published: (2025)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
by: Lee, Suhyun, et al.
Published: (2026)
by: Lee, Suhyun, et al.
Published: (2026)
A Scalable Framework for Evaluating Health Language Models
by: Mallinar, Neil, et al.
Published: (2025)
by: Mallinar, Neil, et al.
Published: (2025)
Similar Items
-
Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation
by: Kaur, Navreet, et al.
Published: (2025) -
Knowledge Graph Guided Evaluation of Abstention Techniques
by: Vasisht, Kinshuk, et al.
Published: (2024) -
"They are uncultured": Unveiling Covert Harms and Social Threats in LLM Generated Conversations
by: Dammu, Preetam Prabhu Srikar, et al.
Published: (2024) -
Heterogeneous Value Alignment Evaluation for Large Language Models
by: Zhang, Zhaowei, et al.
Published: (2023) -
MythTriage: Scalable Detection of Opioid Use Disorder Myths on a Video-Sharing Platform
by: Jung, Hayoung, et al.
Published: (2025)