Assessing The Potential Of Mid-Sized Language Models For Clinical QA
Fuente:
arXiv
Guardado en:
| Autores principales: | Bolton, Elliot, Xiong, Betty, Muralidharan, Vijaytha, Schamroth, Joel, Muralidharan, Vivek, Manning, Christopher D., Daneshjou, Roxana |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text
por: Bolton, Elliot, et al.
Publicado: (2024)
por: Bolton, Elliot, et al.
Publicado: (2024)
Can Lessons From Human Teams Be Applied to Multi-Agent Systems? The Role of Structure, Diversity, and Interaction Dynamics
por: Muralidharan, Rasika, et al.
Publicado: (2025)
por: Muralidharan, Rasika, et al.
Publicado: (2025)
Knowledge AI: Fine-tuning NLP Models for Facilitating Scientific Knowledge Extraction and Understanding
por: Muralidharan, Balaji, et al.
Publicado: (2024)
por: Muralidharan, Balaji, et al.
Publicado: (2024)
Drop Dropout on Single-Epoch Language Model Pretraining
por: Liu, Houjun, et al.
Publicado: (2025)
por: Liu, Houjun, et al.
Publicado: (2025)
Can Large Language Models Detect Misinformation in Scientific News Reporting?
por: Cao, Yupeng, et al.
Publicado: (2024)
por: Cao, Yupeng, et al.
Publicado: (2024)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
Compact Language Models via Pruning and Knowledge Distillation
por: Muralidharan, Saurav, et al.
Publicado: (2024)
por: Muralidharan, Saurav, et al.
Publicado: (2024)
Large language models in medicine: the potentials and pitfalls
por: Omiye, Jesutofunmi A., et al.
Publicado: (2023)
por: Omiye, Jesutofunmi A., et al.
Publicado: (2023)
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
por: Kachwala, Zoher, et al.
Publicado: (2026)
por: Kachwala, Zoher, et al.
Publicado: (2026)
PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment
por: Hong, Chang, et al.
Publicado: (2025)
por: Hong, Chang, et al.
Publicado: (2025)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
por: Kallini, Julie, et al.
Publicado: (2024)
por: Kallini, Julie, et al.
Publicado: (2024)
BiasICL: In-Context Learning and Demographic Biases of Vision Language Models
por: Xu, Sonnet, et al.
Publicado: (2025)
por: Xu, Sonnet, et al.
Publicado: (2025)
ReFT: Representation Finetuning for Language Models
por: Wu, Zhengxuan, et al.
Publicado: (2024)
por: Wu, Zhengxuan, et al.
Publicado: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
por: Rafailov, Rafael, et al.
Publicado: (2023)
por: Rafailov, Rafael, et al.
Publicado: (2023)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
por: Bhatia, Gagan, et al.
Publicado: (2024)
por: Bhatia, Gagan, et al.
Publicado: (2024)
Neural Machine Translation of Clinical Text: An Empirical Investigation into Multilingual Pre-Trained Language Models and Transfer-Learning
por: Han, Lifeng, et al.
Publicado: (2023)
por: Han, Lifeng, et al.
Publicado: (2023)
Beyond QA Pairs: Assessing Parameter-Efficient Fine-Tuning for Fact Embedding in LLMs
por: Ratnakar, Shivam, et al.
Publicado: (2025)
por: Ratnakar, Shivam, et al.
Publicado: (2025)
HealthQA-BR: A System-Wide Benchmark Reveals Critical Knowledge Gaps in Large Language Models
por: D'addario, Andrew Maranhão Ventura
Publicado: (2025)
por: D'addario, Andrew Maranhão Ventura
Publicado: (2025)
Structured Prompts Improve Evaluation of Language Models
por: Aali, Asad, et al.
Publicado: (2025)
por: Aali, Asad, et al.
Publicado: (2025)
DRIFT: Deep Reinforcement Learning for Intelligent Floating Platforms Trajectories
por: El-Hariry, Matteo, et al.
Publicado: (2023)
por: El-Hariry, Matteo, et al.
Publicado: (2023)
Self-Prompting Large Language Models for Zero-Shot Open-Domain QA
por: Li, Junlong, et al.
Publicado: (2022)
por: Li, Junlong, et al.
Publicado: (2022)
Assisted Debate Builder with Large Language Models
por: Faugier, Elliot, et al.
Publicado: (2024)
por: Faugier, Elliot, et al.
Publicado: (2024)
Multi-OphthaLingua: A Multilingual Benchmark for Assessing and Debiasing LLM Ophthalmological QA in LMICs
por: Restrepo, David, et al.
Publicado: (2024)
por: Restrepo, David, et al.
Publicado: (2024)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
por: Qiu, Jiaxing, et al.
Publicado: (2026)
por: Qiu, Jiaxing, et al.
Publicado: (2026)
Rare Disease Differential Diagnosis with Large Language Models at Scale: From Abdominal Actinomycosis to Wilson's Disease
por: Schumacher, Elliot, et al.
Publicado: (2025)
por: Schumacher, Elliot, et al.
Publicado: (2025)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
por: Yao, Zonghai, et al.
Publicado: (2024)
por: Yao, Zonghai, et al.
Publicado: (2024)
Assessing Empathy in Large Language Models with Real-World Physician-Patient Interactions
por: Luo, Man, et al.
Publicado: (2024)
por: Luo, Man, et al.
Publicado: (2024)
Verifiable Benchmarking of Long-Horizon Spatial Biology
por: Diks, Ian, et al.
Publicado: (2026)
por: Diks, Ian, et al.
Publicado: (2026)
Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks
por: Singhvi, Arnav, et al.
Publicado: (2025)
por: Singhvi, Arnav, et al.
Publicado: (2025)
Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
por: Xiao, Yunpeng, et al.
Publicado: (2025)
por: Xiao, Yunpeng, et al.
Publicado: (2025)
DEFT: Data Efficient Fine-Tuning for Pre-Trained Language Models via Unsupervised Core-Set Selection
por: Das, Devleena, et al.
Publicado: (2023)
por: Das, Devleena, et al.
Publicado: (2023)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
por: Doris, Anna C., et al.
Publicado: (2024)
por: Doris, Anna C., et al.
Publicado: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2024)
por: Tan, Yingshui, et al.
Publicado: (2024)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
Assessing the Quality of AI-Generated Clinical Notes: A Validated Evaluation of a Large Language Model Scribe
por: Palm, Erin, et al.
Publicado: (2025)
por: Palm, Erin, et al.
Publicado: (2025)
Prompting Strategies for Language Model-Based Item Generation in K-12 Education: Bridging the Gap Between Small and Large Language Models
por: Amini, Mohammad, et al.
Publicado: (2025)
por: Amini, Mohammad, et al.
Publicado: (2025)
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
por: Bonomo, Tommaso, et al.
Publicado: (2025)
por: Bonomo, Tommaso, et al.
Publicado: (2025)
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
por: Bologna, Federica, et al.
Publicado: (2025)
por: Bologna, Federica, et al.
Publicado: (2025)
Classifying Cancer Stage with Open-Source Clinical Large Language Models
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
Ejemplares similares
-
BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text
por: Bolton, Elliot, et al.
Publicado: (2024) -
Can Lessons From Human Teams Be Applied to Multi-Agent Systems? The Role of Structure, Diversity, and Interaction Dynamics
por: Muralidharan, Rasika, et al.
Publicado: (2025) -
Knowledge AI: Fine-tuning NLP Models for Facilitating Scientific Knowledge Extraction and Understanding
por: Muralidharan, Balaji, et al.
Publicado: (2024) -
Drop Dropout on Single-Epoch Language Model Pretraining
por: Liu, Houjun, et al.
Publicado: (2025) -
Can Large Language Models Detect Misinformation in Scientific News Reporting?
por: Cao, Yupeng, et al.
Publicado: (2024)