MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Zonghai, Parashar, Aditya, Zhou, Huixue, Jang, Won Seok, Ouyang, Feiyun, Yang, Zhichao, Yu, Hong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
di: Yao, Zonghai, et al.
Pubblicazione: (2024)
di: Yao, Zonghai, et al.
Pubblicazione: (2024)
SYNFAC-EDIT: Synthetic Imitation Edit Feedback for Factual Alignment in Clinical Summarization
di: Mishra, Prakamya, et al.
Pubblicazione: (2024)
di: Mishra, Prakamya, et al.
Pubblicazione: (2024)
Enhancing LLMs for Identifying and Prioritizing Important Medical Jargons from Electronic Health Record Notes Utilizing Data Augmentation
di: Jang, Won Seok, et al.
Pubblicazione: (2025)
di: Jang, Won Seok, et al.
Pubblicazione: (2025)
JMLR: Joint Medical LLM and Retrieval Training for Enhancing Reasoning and Professional Question Answering Capability
di: Wang, Junda, et al.
Pubblicazione: (2024)
di: Wang, Junda, et al.
Pubblicazione: (2024)
PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
NoteChat: A Dataset of Synthetic Doctor-Patient Conversations Conditioned on Clinical Notes
di: Wang, Junda, et al.
Pubblicazione: (2023)
di: Wang, Junda, et al.
Pubblicazione: (2023)
DischargeSim: A Simulation Benchmark for Educational Doctor-Patient Communication at Discharge
di: Yao, Zonghai, et al.
Pubblicazione: (2025)
di: Yao, Zonghai, et al.
Pubblicazione: (2025)
Iterative Critique-Refine Framework for Enhancing LLM Personalization
di: Maram, Durga Prasad, et al.
Pubblicazione: (2025)
di: Maram, Durga Prasad, et al.
Pubblicazione: (2025)
ChatCLIDS: Simulating Persuasive AI Dialogues to Promote Closed-Loop Insulin Adoption in Type 1 Diabetes Care
di: Yao, Zonghai, et al.
Pubblicazione: (2025)
di: Yao, Zonghai, et al.
Pubblicazione: (2025)
Feedback Indices to Evaluate LLM Responses to Rebuttals for Multiple Choice Type Questions
di: Dunlap, Justin C., et al.
Pubblicazione: (2026)
di: Dunlap, Justin C., et al.
Pubblicazione: (2026)
RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine
di: Huang, Jiatan, et al.
Pubblicazione: (2024)
di: Huang, Jiatan, et al.
Pubblicazione: (2024)
Medical thinking with multiple images
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
di: Yao, Zonghai, et al.
Pubblicazione: (2026)
MedReadCtrl: Personalizing medical text generation with readability-controlled instruction learning
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
Self-Critique Guided Iterative Reasoning for Multi-hop Question Answering
di: Chu, Zheng, et al.
Pubblicazione: (2025)
di: Chu, Zheng, et al.
Pubblicazione: (2025)
BioInstruct: Instruction Tuning of Large Language Models for Biomedical Natural Language Processing
di: Tran, Hieu, et al.
Pubblicazione: (2023)
di: Tran, Hieu, et al.
Pubblicazione: (2023)
Large Language Models are In-context Teachers for Knowledge Reasoning
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
di: Zhao, Jiachen, et al.
Pubblicazione: (2023)
From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
di: Wang, Benlu, et al.
Pubblicazione: (2025)
di: Wang, Benlu, et al.
Pubblicazione: (2025)
SRefiner: Soft-Braid Attention for Multi-Agent Trajectory Refinement
di: Xiao, Liwen, et al.
Pubblicazione: (2025)
di: Xiao, Liwen, et al.
Pubblicazione: (2025)
Do Physicians Know How to Prompt? The Need for Automatic Prompt Optimization Help in Clinical Note Generation
di: Yao, Zonghai, et al.
Pubblicazione: (2023)
di: Yao, Zonghai, et al.
Pubblicazione: (2023)
Multiple-Choice Questions are Efficient and Robust LLM Evaluators
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
A Novel Method for Calculating Deflection Angle with Finite-Distance Correction
di: Li, Zonghai
Pubblicazione: (2024)
di: Li, Zonghai
Pubblicazione: (2024)
Correctness Coverage Evaluation for Medical Multiple-Choice Question Answering Based on the Enhanced Conformal Prediction Framework
di: Ke, Yusong, et al.
Pubblicazione: (2025)
di: Ke, Yusong, et al.
Pubblicazione: (2025)
Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language Models
di: Bao, Qiming, et al.
Pubblicazione: (2023)
di: Bao, Qiming, et al.
Pubblicazione: (2023)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
ChatThero: An LLM-Supported Chatbot for Behavior Change and Therapeutic Support in Addiction Recovery
di: Wang, Junda, et al.
Pubblicazione: (2025)
di: Wang, Junda, et al.
Pubblicazione: (2025)
RARE: Retrieval-Augmented Reasoning Enhancement for Large Language Models
di: Tran, Hieu, et al.
Pubblicazione: (2024)
di: Tran, Hieu, et al.
Pubblicazione: (2024)
EHR Interaction Between Patients and AI: NoteAid EHR Interaction
di: Zhang, Xiaocheng, et al.
Pubblicazione: (2023)
di: Zhang, Xiaocheng, et al.
Pubblicazione: (2023)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
di: Tran, Hieu, et al.
Pubblicazione: (2025)
di: Tran, Hieu, et al.
Pubblicazione: (2025)
Self-Correcting Large Language Models: Generation vs. Multiple Choice
di: Rahmani, Hossein A., et al.
Pubblicazione: (2025)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2025)
Beyond Output Critique: Self-Correction via Task Distillation
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
Chatbot To Help Patients Understand Their Health
di: Jang, Won Seok, et al.
Pubblicazione: (2025)
di: Jang, Won Seok, et al.
Pubblicazione: (2025)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints
di: Ferraz, Thomas Palmeira, et al.
Pubblicazione: (2024)
di: Ferraz, Thomas Palmeira, et al.
Pubblicazione: (2024)
Generating Plausible Distractors for Multiple-Choice Questions via Student Choice Prediction
di: Lee, Yooseop, et al.
Pubblicazione: (2025)
di: Lee, Yooseop, et al.
Pubblicazione: (2025)
Biomedical Entity Linking as Multiple Choice Question Answering
di: Lin, Zhenxi, et al.
Pubblicazione: (2024)
di: Lin, Zhenxi, et al.
Pubblicazione: (2024)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
di: Raina, Vatsal, et al.
Pubblicazione: (2024)
di: Raina, Vatsal, et al.
Pubblicazione: (2024)
AI-Assisted Model for Generating Multiple-Choice Questions
di: Krushynska, Tetiana, et al.
Pubblicazione: (2026)
di: Krushynska, Tetiana, et al.
Pubblicazione: (2026)
Option-ID Based Elimination For Multiple Choice Questions
di: Zhu, Zhenhao, et al.
Pubblicazione: (2025)
di: Zhu, Zhenhao, et al.
Pubblicazione: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
di: Zhou, Ao, et al.
Pubblicazione: (2025)
di: Zhou, Ao, et al.
Pubblicazione: (2025)
Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
di: Wang, Yuhan, et al.
Pubblicazione: (2026)
di: Wang, Yuhan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
di: Yao, Zonghai, et al.
Pubblicazione: (2024) -
SYNFAC-EDIT: Synthetic Imitation Edit Feedback for Factual Alignment in Clinical Summarization
di: Mishra, Prakamya, et al.
Pubblicazione: (2024) -
Enhancing LLMs for Identifying and Prioritizing Important Medical Jargons from Electronic Health Record Notes Utilizing Data Augmentation
di: Jang, Won Seok, et al.
Pubblicazione: (2025) -
JMLR: Joint Medical LLM and Retrieval Training for Enhancing Reasoning and Professional Question Answering Capability
di: Wang, Junda, et al.
Pubblicazione: (2024) -
PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
di: Tran, Hieu, et al.
Pubblicazione: (2025)