CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bologna, Federica, Pan, Tiffany, Wilkens, Matthew, Guo, Yue, Wang, Lucy Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VERT: Reliable LLM Judges for Radiology Report Evaluation
par: Bologna, Federica, et autres
Publié: (2026)
par: Bologna, Federica, et autres
Publié: (2026)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025)
par: Lamba, Naveen, et autres
Publié: (2025)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
par: Jamali, Naghmeh, et autres
Publié: (2025)
par: Jamali, Naghmeh, et autres
Publié: (2025)
Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025)
par: Lamba, Naveen, et autres
Publié: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024)
par: Li, Chuhan, et autres
Publié: (2024)
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
par: Huang, Tiancheng, et autres
Publié: (2025)
par: Huang, Tiancheng, et autres
Publié: (2025)
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
par: Yao, Zonghai, et autres
Publié: (2024)
par: Yao, Zonghai, et autres
Publié: (2024)
NLP at UC Santa Cruz at SemEval-2024 Task 5: Legal Answer Validation using Few-Shot Multi-Choice QA
par: Pahilajani, Anish, et autres
Publié: (2024)
par: Pahilajani, Anish, et autres
Publié: (2024)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
par: Zhao, Jingqian, et autres
Publié: (2025)
par: Zhao, Jingqian, et autres
Publié: (2025)
LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
par: Bonomo, Tommaso, et autres
Publié: (2025)
par: Bonomo, Tommaso, et autres
Publié: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction
par: Pan, Ruihao, et autres
Publié: (2026)
par: Pan, Ruihao, et autres
Publié: (2026)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
par: Doris, Anna C., et autres
Publié: (2024)
par: Doris, Anna C., et autres
Publié: (2024)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
par: Patel, Nisarg, et autres
Publié: (2024)
par: Patel, Nisarg, et autres
Publié: (2024)
Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization
par: Sumit, Dipto, et autres
Publié: (2026)
par: Sumit, Dipto, et autres
Publié: (2026)
LyS at SemEval 2025 Task 8: Zero-Shot Code Generation for Tabular QA
par: Gude, Adrián, et autres
Publié: (2025)
par: Gude, Adrián, et autres
Publié: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
par: Jubair, Sheikh, et autres
Publié: (2025)
par: Jubair, Sheikh, et autres
Publié: (2025)
TCE at Qur'an QA 2023 Shared Task: Low Resource Enhanced Transformer-based Ensemble Approach for Qur'anic QA
par: Elkomy, Mohammed Alaa, et autres
Publié: (2024)
par: Elkomy, Mohammed Alaa, et autres
Publié: (2024)
Assessing The Potential Of Mid-Sized Language Models For Clinical QA
par: Bolton, Elliot, et autres
Publié: (2024)
par: Bolton, Elliot, et autres
Publié: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
par: Kammakomati, Mehant, et autres
Publié: (2024)
par: Kammakomati, Mehant, et autres
Publié: (2024)
NarraBench: A Comprehensive Framework for Narrative Benchmarking
par: Hamilton, Sil, et autres
Publié: (2025)
par: Hamilton, Sil, et autres
Publié: (2025)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
par: Shu, Lei, et autres
Publié: (2023)
par: Shu, Lei, et autres
Publié: (2023)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
par: Ren, Huimin, et autres
Publié: (2025)
par: Ren, Huimin, et autres
Publié: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
par: Lee, Yuho, et autres
Publié: (2024)
par: Lee, Yuho, et autres
Publié: (2024)
SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs
par: Shil, Avijit, et autres
Publié: (2026)
par: Shil, Avijit, et autres
Publié: (2026)
MyCulture: Exploring Malaysia's Diverse Culture under Low-Resource Language Constraints
par: Hew, Zhong Ken, et autres
Publié: (2025)
par: Hew, Zhong Ken, et autres
Publié: (2025)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
par: Adib, Shefayat E Shams, et autres
Publié: (2026)
par: Adib, Shefayat E Shams, et autres
Publié: (2026)
Understanding QA generation: Extracting Parametric and Contextual Knowledge with CQA for Low Resource Bangla Language
par: Azmary, Umme Abira, et autres
Publié: (2026)
par: Azmary, Umme Abira, et autres
Publié: (2026)
FairytaleQA Translated: Enabling Educational Question and Answer Generation in Less-Resourced Languages
par: Leite, Bernardo, et autres
Publié: (2024)
par: Leite, Bernardo, et autres
Publié: (2024)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
EpiK-Eval: Evaluation for Language Models as Epistemic Models
par: Prato, Gabriele, et autres
Publié: (2023)
par: Prato, Gabriele, et autres
Publié: (2023)
ScholarEval: Research Idea Evaluation Grounded in Literature
par: Moussa, Hanane Nour, et autres
Publié: (2025)
par: Moussa, Hanane Nour, et autres
Publié: (2025)
HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA
par: Chen, Xinyue, et autres
Publié: (2024)
par: Chen, Xinyue, et autres
Publié: (2024)
Documents similaires
-
VERT: Reliable LLM Judges for Radiology Report Evaluation
par: Bologna, Federica, et autres
Publié: (2026) -
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024) -
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025) -
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
par: Jamali, Naghmeh, et autres
Publié: (2025) -
Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025)