A Study on Large Language Models' Limitations in Multiple-Choice Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Khatun, Aisha, Brown, Daniel G. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Biomedical Entity Linking as Multiple Choice Question Answering
von: Lin, Zhenxi, et al.
Veröffentlicht: (2024)
von: Lin, Zhenxi, et al.
Veröffentlicht: (2024)
Assessing Language Models' Worldview for Fiction Generation
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
von: Şakiroğlu, Mehmet Can, et al.
Veröffentlicht: (2026)
von: Şakiroğlu, Mehmet Can, et al.
Veröffentlicht: (2026)
SQuARE: Sequential Question Answering Reasoning Engine for Enhanced Chain-of-Thought in Large Language Models
von: Fleischer, Daniel, et al.
Veröffentlicht: (2025)
von: Fleischer, Daniel, et al.
Veröffentlicht: (2025)
Dynamic Strategy Planning for Efficient Question Answering with Large Language Models
von: Parekh, Tanmay, et al.
Veröffentlicht: (2024)
von: Parekh, Tanmay, et al.
Veröffentlicht: (2024)
MEG: Medical Knowledge-Augmented Large Language Models for Question Answering
von: Cabello, Laura, et al.
Veröffentlicht: (2024)
von: Cabello, Laura, et al.
Veröffentlicht: (2024)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
Generating Plausible Distractors for Multiple-Choice Questions via Student Choice Prediction
von: Lee, Yooseop, et al.
Veröffentlicht: (2025)
von: Lee, Yooseop, et al.
Veröffentlicht: (2025)
On the Limitations of Rank-One Model Editing in Answering Multi-hop Questions
von: He, Zhiyuan, et al.
Veröffentlicht: (2026)
von: He, Zhiyuan, et al.
Veröffentlicht: (2026)
Option-ID Based Elimination For Multiple Choice Questions
von: Zhu, Zhenhao, et al.
Veröffentlicht: (2025)
von: Zhu, Zhenhao, et al.
Veröffentlicht: (2025)
Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models
von: Park, Jean, et al.
Veröffentlicht: (2024)
von: Park, Jean, et al.
Veröffentlicht: (2024)
Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in Medicine
von: Griot, Maxime, et al.
Veröffentlicht: (2024)
von: Griot, Maxime, et al.
Veröffentlicht: (2024)
MedLM: Exploring Language Models for Medical Question Answering Systems
von: Yagnik, Niraj, et al.
Veröffentlicht: (2024)
von: Yagnik, Niraj, et al.
Veröffentlicht: (2024)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
Multiple Choice Learning of Low-Rank Adapters for Language Modeling
von: Letzelter, Victor, et al.
Veröffentlicht: (2025)
von: Letzelter, Victor, et al.
Veröffentlicht: (2025)
Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions
von: Li, Ruizhe, et al.
Veröffentlicht: (2024)
von: Li, Ruizhe, et al.
Veröffentlicht: (2024)
Retrieval-enhanced Knowledge Editing in Language Models for Multi-Hop Question Answering
von: Shi, Yucheng, et al.
Veröffentlicht: (2024)
von: Shi, Yucheng, et al.
Veröffentlicht: (2024)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
von: Zhang, Yuhui, et al.
Veröffentlicht: (2025)
von: Zhang, Yuhui, et al.
Veröffentlicht: (2025)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
von: Deng, Wenqing, et al.
Veröffentlicht: (2024)
von: Deng, Wenqing, et al.
Veröffentlicht: (2024)
UnibucLLM: Harnessing LLMs for Automated Prediction of Item Difficulty and Response Time for Multiple-Choice Questions
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2024)
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2024)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
von: Srivastava, Varun, et al.
Veröffentlicht: (2025)
von: Srivastava, Varun, et al.
Veröffentlicht: (2025)
The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
von: Jeong, Daniel P., et al.
Veröffentlicht: (2024)
Interpretable Question Answering with Knowledge Graphs
von: Aneja, Kartikeya, et al.
Veröffentlicht: (2025)
von: Aneja, Kartikeya, et al.
Veröffentlicht: (2025)
A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering
von: Sultana, Nusrat, et al.
Veröffentlicht: (2026)
von: Sultana, Nusrat, et al.
Veröffentlicht: (2026)
Deceiving Question-Answering Models: A Hybrid Word-Level Adversarial Approach
von: Li, Jiyao, et al.
Veröffentlicht: (2024)
von: Li, Jiyao, et al.
Veröffentlicht: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
von: Guo, Danfeng, et al.
Veröffentlicht: (2024)
Temporal Knowledge Graph Question Answering: A Survey
von: Su, Miao, et al.
Veröffentlicht: (2024)
von: Su, Miao, et al.
Veröffentlicht: (2024)
Specialised or Generic? Tokenization Choices for Radiology Language Models
von: Warr, Hermione, et al.
Veröffentlicht: (2025)
von: Warr, Hermione, et al.
Veröffentlicht: (2025)
Fine-tuning Large Language Models with Limited Data: A Survey and Practical Guide
von: Szep, Marton, et al.
Veröffentlicht: (2024)
von: Szep, Marton, et al.
Veröffentlicht: (2024)
RadioRAG: Online Retrieval-augmented Generation for Radiology Question Answering
von: Arasteh, Soroosh Tayebi, et al.
Veröffentlicht: (2024)
von: Arasteh, Soroosh Tayebi, et al.
Veröffentlicht: (2024)
Comprehensive Modeling and Question Answering of Cancer Clinical Practice Guidelines using LLMs
von: Gupta, Bhumika, et al.
Veröffentlicht: (2025)
von: Gupta, Bhumika, et al.
Veröffentlicht: (2025)
Understanding Understanding: A Pragmatic Framework Motivated by Large Language Models
von: Leyton-Brown, Kevin, et al.
Veröffentlicht: (2024)
von: Leyton-Brown, Kevin, et al.
Veröffentlicht: (2024)
SEMQA: Semi-Extractive Multi-Source Question Answering
von: Schuster, Tal, et al.
Veröffentlicht: (2023)
von: Schuster, Tal, et al.
Veröffentlicht: (2023)
COMPKE: Complex Question Answering under Knowledge Editing
von: Cheng, Keyuan, et al.
Veröffentlicht: (2025)
von: Cheng, Keyuan, et al.
Veröffentlicht: (2025)
Fine-tuning Smaller Language Models for Question Answering over Financial Documents
von: Phogat, Karmvir Singh, et al.
Veröffentlicht: (2024)
von: Phogat, Karmvir Singh, et al.
Veröffentlicht: (2024)
Towards Robust Evaluation: A Comprehensive Taxonomy of Datasets and Metrics for Open Domain Question Answering in the Era of Large Language Models
von: Srivastava, Akchay, et al.
Veröffentlicht: (2024)
von: Srivastava, Akchay, et al.
Veröffentlicht: (2024)
Hallucination is Inevitable: An Innate Limitation of Large Language Models
von: Xu, Ziwei, et al.
Veröffentlicht: (2024)
von: Xu, Ziwei, et al.
Veröffentlicht: (2024)
Mitigating Bias for Question Answering Models by Tracking Bias Influence
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2023)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2023)
COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees
von: Wang, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Biomedical Entity Linking as Multiple Choice Question Answering
von: Lin, Zhenxi, et al.
Veröffentlicht: (2024) -
Assessing Language Models' Worldview for Fiction Generation
von: Khatun, Aisha, et al.
Veröffentlicht: (2024) -
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
von: Khatun, Aisha, et al.
Veröffentlicht: (2024) -
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
von: Şakiroğlu, Mehmet Can, et al.
Veröffentlicht: (2026) -
SQuARE: Sequential Question Answering Reasoning Engine for Enhanced Chain-of-Thought in Large Language Models
von: Fleischer, Daniel, et al.
Veröffentlicht: (2025)