Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Tairan, Conde, Javier, Martínez, Gonzalo, Grandury, María, Reviriego, Pedro |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Do Large Language Models (LLMs) Struggle to Count Letters?
par: Fu, Tairan, et autres
Publié: (2024)
par: Fu, Tairan, et autres
Publié: (2024)
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?
par: Fu, Tairan, et autres
Publié: (2025)
par: Fu, Tairan, et autres
Publié: (2025)
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
par: Ferrando, Raquel, et autres
Publié: (2025)
par: Ferrando, Raquel, et autres
Publié: (2025)
Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?
par: Mayor-Rocher, Marina, et autres
Publié: (2024)
par: Mayor-Rocher, Marina, et autres
Publié: (2024)
Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
par: Awad, Samer, et autres
Publié: (2026)
par: Awad, Samer, et autres
Publié: (2026)
It's the same but not the same: Do LLMs distinguish Spanish varieties?
par: Mayor-Rocher, Marina, et autres
Publié: (2025)
par: Mayor-Rocher, Marina, et autres
Publié: (2025)
The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) Human Evaluations
par: Arriaga, Carlos, et autres
Publié: (2025)
par: Arriaga, Carlos, et autres
Publié: (2025)
To Words and Beyond: Probing Large Language Models for Sentence-Level Psycholinguistic Norms of Memorability and Reading Times
par: Clark, Thomas Hikaru, et autres
Publié: (2026)
par: Clark, Thomas Hikaru, et autres
Publié: (2026)
Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
Beware of Words: Evaluating the Lexical Diversity of Conversational LLMs using ChatGPT as Case Study
par: Martínez, Gonzalo, et autres
Publié: (2024)
par: Martínez, Gonzalo, et autres
Publié: (2024)
Establishing Vocabulary Tests as a Benchmark for Evaluating Large Language Models
par: Martínez, Gonzalo, et autres
Publié: (2023)
par: Martínez, Gonzalo, et autres
Publié: (2023)
Spanish and LLM Benchmarks: is MMLU Lost in Translation?
par: Plaza, Irene, et autres
Publié: (2024)
par: Plaza, Irene, et autres
Publié: (2024)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
Speed and Conversational Large Language Models: Not All Is About Tokens per Second
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Can ChatGPT Learn to Count Letters?
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Playing with words: Comparing the vocabulary and lexical diversity of ChatGPT and humans
par: Reviriego, Pedro, et autres
Publié: (2023)
par: Reviriego, Pedro, et autres
Publié: (2023)
Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
Open Conversational LLMs do not know most Spanish words
par: Conde, Javier, et autres
Publié: (2024)
par: Conde, Javier, et autres
Publié: (2024)
Concurrent Linguistic Error Detection (CLED): a New Methodology for Error Detection in Large Language Models
par: Zhu, Jinhua, et autres
Publié: (2024)
par: Zhu, Jinhua, et autres
Publié: (2024)
Using large language models to estimate features of multi-word expressions: Concreteness, valence, arousal
par: Martínez, Gonzalo, et autres
Publié: (2024)
par: Martínez, Gonzalo, et autres
Publié: (2024)
UBench: Benchmarking Uncertainty in Large Language Models with Multiple Choice Questions
par: Wang, Xunzhi, et autres
Publié: (2024)
par: Wang, Xunzhi, et autres
Publié: (2024)
Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
How does fine-tuning improve sensorimotor representations in large language models?
par: Wu, Minghua, et autres
Publié: (2026)
par: Wu, Minghua, et autres
Publié: (2026)
When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Self-Training Large Language Models with Confident Reasoning
par: Jang, Hyosoon, et autres
Publié: (2025)
par: Jang, Hyosoon, et autres
Publié: (2025)
When Models Decide and When They Bind: A Two-Stage Computation for Multiple-Choice Question-Answering
par: Wong, Hugh Mee, et autres
Publié: (2026)
par: Wong, Hugh Mee, et autres
Publié: (2026)
Math Multiple Choice Question Generation via Human-Large Language Model Collaboration
par: Lee, Jaewook, et autres
Publié: (2024)
par: Lee, Jaewook, et autres
Publié: (2024)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions
par: Park, Yoonah, et autres
Publié: (2025)
par: Park, Yoonah, et autres
Publié: (2025)
The #Somos600M Project: Generating NLP resources that represent the diversity of the languages from LATAM, the Caribbean, and Spain
par: Grandury, María
Publié: (2024)
par: Grandury, María
Publié: (2024)
Strengthened Symbol Binding Makes Large Language Models Reliable Multiple-Choice Selectors
par: Xue, Mengge, et autres
Publié: (2024)
par: Xue, Mengge, et autres
Publié: (2024)
A Study on Large Language Models' Limitations in Multiple-Choice Question Answering
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
Multiple-Choice Question Generation Using Large Language Models: Methodology and Educator Insights
par: Biancini, Giorgio, et autres
Publié: (2025)
par: Biancini, Giorgio, et autres
Publié: (2025)
La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
par: Grandury, María, et autres
Publié: (2025)
par: Grandury, María, et autres
Publié: (2025)
Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?
par: Balepur, Nishant, et autres
Publié: (2024)
par: Balepur, Nishant, et autres
Publié: (2024)
Self-Correcting Large Language Models: Generation vs. Multiple Choice
par: Rahmani, Hossein A., et autres
Publié: (2025)
par: Rahmani, Hossein A., et autres
Publié: (2025)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
par: Vu, Duc Anh, et autres
Publié: (2025)
par: Vu, Duc Anh, et autres
Publié: (2025)
Documents similaires
-
Why Do Large Language Models (LLMs) Struggle to Count Letters?
par: Fu, Tairan, et autres
Publié: (2024) -
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans
par: Conde, Javier, et autres
Publié: (2025) -
Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings
par: Conde, Javier, et autres
Publié: (2025) -
Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?
par: Fu, Tairan, et autres
Publié: (2025) -
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
par: Ferrando, Raquel, et autres
Publié: (2025)