Do LLMs Give Psychometrically Plausible Responses in Educational Assessments?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Säuberli, Andreas, Frassinelli, Diego, Plank, Barbara |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Controlling Reading Ease with Gaze-Guided Text Generation
par: Säuberli, Andreas, et autres
Publié: (2026)
par: Säuberli, Andreas, et autres
Publié: (2026)
Mind the Uncertainty in Human Disagreement: Evaluating Discrepancies between Model Predictions and Human Responses in VQA
par: Lan, Jian, et autres
Publié: (2024)
par: Lan, Jian, et autres
Publié: (2024)
Resource-Lean Lexicon Induction for German Dialects
par: Litschko, Robert, et autres
Publié: (2026)
par: Litschko, Robert, et autres
Publié: (2026)
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
par: Zhou, Shijia, et autres
Publié: (2026)
par: Zhou, Shijia, et autres
Publié: (2026)
Make Every Letter Count: Building Dialect Variation Dictionaries from Monolingual Corpora
par: Litschko, Robert, et autres
Publié: (2025)
par: Litschko, Robert, et autres
Publié: (2025)
To Know or Not To Know? Analyzing Self-Consistency of Large Language Models under Ambiguity
par: Sedova, Anastasiia, et autres
Publié: (2024)
par: Sedova, Anastasiia, et autres
Publié: (2024)
Automatic Generation and Evaluation of Reading Comprehension Test Items with Large Language Models
par: Säuberli, Andreas, et autres
Publié: (2024)
par: Säuberli, Andreas, et autres
Publié: (2024)
Generalizable Sarcasm Detection Is Just Around The Corner, Of Course!
par: Jang, Hyewon, et autres
Publié: (2024)
par: Jang, Hyewon, et autres
Publié: (2024)
Digital Comprehensibility Assessment of Simplified Texts among Persons with Intellectual Disabilities
par: Säuberli, Andreas, et autres
Publié: (2024)
par: Säuberli, Andreas, et autres
Publié: (2024)
Investigating the Nature of Disagreements on Mid-Scale Ratings: A Case Study on the Abstractness-Concreteness Continuum
par: Knupleš, Urban, et autres
Publié: (2023)
par: Knupleš, Urban, et autres
Publié: (2023)
RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMs
par: Testoni, Alberto, et autres
Publié: (2024)
par: Testoni, Alberto, et autres
Publié: (2024)
LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
par: Leonardelli, Elisa, et autres
Publié: (2025)
par: Leonardelli, Elisa, et autres
Publié: (2025)
Unveiling the Mystery of Visual Attributes of Concrete and Abstract Concepts: Variability, Nearest Neighbors, and Challenging Categories
par: Tater, Tarun, et autres
Publié: (2024)
par: Tater, Tarun, et autres
Publié: (2024)
Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
par: Ahnert, Georg, et autres
Publié: (2025)
par: Ahnert, Georg, et autres
Publié: (2025)
What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German Dialects
par: Blaschke, Verena, et autres
Publié: (2024)
par: Blaschke, Verena, et autres
Publié: (2024)
Spontaneous Speech Variables for Evaluating LLMs Cognitive Plausibility
par: Wang, Sheng-Fu, et autres
Publié: (2025)
par: Wang, Sheng-Fu, et autres
Publié: (2025)
Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
par: Lee, Seungbeen, et autres
Publié: (2024)
par: Lee, Seungbeen, et autres
Publié: (2024)
MAKIEval: A Multilingual Automatic WiKidata-based Framework for Cultural Awareness Evaluation for LLMs
par: Zhao, Raoyuan, et autres
Publié: (2025)
par: Zhao, Raoyuan, et autres
Publié: (2025)
B4: Towards Optimal Assessment of Plausible Code Solutions with Plausible Tests
par: Chen, Mouxiang, et autres
Publié: (2024)
par: Chen, Mouxiang, et autres
Publié: (2024)
Probing LLMs for Multilingual Discourse Generalization Through a Unified Label Set
par: Eichin, Florian, et autres
Publié: (2025)
par: Eichin, Florian, et autres
Publié: (2025)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
par: Mondorf, Philipp, et autres
Publié: (2024)
par: Mondorf, Philipp, et autres
Publié: (2024)
PRobELM: Plausibility Ranking Evaluation for Language Models
par: Yuan, Zhangdie, et autres
Publié: (2024)
par: Yuan, Zhangdie, et autres
Publié: (2024)
Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not
par: Karakaş, Sercan
Publié: (2026)
par: Karakaş, Sercan
Publié: (2026)
MaiBaam Annotation Guidelines
par: Blaschke, Verena, et autres
Publié: (2024)
par: Blaschke, Verena, et autres
Publié: (2024)
If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models
par: Orth, Jasmin, et autres
Publié: (2025)
par: Orth, Jasmin, et autres
Publié: (2025)
EVADE: LLM-Based Explanation Generation and Validation for Error Detection in NLI
par: Zuo, Longfei, et autres
Publié: (2025)
par: Zuo, Longfei, et autres
Publié: (2025)
Add Noise, Tasks, or Layers? MaiNLP at the VarDial 2025 Shared Task on Norwegian Dialectal Slot and Intent Detection
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
Standard-to-Dialect Transfer Trends Differ across Text and Speech: A Case Study on Intent and Topic Classification in German Dialects
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
Indirect Question Answering in English, German and Bavarian: A Challenging Task for High- and Low-Resource Languages Alike
par: Winkler, Miriam, et autres
Publié: (2026)
par: Winkler, Miriam, et autres
Publié: (2026)
CLIMATELI: Evaluating Entity Linking on Climate Change Data
par: Zhou, Shijia, et autres
Publié: (2024)
par: Zhou, Shijia, et autres
Publié: (2024)
Dialetto, ma Quanto Dialetto? Transcribing and Evaluating Dialects on a Continuum
par: Shim, Ryan Soh-Eun, et autres
Publié: (2024)
par: Shim, Ryan Soh-Eun, et autres
Publié: (2024)
Exploring the Robustness of Task-oriented Dialogue Systems for Colloquial German Varieties
par: Artemova, Ekaterina, et autres
Publié: (2024)
par: Artemova, Ekaterina, et autres
Publié: (2024)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
par: Si, Shengyun, et autres
Publié: (2025)
par: Si, Shengyun, et autres
Publié: (2025)
Better Aligned with Survey Respondents or Training Data? Unveiling Political Leanings of LLMs on U.S. Supreme Court Cases
par: Xu, Shanshan, et autres
Publié: (2025)
par: Xu, Shanshan, et autres
Publié: (2025)
"Seeing the Big through the Small": Can LLMs Approximate Human Judgment Distributions on NLI from a Few Explanations?
par: Chen, Beiduo, et autres
Publié: (2024)
par: Chen, Beiduo, et autres
Publié: (2024)
Plausibility Vaccine: Injecting LLM Knowledge for Event Plausibility
par: Chmura, Jacob, et autres
Publié: (2025)
par: Chmura, Jacob, et autres
Publié: (2025)
AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility Estimation
par: Wang, Zhaowei, et autres
Publié: (2024)
par: Wang, Zhaowei, et autres
Publié: (2024)
Improving Dialectal Slot and Intent Detection with Auxiliary Tasks: A Multi-Dialectal Bavarian Case Study
par: Krückl, Xaver Maria, et autres
Publié: (2025)
par: Krückl, Xaver Maria, et autres
Publié: (2025)
Documents similaires
-
Controlling Reading Ease with Gaze-Guided Text Generation
par: Säuberli, Andreas, et autres
Publié: (2026) -
Mind the Uncertainty in Human Disagreement: Evaluating Discrepancies between Model Predictions and Human Responses in VQA
par: Lan, Jian, et autres
Publié: (2024) -
Resource-Lean Lexicon Induction for German Dialects
par: Litschko, Robert, et autres
Publié: (2026) -
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
par: Zhou, Shijia, et autres
Publié: (2026) -
Make Every Letter Count: Building Dialect Variation Dictionaries from Monolingual Corpora
par: Litschko, Robert, et autres
Publié: (2025)