Automatic Generation and Evaluation of Reading Comprehension Test Items with Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Säuberli, Andreas, Clematide, Simon |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Controlling Reading Ease with Gaze-Guided Text Generation
by: Säuberli, Andreas, et al.
Published: (2026)
by: Säuberli, Andreas, et al.
Published: (2026)
PARAPHRASUS : A Comprehensive Benchmark for Evaluating Paraphrase Detection Models
by: Michail, Andrianos, et al.
Published: (2024)
by: Michail, Andrianos, et al.
Published: (2024)
Examining Multilingual Embedding Models Cross-Lingually Through LLM-Generated Adversarial Examples
by: Michail, Andrianos, et al.
Published: (2025)
by: Michail, Andrianos, et al.
Published: (2025)
Do LLMs Give Psychometrically Plausible Responses in Educational Assessments?
by: Säuberli, Andreas, et al.
Published: (2025)
by: Säuberli, Andreas, et al.
Published: (2025)
Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models
by: Li, Chang-Jin, et al.
Published: (2024)
by: Li, Chang-Jin, et al.
Published: (2024)
Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository
by: Kapoor, Radhika, et al.
Published: (2025)
by: Kapoor, Radhika, et al.
Published: (2025)
LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models
by: Yang, Xiaohao, et al.
Published: (2024)
by: Yang, Xiaohao, et al.
Published: (2024)
Sentence Smith: Controllable Edits for Evaluating Text Embeddings
by: Li, Hongji, et al.
Published: (2025)
by: Li, Hongji, et al.
Published: (2025)
Adapting Multilingual Embedding Models to Historical Luxembourgish
by: Michail, Andrianos, et al.
Published: (2025)
by: Michail, Andrianos, et al.
Published: (2025)
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
by: Zhang, Chen, et al.
Published: (2023)
by: Zhang, Chen, et al.
Published: (2023)
Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
by: Hwang, Seonjeong, et al.
Published: (2025)
by: Hwang, Seonjeong, et al.
Published: (2025)
Digital Comprehensibility Assessment of Simplified Texts among Persons with Intellectual Disabilities
by: Säuberli, Andreas, et al.
Published: (2024)
by: Säuberli, Andreas, et al.
Published: (2024)
Generating Reading Comprehension Exercises with Large Language Models for Educational Applications
by: Huang, Xingyu, et al.
Published: (2025)
by: Huang, Xingyu, et al.
Published: (2025)
A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation
by: Hwang, Seonjeong, et al.
Published: (2026)
by: Hwang, Seonjeong, et al.
Published: (2026)
Text-Based Approaches to Item Alignment to Content Standards in Large-Scale Reading & Writing Tests
by: Fu, Yanbin, et al.
Published: (2025)
by: Fu, Yanbin, et al.
Published: (2025)
Adapting Large Language Models to Domains via Reading Comprehension
by: Cheng, Daixuan, et al.
Published: (2023)
by: Cheng, Daixuan, et al.
Published: (2023)
Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias
by: Schuhmacher, Elias, et al.
Published: (2026)
by: Schuhmacher, Elias, et al.
Published: (2026)
Evaluation of Automatic Speech Recognition Using Generative Large Language Models
by: Bañeras-Roux, Thibault, et al.
Published: (2026)
by: Bañeras-Roux, Thibault, et al.
Published: (2026)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
by: Wei, Fangyun, et al.
Published: (2024)
by: Wei, Fangyun, et al.
Published: (2024)
Automatic Generation of Inference Making Questions for Reading Comprehension Assessments
by: Ma, Wanjing Anya, et al.
Published: (2025)
by: Ma, Wanjing Anya, et al.
Published: (2025)
Investigating Recent Large Language Models for Vietnamese Machine Reading Comprehension
by: Nguyen, Anh Duc, et al.
Published: (2025)
by: Nguyen, Anh Duc, et al.
Published: (2025)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
Comprehensive Evaluation of Large Language Models for Topic Modeling
by: Doi, Tomoki, et al.
Published: (2024)
by: Doi, Tomoki, et al.
Published: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
Exploring the Potential of Large Language Models for Estimating the Reading Comprehension Question Difficulty
by: Jain, Yoshee, et al.
Published: (2025)
by: Jain, Yoshee, et al.
Published: (2025)
Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models
by: Sheng, Boheng, et al.
Published: (2025)
by: Sheng, Boheng, et al.
Published: (2025)
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
by: Gan, Aoran, et al.
Published: (2025)
by: Gan, Aoran, et al.
Published: (2025)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
by: Özen, Yıldırım, et al.
Published: (2025)
by: Özen, Yıldırım, et al.
Published: (2025)
Arabic Automatic Story Generation with Large Language Models
by: El-Shangiti, Ahmed Oumar, et al.
Published: (2024)
by: El-Shangiti, Ahmed Oumar, et al.
Published: (2024)
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with Writers
by: Subbiah, Melanie, et al.
Published: (2024)
by: Subbiah, Melanie, et al.
Published: (2024)
Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator
by: Liao, Yusheng, et al.
Published: (2024)
by: Liao, Yusheng, et al.
Published: (2024)
Large Language Models Are Read/Write Policy-Makers for Simultaneous Generation
by: Guo, Shoutao, et al.
Published: (2025)
by: Guo, Shoutao, et al.
Published: (2025)
Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation
by: Chhun, Cyril, et al.
Published: (2024)
by: Chhun, Cyril, et al.
Published: (2024)
Evaluating Gender Bias in Large Language Models
by: Döll, Michael, et al.
Published: (2024)
by: Döll, Michael, et al.
Published: (2024)
ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
by: Chang, Emily, et al.
Published: (2025)
by: Chang, Emily, et al.
Published: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
by: An, Bang, et al.
Published: (2024)
by: An, Bang, et al.
Published: (2024)
Benchmarking Next-Generation Reasoning-Focused Large Language Models in Ophthalmology: A Head-to-Head Evaluation on 5,888 Items
by: Zou, Minjie, et al.
Published: (2025)
by: Zou, Minjie, et al.
Published: (2025)
AI Analyst: Framework and Comprehensive Evaluation of Large Language Models for Financial Time Series Report Generation
by: Fons, Elizabeth, et al.
Published: (2025)
by: Fons, Elizabeth, et al.
Published: (2025)
Interpretable Text Embeddings and Text Similarity Explanation: A Survey
by: Opitz, Juri, et al.
Published: (2025)
by: Opitz, Juri, et al.
Published: (2025)
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension
by: Ai, Lin, et al.
Published: (2024)
by: Ai, Lin, et al.
Published: (2024)
Similar Items
-
Controlling Reading Ease with Gaze-Guided Text Generation
by: Säuberli, Andreas, et al.
Published: (2026) -
PARAPHRASUS : A Comprehensive Benchmark for Evaluating Paraphrase Detection Models
by: Michail, Andrianos, et al.
Published: (2024) -
Examining Multilingual Embedding Models Cross-Lingually Through LLM-Generated Adversarial Examples
by: Michail, Andrianos, et al.
Published: (2025) -
Do LLMs Give Psychometrically Plausible Responses in Educational Assessments?
by: Säuberli, Andreas, et al.
Published: (2025) -
Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models
by: Li, Chang-Jin, et al.
Published: (2024)