Automatic Generation and Evaluation of Reading Comprehension Test Items with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Säuberli, Andreas, Clematide, Simon |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Controlling Reading Ease with Gaze-Guided Text Generation
par: Säuberli, Andreas, et autres
Publié: (2026)
par: Säuberli, Andreas, et autres
Publié: (2026)
PARAPHRASUS : A Comprehensive Benchmark for Evaluating Paraphrase Detection Models
par: Michail, Andrianos, et autres
Publié: (2024)
par: Michail, Andrianos, et autres
Publié: (2024)
Examining Multilingual Embedding Models Cross-Lingually Through LLM-Generated Adversarial Examples
par: Michail, Andrianos, et autres
Publié: (2025)
par: Michail, Andrianos, et autres
Publié: (2025)
Do LLMs Give Psychometrically Plausible Responses in Educational Assessments?
par: Säuberli, Andreas, et autres
Publié: (2025)
par: Säuberli, Andreas, et autres
Publié: (2025)
Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models
par: Li, Chang-Jin, et autres
Publié: (2024)
par: Li, Chang-Jin, et autres
Publié: (2024)
Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository
par: Kapoor, Radhika, et autres
Publié: (2025)
par: Kapoor, Radhika, et autres
Publié: (2025)
LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models
par: Yang, Xiaohao, et autres
Publié: (2024)
par: Yang, Xiaohao, et autres
Publié: (2024)
Sentence Smith: Controllable Edits for Evaluating Text Embeddings
par: Li, Hongji, et autres
Publié: (2025)
par: Li, Hongji, et autres
Publié: (2025)
Adapting Multilingual Embedding Models to Historical Luxembourgish
par: Michail, Andrianos, et autres
Publié: (2025)
par: Michail, Andrianos, et autres
Publié: (2025)
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators
par: Zhang, Chen, et autres
Publié: (2023)
par: Zhang, Chen, et autres
Publié: (2023)
Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
par: Hwang, Seonjeong, et autres
Publié: (2025)
par: Hwang, Seonjeong, et autres
Publié: (2025)
Digital Comprehensibility Assessment of Simplified Texts among Persons with Intellectual Disabilities
par: Säuberli, Andreas, et autres
Publié: (2024)
par: Säuberli, Andreas, et autres
Publié: (2024)
Generating Reading Comprehension Exercises with Large Language Models for Educational Applications
par: Huang, Xingyu, et autres
Publié: (2025)
par: Huang, Xingyu, et autres
Publié: (2025)
A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation
par: Hwang, Seonjeong, et autres
Publié: (2026)
par: Hwang, Seonjeong, et autres
Publié: (2026)
Text-Based Approaches to Item Alignment to Content Standards in Large-Scale Reading & Writing Tests
par: Fu, Yanbin, et autres
Publié: (2025)
par: Fu, Yanbin, et autres
Publié: (2025)
Adapting Large Language Models to Domains via Reading Comprehension
par: Cheng, Daixuan, et autres
Publié: (2023)
par: Cheng, Daixuan, et autres
Publié: (2023)
Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias
par: Schuhmacher, Elias, et autres
Publié: (2026)
par: Schuhmacher, Elias, et autres
Publié: (2026)
Evaluation of Automatic Speech Recognition Using Generative Large Language Models
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
par: Wei, Fangyun, et autres
Publié: (2024)
par: Wei, Fangyun, et autres
Publié: (2024)
Automatic Generation of Inference Making Questions for Reading Comprehension Assessments
par: Ma, Wanjing Anya, et autres
Publié: (2025)
par: Ma, Wanjing Anya, et autres
Publié: (2025)
Investigating Recent Large Language Models for Vietnamese Machine Reading Comprehension
par: Nguyen, Anh Duc, et autres
Publié: (2025)
par: Nguyen, Anh Duc, et autres
Publié: (2025)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Comprehensive Evaluation of Large Language Models for Topic Modeling
par: Doi, Tomoki, et autres
Publié: (2024)
par: Doi, Tomoki, et autres
Publié: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
par: Guo, Pei-Fu, et autres
Publié: (2026)
par: Guo, Pei-Fu, et autres
Publié: (2026)
Exploring the Potential of Large Language Models for Estimating the Reading Comprehension Question Difficulty
par: Jain, Yoshee, et autres
Publié: (2025)
par: Jain, Yoshee, et autres
Publié: (2025)
Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models
par: Sheng, Boheng, et autres
Publié: (2025)
par: Sheng, Boheng, et autres
Publié: (2025)
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
par: Gan, Aoran, et autres
Publié: (2025)
par: Gan, Aoran, et autres
Publié: (2025)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
par: Özen, Yıldırım, et autres
Publié: (2025)
par: Özen, Yıldırım, et autres
Publié: (2025)
Arabic Automatic Story Generation with Large Language Models
par: El-Shangiti, Ahmed Oumar, et autres
Publié: (2024)
par: El-Shangiti, Ahmed Oumar, et autres
Publié: (2024)
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with Writers
par: Subbiah, Melanie, et autres
Publié: (2024)
par: Subbiah, Melanie, et autres
Publié: (2024)
Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator
par: Liao, Yusheng, et autres
Publié: (2024)
par: Liao, Yusheng, et autres
Publié: (2024)
Large Language Models Are Read/Write Policy-Makers for Simultaneous Generation
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation
par: Chhun, Cyril, et autres
Publié: (2024)
par: Chhun, Cyril, et autres
Publié: (2024)
Evaluating Gender Bias in Large Language Models
par: Döll, Michael, et autres
Publié: (2024)
par: Döll, Michael, et autres
Publié: (2024)
ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
par: Chang, Emily, et autres
Publié: (2025)
par: Chang, Emily, et autres
Publié: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
par: An, Bang, et autres
Publié: (2024)
par: An, Bang, et autres
Publié: (2024)
Benchmarking Next-Generation Reasoning-Focused Large Language Models in Ophthalmology: A Head-to-Head Evaluation on 5,888 Items
par: Zou, Minjie, et autres
Publié: (2025)
par: Zou, Minjie, et autres
Publié: (2025)
AI Analyst: Framework and Comprehensive Evaluation of Large Language Models for Financial Time Series Report Generation
par: Fons, Elizabeth, et autres
Publié: (2025)
par: Fons, Elizabeth, et autres
Publié: (2025)
Interpretable Text Embeddings and Text Similarity Explanation: A Survey
par: Opitz, Juri, et autres
Publié: (2025)
par: Opitz, Juri, et autres
Publié: (2025)
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension
par: Ai, Lin, et autres
Publié: (2024)
par: Ai, Lin, et autres
Publié: (2024)
Documents similaires
-
Controlling Reading Ease with Gaze-Guided Text Generation
par: Säuberli, Andreas, et autres
Publié: (2026) -
PARAPHRASUS : A Comprehensive Benchmark for Evaluating Paraphrase Detection Models
par: Michail, Andrianos, et autres
Publié: (2024) -
Examining Multilingual Embedding Models Cross-Lingually Through LLM-Generated Adversarial Examples
par: Michail, Andrianos, et autres
Publié: (2025) -
Do LLMs Give Psychometrically Plausible Responses in Educational Assessments?
par: Säuberli, Andreas, et autres
Publié: (2025) -
Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models
par: Li, Chang-Jin, et autres
Publié: (2024)