Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Brant, Thiago, Kühn, Julien, Pang, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research
par: Magee, Liam
Publié: (2026)
par: Magee, Liam
Publié: (2026)
The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models
par: Van Clief, Jake, et autres
Publié: (2025)
par: Van Clief, Jake, et autres
Publié: (2025)
Sure! Here's a short and concise title for your paper: "Contamination in Generated Text Detection Benchmarks"
par: Dingfelder, Philipp, et autres
Publié: (2025)
par: Dingfelder, Philipp, et autres
Publié: (2025)
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
par: Gómez-Rodríguez, Carlos
Publié: (2025)
par: Gómez-Rodríguez, Carlos
Publié: (2025)
Reviewriter: AI-Generated Instructions For Peer Review Writing
par: Su, Xiaotian, et autres
Publié: (2025)
par: Su, Xiaotian, et autres
Publié: (2025)
ChatGPT Based Data Augmentation for Improved Parameter-Efficient Debiasing of LLMs
par: Han, Pengrui, et autres
Publié: (2024)
par: Han, Pengrui, et autres
Publié: (2024)
CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam
par: Khrulev, Ruslan
Publié: (2025)
par: Khrulev, Ruslan
Publié: (2025)
EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage
par: Young, Richard J., et autres
Publié: (2026)
par: Young, Richard J., et autres
Publié: (2026)
Automated Quality Assessment for LLM-Based Complex Qualitative Coding: A Confidence-Diversity Framework
par: Zhao, Zhilong, et autres
Publié: (2025)
par: Zhao, Zhilong, et autres
Publié: (2025)
When Names Change Verdicts: Intervention Consistency Reveals Systematic Bias in LLM Decision-Making
par: Basu, Abhinaba, et autres
Publié: (2026)
par: Basu, Abhinaba, et autres
Publié: (2026)
Subjective Question Generation and Answer Evaluation using NLP
par: Islam, G. M. Refatul, et autres
Publié: (2025)
par: Islam, G. M. Refatul, et autres
Publié: (2025)
Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs
par: Hari, Vishnu, et autres
Publié: (2025)
par: Hari, Vishnu, et autres
Publié: (2025)
Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation
par: Nasriddinov, Firdavs, et autres
Publié: (2025)
par: Nasriddinov, Firdavs, et autres
Publié: (2025)
Evaluating LLM Prompts for Data Augmentation in Multi-label Classification of Ecological Texts
par: Glazkova, Anna, et autres
Publié: (2024)
par: Glazkova, Anna, et autres
Publié: (2024)
From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring
par: Nguyen, Minh Hoang, et autres
Publié: (2026)
par: Nguyen, Minh Hoang, et autres
Publié: (2026)
Synthetic Student Responses: LLM-Extracted Features for IRT Difficulty Parameter Estimation
par: Hoyl, Matias
Publié: (2026)
par: Hoyl, Matias
Publié: (2026)
How can AI agents support journalists' work? An experiment with designing an LLM-driven intelligent reporting system
par: Maltezos, Vasileios, et autres
Publié: (2025)
par: Maltezos, Vasileios, et autres
Publié: (2025)
Modeling Political Discourse with Sentence-BERT and BERTopic
par: Mendonca, Margarida, et autres
Publié: (2025)
par: Mendonca, Margarida, et autres
Publié: (2025)
Toward Self-Driving Universities: Can Universities Drive Themselves with Agentic AI?
par: Koubaa, Anis
Publié: (2026)
par: Koubaa, Anis
Publié: (2026)
The AI Fiction Paradox
par: Elkins, Katherine
Publié: (2026)
par: Elkins, Katherine
Publié: (2026)
AI-Powered Citation Auditing: A Zero-Assumption Protocol for Systematic Reference Verification in Academic Research
par: van Rensburg, L. J. Janse
Publié: (2025)
par: van Rensburg, L. J. Janse
Publié: (2025)
On-Device Generative AI for GDPR-Compliant Visual Monitoring: Natural Language Alerts from Local Object Detection
par: Schappacher-Tilp, Gudrun, et autres
Publié: (2026)
par: Schappacher-Tilp, Gudrun, et autres
Publié: (2026)
Balancing Innovation and Integrity: AI Integration in Liberal Arts College Administration
par: Read, Ian Olivo
Publié: (2025)
par: Read, Ian Olivo
Publié: (2025)
How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents
par: Zha, Siyu, et autres
Publié: (2026)
par: Zha, Siyu, et autres
Publié: (2026)
CS-Guide: Leveraging LLMs and Student Reflections to Provide Frequent, Scalable Academic Monitoring Feedback to Computer Science Students
par: Chacko, Samuel Jacob, et autres
Publié: (2025)
par: Chacko, Samuel Jacob, et autres
Publié: (2025)
Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark
par: Bayram, M. Ali, et autres
Publié: (2025)
par: Bayram, M. Ali, et autres
Publié: (2025)
The Knesset Corpus: An Annotated Corpus of Hebrew Parliamentary Proceedings
par: Goldin, Gili, et autres
Publié: (2024)
par: Goldin, Gili, et autres
Publié: (2024)
Computational Social Linguistics for Telugu Cultural Preservation: Novel Algorithms for Chandassu Metrical Pattern Recognition
par: Pavan, Boddu Sri, et autres
Publié: (2025)
par: Pavan, Boddu Sri, et autres
Publié: (2025)
Automating Feedback Analysis in Surgical Training: Detection, Categorization, and Assessment
par: Nasriddinov, Firdavs, et autres
Publié: (2024)
par: Nasriddinov, Firdavs, et autres
Publié: (2024)
Synthesizing Behaviorally-Grounded Reasoning Chains: A Data-Generation Framework for Personal Finance LLMs
par: Theerthala, Akhil
Publié: (2025)
par: Theerthala, Akhil
Publié: (2025)
Modeling and Visualization Reasoning for Stakeholders in Education and Industry Integration Systems: Research on Structured Synthetic Dialogue Data Generation Based on NIST Standards
par: Meng, Wei
Publié: (2025)
par: Meng, Wei
Publié: (2025)
AVEC: Bootstrapping Privacy for Local LLMs
par: Gaikwad, Madhava
Publié: (2025)
par: Gaikwad, Madhava
Publié: (2025)
ArGen: Auto-Regulation of Generative AI via GRPO and Policy-as-Code
par: Madan, Kapil
Publié: (2025)
par: Madan, Kapil
Publié: (2025)
Towards the Terminator Economy: Assessing Job Exposure to AI through LLMs
par: Colombo, Emilio, et autres
Publié: (2024)
par: Colombo, Emilio, et autres
Publié: (2024)
Argument Quality Annotation and Gender Bias Detection in Financial Communication through Large Language Models
par: Alhamzeh, Alaa, et autres
Publié: (2025)
par: Alhamzeh, Alaa, et autres
Publié: (2025)
On the Validity of Traditional Vulnerability Scoring Systems for Adversarial Attacks against LLMs
par: Bahar, Atmane Ayoub Mansour, et autres
Publié: (2024)
par: Bahar, Atmane Ayoub Mansour, et autres
Publié: (2024)
AI to Learn 2.0: A Deliverable-Oriented Governance Framework and Maturity Rubric for Opaque AI in Learning-Intensive Domains
par: Shintani, Seine A.
Publié: (2026)
par: Shintani, Seine A.
Publié: (2026)
Efficacy of a Computer Tutor that Models Expert Human Tutors
par: Olney, Andrew M., et autres
Publié: (2025)
par: Olney, Andrew M., et autres
Publié: (2025)
Beyond Human Judgment: A Bayesian Evaluation of LLMs' Moral Values Understanding
par: Skorski, Maciej, et autres
Publié: (2025)
par: Skorski, Maciej, et autres
Publié: (2025)
Tokenizations for Austronesian Language Models: study on languages in Indonesia Archipelago
par: Lumbantobing, Andhika Bernard, et autres
Publié: (2026)
par: Lumbantobing, Andhika Bernard, et autres
Publié: (2026)
Documents similaires
-
Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research
par: Magee, Liam
Publié: (2026) -
The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models
par: Van Clief, Jake, et autres
Publié: (2025) -
Sure! Here's a short and concise title for your paper: "Contamination in Generated Text Detection Benchmarks"
par: Dingfelder, Philipp, et autres
Publié: (2025) -
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
par: Gómez-Rodríguez, Carlos
Publié: (2025) -
Reviewriter: AI-Generated Instructions For Peer Review Writing
par: Su, Xiaotian, et autres
Publié: (2025)