Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus
Fuente:
arXiv
Guardado en:
| Autores principales: | Brant, Thiago, Kühn, Julien, Pang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research
por: Magee, Liam
Publicado: (2026)
por: Magee, Liam
Publicado: (2026)
The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models
por: Van Clief, Jake, et al.
Publicado: (2025)
por: Van Clief, Jake, et al.
Publicado: (2025)
Sure! Here's a short and concise title for your paper: "Contamination in Generated Text Detection Benchmarks"
por: Dingfelder, Philipp, et al.
Publicado: (2025)
por: Dingfelder, Philipp, et al.
Publicado: (2025)
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
por: Gómez-Rodríguez, Carlos
Publicado: (2025)
por: Gómez-Rodríguez, Carlos
Publicado: (2025)
Reviewriter: AI-Generated Instructions For Peer Review Writing
por: Su, Xiaotian, et al.
Publicado: (2025)
por: Su, Xiaotian, et al.
Publicado: (2025)
ChatGPT Based Data Augmentation for Improved Parameter-Efficient Debiasing of LLMs
por: Han, Pengrui, et al.
Publicado: (2024)
por: Han, Pengrui, et al.
Publicado: (2024)
CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam
por: Khrulev, Ruslan
Publicado: (2025)
por: Khrulev, Ruslan
Publicado: (2025)
EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage
por: Young, Richard J., et al.
Publicado: (2026)
por: Young, Richard J., et al.
Publicado: (2026)
Automated Quality Assessment for LLM-Based Complex Qualitative Coding: A Confidence-Diversity Framework
por: Zhao, Zhilong, et al.
Publicado: (2025)
por: Zhao, Zhilong, et al.
Publicado: (2025)
When Names Change Verdicts: Intervention Consistency Reveals Systematic Bias in LLM Decision-Making
por: Basu, Abhinaba, et al.
Publicado: (2026)
por: Basu, Abhinaba, et al.
Publicado: (2026)
Subjective Question Generation and Answer Evaluation using NLP
por: Islam, G. M. Refatul, et al.
Publicado: (2025)
por: Islam, G. M. Refatul, et al.
Publicado: (2025)
Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs
por: Hari, Vishnu, et al.
Publicado: (2025)
por: Hari, Vishnu, et al.
Publicado: (2025)
Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation
por: Nasriddinov, Firdavs, et al.
Publicado: (2025)
por: Nasriddinov, Firdavs, et al.
Publicado: (2025)
Evaluating LLM Prompts for Data Augmentation in Multi-label Classification of Ecological Texts
por: Glazkova, Anna, et al.
Publicado: (2024)
por: Glazkova, Anna, et al.
Publicado: (2024)
From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring
por: Nguyen, Minh Hoang, et al.
Publicado: (2026)
por: Nguyen, Minh Hoang, et al.
Publicado: (2026)
Synthetic Student Responses: LLM-Extracted Features for IRT Difficulty Parameter Estimation
por: Hoyl, Matias
Publicado: (2026)
por: Hoyl, Matias
Publicado: (2026)
How can AI agents support journalists' work? An experiment with designing an LLM-driven intelligent reporting system
por: Maltezos, Vasileios, et al.
Publicado: (2025)
por: Maltezos, Vasileios, et al.
Publicado: (2025)
Modeling Political Discourse with Sentence-BERT and BERTopic
por: Mendonca, Margarida, et al.
Publicado: (2025)
por: Mendonca, Margarida, et al.
Publicado: (2025)
Toward Self-Driving Universities: Can Universities Drive Themselves with Agentic AI?
por: Koubaa, Anis
Publicado: (2026)
por: Koubaa, Anis
Publicado: (2026)
The AI Fiction Paradox
por: Elkins, Katherine
Publicado: (2026)
por: Elkins, Katherine
Publicado: (2026)
AI-Powered Citation Auditing: A Zero-Assumption Protocol for Systematic Reference Verification in Academic Research
por: van Rensburg, L. J. Janse
Publicado: (2025)
por: van Rensburg, L. J. Janse
Publicado: (2025)
On-Device Generative AI for GDPR-Compliant Visual Monitoring: Natural Language Alerts from Local Object Detection
por: Schappacher-Tilp, Gudrun, et al.
Publicado: (2026)
por: Schappacher-Tilp, Gudrun, et al.
Publicado: (2026)
Balancing Innovation and Integrity: AI Integration in Liberal Arts College Administration
por: Read, Ian Olivo
Publicado: (2025)
por: Read, Ian Olivo
Publicado: (2025)
How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents
por: Zha, Siyu, et al.
Publicado: (2026)
por: Zha, Siyu, et al.
Publicado: (2026)
CS-Guide: Leveraging LLMs and Student Reflections to Provide Frequent, Scalable Academic Monitoring Feedback to Computer Science Students
por: Chacko, Samuel Jacob, et al.
Publicado: (2025)
por: Chacko, Samuel Jacob, et al.
Publicado: (2025)
Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark
por: Bayram, M. Ali, et al.
Publicado: (2025)
por: Bayram, M. Ali, et al.
Publicado: (2025)
The Knesset Corpus: An Annotated Corpus of Hebrew Parliamentary Proceedings
por: Goldin, Gili, et al.
Publicado: (2024)
por: Goldin, Gili, et al.
Publicado: (2024)
Computational Social Linguistics for Telugu Cultural Preservation: Novel Algorithms for Chandassu Metrical Pattern Recognition
por: Pavan, Boddu Sri, et al.
Publicado: (2025)
por: Pavan, Boddu Sri, et al.
Publicado: (2025)
Automating Feedback Analysis in Surgical Training: Detection, Categorization, and Assessment
por: Nasriddinov, Firdavs, et al.
Publicado: (2024)
por: Nasriddinov, Firdavs, et al.
Publicado: (2024)
Synthesizing Behaviorally-Grounded Reasoning Chains: A Data-Generation Framework for Personal Finance LLMs
por: Theerthala, Akhil
Publicado: (2025)
por: Theerthala, Akhil
Publicado: (2025)
Modeling and Visualization Reasoning for Stakeholders in Education and Industry Integration Systems: Research on Structured Synthetic Dialogue Data Generation Based on NIST Standards
por: Meng, Wei
Publicado: (2025)
por: Meng, Wei
Publicado: (2025)
AVEC: Bootstrapping Privacy for Local LLMs
por: Gaikwad, Madhava
Publicado: (2025)
por: Gaikwad, Madhava
Publicado: (2025)
ArGen: Auto-Regulation of Generative AI via GRPO and Policy-as-Code
por: Madan, Kapil
Publicado: (2025)
por: Madan, Kapil
Publicado: (2025)
Towards the Terminator Economy: Assessing Job Exposure to AI through LLMs
por: Colombo, Emilio, et al.
Publicado: (2024)
por: Colombo, Emilio, et al.
Publicado: (2024)
Argument Quality Annotation and Gender Bias Detection in Financial Communication through Large Language Models
por: Alhamzeh, Alaa, et al.
Publicado: (2025)
por: Alhamzeh, Alaa, et al.
Publicado: (2025)
On the Validity of Traditional Vulnerability Scoring Systems for Adversarial Attacks against LLMs
por: Bahar, Atmane Ayoub Mansour, et al.
Publicado: (2024)
por: Bahar, Atmane Ayoub Mansour, et al.
Publicado: (2024)
AI to Learn 2.0: A Deliverable-Oriented Governance Framework and Maturity Rubric for Opaque AI in Learning-Intensive Domains
por: Shintani, Seine A.
Publicado: (2026)
por: Shintani, Seine A.
Publicado: (2026)
Efficacy of a Computer Tutor that Models Expert Human Tutors
por: Olney, Andrew M., et al.
Publicado: (2025)
por: Olney, Andrew M., et al.
Publicado: (2025)
Beyond Human Judgment: A Bayesian Evaluation of LLMs' Moral Values Understanding
por: Skorski, Maciej, et al.
Publicado: (2025)
por: Skorski, Maciej, et al.
Publicado: (2025)
Tokenizations for Austronesian Language Models: study on languages in Indonesia Archipelago
por: Lumbantobing, Andhika Bernard, et al.
Publicado: (2026)
por: Lumbantobing, Andhika Bernard, et al.
Publicado: (2026)
Ejemplares similares
-
Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research
por: Magee, Liam
Publicado: (2026) -
The Ethics Engine: A Modular Pipeline for Accessible Psychometric Assessment of Large Language Models
por: Van Clief, Jake, et al.
Publicado: (2025) -
Sure! Here's a short and concise title for your paper: "Contamination in Generated Text Detection Benchmarks"
por: Dingfelder, Philipp, et al.
Publicado: (2025) -
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
por: Gómez-Rodríguez, Carlos
Publicado: (2025) -
Reviewriter: AI-Generated Instructions For Peer Review Writing
por: Su, Xiaotian, et al.
Publicado: (2025)