MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Marius, Dumitran Adrian, Moroianu, Theodor-Pierre, Mihnea-Vicentiu, Buca |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs
par: Dumitran, Adrian-Marius, et autres
Publié: (2025)
par: Dumitran, Adrian-Marius, et autres
Publié: (2025)
From Struggle (06-2024) to Mastery (02-2025) LLMs Conquer Advanced Algorithm Exams and Pave the Way for Editorial Generation
par: Dumitran, Adrian Marius, et autres
Publié: (2025)
par: Dumitran, Adrian Marius, et autres
Publié: (2025)
An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks
par: Stefan, Gabriel, et autres
Publié: (2026)
par: Stefan, Gabriel, et autres
Publié: (2026)
BacPrep: Lessons from Deploying an LLM-Based Bacalaureat Assessment Platform
par: Dumitran, Adrian-Marius, et autres
Publié: (2025)
par: Dumitran, Adrian-Marius, et autres
Publié: (2025)
Leveraging Generative AI for Enhancing Automated Assessment in Programming Education Contests
par: Dascalescu, Stefan, et autres
Publié: (2025)
par: Dascalescu, Stefan, et autres
Publié: (2025)
RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)
par: Cuclea, Luca-Ncolae, et autres
Publié: (2026)
par: Cuclea, Luca-Ncolae, et autres
Publié: (2026)
Do LLMs Understand Romanian Driving Laws? A Study on Multimodal and Fine-Tuned Question Answering
par: Barbu, Eduard, et autres
Publié: (2025)
par: Barbu, Eduard, et autres
Publié: (2025)
Block-Based Pathfinding: A Minecraft System for Visualizing Graph Algorithms
par: Pirvu, Luca-Stefan, et autres
Publié: (2026)
par: Pirvu, Luca-Stefan, et autres
Publié: (2026)
Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models
par: Sharma, Shivam, et autres
Publié: (2025)
par: Sharma, Shivam, et autres
Publié: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
par: Jiang, Roy, et autres
Publié: (2026)
par: Jiang, Roy, et autres
Publié: (2026)
The Design and Organization of Educational Competitions with Anonymous and Real-Time Leaderboards in Academic and Industrial Settings
par: Kadıoğlu, Serdar, et autres
Publié: (2024)
par: Kadıoğlu, Serdar, et autres
Publié: (2024)
When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition
par: Li, Karen Jia-Hui, et autres
Publié: (2025)
par: Li, Karen Jia-Hui, et autres
Publié: (2025)
Towards Red Teaming in Multimodal and Multilingual Translation
par: Ropers, Christophe, et autres
Publié: (2024)
par: Ropers, Christophe, et autres
Publié: (2024)
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs
par: Jeune, Pierre Le, et autres
Publié: (2026)
par: Jeune, Pierre Le, et autres
Publié: (2026)
The Oracle's Fingerprint: Correlated AI Forecasting Errors and the Limits of Bias Transmission
par: Spiro, Theodor
Publié: (2026)
par: Spiro, Theodor
Publié: (2026)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025)
par: Rystrøm, Jonathan, et autres
Publié: (2025)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2026)
par: Kabir, Mohsinul, et autres
Publié: (2026)
Triangulating Temporal Dynamics in Multilingual Swiss Online News
par: Victor, Bros, et autres
Publié: (2026)
par: Victor, Bros, et autres
Publié: (2026)
MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator
par: Roscan, Rares-Alexandru, et autres
Publié: (2026)
par: Roscan, Rares-Alexandru, et autres
Publié: (2026)
RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?
par: de Wynter, Adrian, et autres
Publié: (2024)
par: de Wynter, Adrian, et autres
Publié: (2024)
Universal statistical signatures of evolution in artificial intelligence architectures
par: Spiro, Theodor
Publié: (2026)
par: Spiro, Theodor
Publié: (2026)
Longitudinal and Multimodal Recording System to Capture Real-World Patient-Clinician Conversations for AI and Encounter Research: Protocol
par: Zahidy, Misk Al, et autres
Publié: (2025)
par: Zahidy, Misk Al, et autres
Publié: (2025)
Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs
par: Saeed, Muhammed, et autres
Publié: (2025)
par: Saeed, Muhammed, et autres
Publié: (2025)
Understanding Cultural Alignment in Multilingual LLMs via Natural Debate Statements
par: Negru, Vlad-Andrei, et autres
Publié: (2026)
par: Negru, Vlad-Andrei, et autres
Publié: (2026)
Whose ChatGPT? Unveiling Real-World Educational Inequalities Introduced by Large Language Models
par: Yu, Renzhe, et autres
Publié: (2024)
par: Yu, Renzhe, et autres
Publié: (2024)
RealHarm: A Collection of Real-World Language Model Application Failures
par: Jeune, Pierre Le, et autres
Publié: (2025)
par: Jeune, Pierre Le, et autres
Publié: (2025)
Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs
par: Oh, Gyutaek, et autres
Publié: (2025)
par: Oh, Gyutaek, et autres
Publié: (2025)
Does This Even Matter in the Real World? Real World Problems in Foundational Theory Courses
par: Kuznetsova, Anna
Publié: (2026)
par: Kuznetsova, Anna
Publié: (2026)
The Thin Line Between Comprehension and Persuasion in LLMs
par: de Wynter, Adrian, et autres
Publié: (2025)
par: de Wynter, Adrian, et autres
Publié: (2025)
Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark
par: Götting, Jasper, et autres
Publié: (2025)
par: Götting, Jasper, et autres
Publié: (2025)
Cyclic Adaptive Private Synthesis for Sharing Real-World Data in Education
par: Ito, Hibiki, et autres
Publié: (2026)
par: Ito, Hibiki, et autres
Publié: (2026)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
par: Xu, Liuchang, et autres
Publié: (2024)
par: Xu, Liuchang, et autres
Publié: (2024)
Multilingual Large Language Models and Curse of Multilinguality
par: Gurgurov, Daniil, et autres
Publié: (2024)
par: Gurgurov, Daniil, et autres
Publié: (2024)
Prompt Refinement or Fine-tuning? Best Practices for using LLMs in Computational Social Science Tasks
par: Møller, Anders Giovanni, et autres
Publié: (2024)
par: Møller, Anders Giovanni, et autres
Publié: (2024)
InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems
par: Shi, Shaojie, et autres
Publié: (2026)
par: Shi, Shaojie, et autres
Publié: (2026)
The Third-Party Access Effect: An Overlooked Challenge in Secondary Use of Educational Real-World Data
par: Ito, Hibiki, et autres
Publié: (2026)
par: Ito, Hibiki, et autres
Publié: (2026)
Parallel Algorithms for the One Sided Crossing Minimization Problem
par: Popa, Bogdan-Ioan, et autres
Publié: (2025)
par: Popa, Bogdan-Ioan, et autres
Publié: (2025)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
par: Lin, Justin W., et autres
Publié: (2025)
par: Lin, Justin W., et autres
Publié: (2025)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
par: Ikuta, Hikaru, et autres
Publié: (2024)
par: Ikuta, Hikaru, et autres
Publié: (2024)
Documents similaires
-
GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs
par: Dumitran, Adrian-Marius, et autres
Publié: (2025) -
From Struggle (06-2024) to Mastery (02-2025) LLMs Conquer Advanced Algorithm Exams and Pave the Way for Editorial Generation
par: Dumitran, Adrian Marius, et autres
Publié: (2025) -
An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks
par: Stefan, Gabriel, et autres
Publié: (2026) -
BacPrep: Lessons from Deploying an LLM-Based Bacalaureat Assessment Platform
par: Dumitran, Adrian-Marius, et autres
Publié: (2025) -
Leveraging Generative AI for Enhancing Automated Assessment in Programming Education Contests
par: Dascalescu, Stefan, et autres
Publié: (2025)