Alvorada-Bench: Can Language Models Solve Brazilian University Entrance Exams?
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Godoy, Henrique |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Extract-0: A Specialized Language Model for Document Information Extraction
par: Godoy, Henrique
Publié: (2025)
par: Godoy, Henrique
Publié: (2025)
Can Language Models Solve Olympiad Programming?
par: Shi, Quan, et autres
Publié: (2024)
par: Shi, Quan, et autres
Publié: (2024)
Can Language Models Solve Graph Problems in Natural Language?
par: Wang, Heng, et autres
Publié: (2023)
par: Wang, Heng, et autres
Publié: (2023)
FCoReBench: Can Large Language Models Solve Challenging First-Order Combinatorial Reasoning Problems?
par: Mittal, Chinmay, et autres
Publié: (2024)
par: Mittal, Chinmay, et autres
Publié: (2024)
Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams
par: Xiong, Ruoxin, et autres
Publié: (2025)
par: Xiong, Ruoxin, et autres
Publié: (2025)
SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
par: Liu, Chaoqun, et autres
Publié: (2025)
par: Liu, Chaoqun, et autres
Publié: (2025)
EnviroExam: Benchmarking Environmental Science Knowledge of Large Language Models
par: Huang, Yu, et autres
Publié: (2024)
par: Huang, Yu, et autres
Publié: (2024)
Can Large Language Models Replace Human Coders? Introducing ContentBench
par: Haman, Michael
Publié: (2026)
par: Haman, Michael
Publié: (2026)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
par: Zhao, Yimin, et autres
Publié: (2026)
par: Zhao, Yimin, et autres
Publié: (2026)
Can Large Language Models Solve Robot Routing?
par: Huang, Zhehui, et autres
Publié: (2024)
par: Huang, Zhehui, et autres
Publié: (2024)
Bilingual Evaluation of Language Models on General Knowledge in University Entrance Exams with Minimal Contamination
par: Salido, Eva Sánchez, et autres
Publié: (2024)
par: Salido, Eva Sánchez, et autres
Publié: (2024)
Can Vision-Language Models Solve Visual Math Equations?
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
par: Wang, Xiaoxuan, et autres
Publié: (2023)
par: Wang, Xiaoxuan, et autres
Publié: (2023)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
par: Kao, Kuei-Chun, et autres
Publié: (2024)
par: Kao, Kuei-Chun, et autres
Publié: (2024)
SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark
par: Liang, Zhenwen, et autres
Publié: (2024)
par: Liang, Zhenwen, et autres
Publié: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
The Ever-Evolving Science Exam
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
par: Cui, Yiming, et autres
Publié: (2025)
par: Cui, Yiming, et autres
Publié: (2025)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
par: Krechetova, Varvara, et autres
Publié: (2025)
par: Krechetova, Varvara, et autres
Publié: (2025)
Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools
par: Hao, Yilun, et autres
Publié: (2024)
par: Hao, Yilun, et autres
Publié: (2024)
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
par: Ok, Hyunjong, et autres
Publié: (2025)
par: Ok, Hyunjong, et autres
Publié: (2025)
How Diversely Can Language Models Solve Problems? Exploring the Algorithmic Diversity of Model-Generated Code
par: Lee, Seonghyeon, et autres
Publié: (2025)
par: Lee, Seonghyeon, et autres
Publié: (2025)
VideoGameBench: Can Vision-Language Models complete popular video games?
par: Zhang, Alex L., et autres
Publié: (2025)
par: Zhang, Alex L., et autres
Publié: (2025)
Liars' Bench: Evaluating Lie Detectors for Language Models
par: Kretschmar, Kieron, et autres
Publié: (2025)
par: Kretschmar, Kieron, et autres
Publié: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
par: Cui, Justin, et autres
Publié: (2024)
par: Cui, Justin, et autres
Publié: (2024)
SommBench: Assessing Sommelier Expertise of Language Models
par: Brach, William, et autres
Publié: (2026)
par: Brach, William, et autres
Publié: (2026)
LLM Olympiad: Why Model Evaluation Needs a Sealed Exam
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
Has It All Been Solved? Open NLP Research Questions Not Solved by Large Language Models
par: Ignat, Oana, et autres
Publié: (2023)
par: Ignat, Oana, et autres
Publié: (2023)
Reasoning Models Ace the CFA Exams
par: Patel, Jaisal, et autres
Publié: (2025)
par: Patel, Jaisal, et autres
Publié: (2025)
Reinforcement Learning Problem Solving with Large Language Models
par: Gholamian, Sina, et autres
Publié: (2024)
par: Gholamian, Sina, et autres
Publié: (2024)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
par: Zhang, Yuxuan, et autres
Publié: (2026)
par: Zhang, Yuxuan, et autres
Publié: (2026)
TaskBench: Benchmarking Large Language Models for Task Automation
par: Shen, Yongliang, et autres
Publié: (2023)
par: Shen, Yongliang, et autres
Publié: (2023)
Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench
par: Liu, Zheyuan, et autres
Publié: (2024)
par: Liu, Zheyuan, et autres
Publié: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
par: Sabour, Sahand, et autres
Publié: (2024)
par: Sabour, Sahand, et autres
Publié: (2024)
Perspective Transition of Large Language Models for Solving Subjective Tasks
par: Wang, Xiaolong, et autres
Publié: (2025)
par: Wang, Xiaolong, et autres
Publié: (2025)
Modular Arithmetic: Language Models Solve Math Digit by Digit
par: Baeumel, Tanja, et autres
Publié: (2025)
par: Baeumel, Tanja, et autres
Publié: (2025)
The Effect of Sampling Temperature on Problem Solving in Large Language Models
par: Renze, Matthew, et autres
Publié: (2024)
par: Renze, Matthew, et autres
Publié: (2024)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
par: Han, Wenhan, et autres
Publié: (2025)
par: Han, Wenhan, et autres
Publié: (2025)
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models
par: Adelani, David Ifeoluwa, et autres
Publié: (2024)
par: Adelani, David Ifeoluwa, et autres
Publié: (2024)
LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench
par: Valmeekam, Karthik, et autres
Publié: (2024)
par: Valmeekam, Karthik, et autres
Publié: (2024)
Documents similaires
-
Extract-0: A Specialized Language Model for Document Information Extraction
par: Godoy, Henrique
Publié: (2025) -
Can Language Models Solve Olympiad Programming?
par: Shi, Quan, et autres
Publié: (2024) -
Can Language Models Solve Graph Problems in Natural Language?
par: Wang, Heng, et autres
Publié: (2023) -
FCoReBench: Can Large Language Models Solve Challenging First-Order Combinatorial Reasoning Problems?
par: Mittal, Chinmay, et autres
Publié: (2024) -
Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams
par: Xiong, Ruoxin, et autres
Publié: (2025)