LLM Olympiad: Why Model Evaluation Needs a Sealed Exam
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cruz, Jan Christian Blaise, Aji, Alham Fikri |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sense Representations Are Inducible Interfaces
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2026)
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2026)
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
von: Attia, Ahmed, et al.
Veröffentlicht: (2026)
von: Attia, Ahmed, et al.
Veröffentlicht: (2026)
Extracting General-use Transformers for Low-resource Languages via Knowledge Distillation
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2025)
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2025)
Thank You, Stingray: Multilingual Large Language Models Can Not (Yet) Disambiguate Cross-Lingual Word Sense
von: Cahyawijaya, Samuel, et al.
Veröffentlicht: (2024)
von: Cahyawijaya, Samuel, et al.
Veröffentlicht: (2024)
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
von: Mansurov, Jonibek, et al.
Veröffentlicht: (2024)
von: Mansurov, Jonibek, et al.
Veröffentlicht: (2024)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
von: Hudi, Frederikus, et al.
Veröffentlicht: (2025)
von: Hudi, Frederikus, et al.
Veröffentlicht: (2025)
Multilinguality as Sense Adaptation
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2026)
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2026)
Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation
von: Nur'aini, Khumaisa, et al.
Veröffentlicht: (2026)
von: Nur'aini, Khumaisa, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
Kalahi: A handcrafted, grassroots cultural LLM evaluation suite for Filipino
von: Montalan, Jann Railey, et al.
Veröffentlicht: (2024)
von: Montalan, Jann Railey, et al.
Veröffentlicht: (2024)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
von: Ananta, Moses, et al.
Veröffentlicht: (2025)
von: Ananta, Moses, et al.
Veröffentlicht: (2025)
Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming
von: Hadhoud, Sama, et al.
Veröffentlicht: (2026)
von: Hadhoud, Sama, et al.
Veröffentlicht: (2026)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
von: Lyu, Chenyang, et al.
Veröffentlicht: (2024)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
von: Aji, Alham Fikri, et al.
Veröffentlicht: (2025)
von: Aji, Alham Fikri, et al.
Veröffentlicht: (2025)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
von: Susanto, Lucky, et al.
Veröffentlicht: (2026)
von: Susanto, Lucky, et al.
Veröffentlicht: (2026)
IndoToxic2024: A Demographically-Enriched Dataset of Hate Speech and Toxicity Types for Indonesian Language
von: Susanto, Lucky, et al.
Veröffentlicht: (2024)
von: Susanto, Lucky, et al.
Veröffentlicht: (2024)
Towards Measuring and Modeling "Culture" in LLMs: A Survey
von: Adilazuarda, Muhammad Farid, et al.
Veröffentlicht: (2024)
von: Adilazuarda, Muhammad Farid, et al.
Veröffentlicht: (2024)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
von: Chevi, Rendi, et al.
Veröffentlicht: (2024)
von: Chevi, Rendi, et al.
Veröffentlicht: (2024)
NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts
von: Adilazuarda, Muhammad Farid, et al.
Veröffentlicht: (2025)
von: Adilazuarda, Muhammad Farid, et al.
Veröffentlicht: (2025)
Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models
von: Kaneko, Masahiro, et al.
Veröffentlicht: (2025)
von: Kaneko, Masahiro, et al.
Veröffentlicht: (2025)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
von: Altakrori, Malik H., et al.
Veröffentlicht: (2025)
von: Altakrori, Malik H., et al.
Veröffentlicht: (2025)
How Individual Traits and Language Styles Shape Preferences In Open-ended User-LLM Interaction: A Preliminary Study
von: Chevi, Rendi, et al.
Veröffentlicht: (2025)
von: Chevi, Rendi, et al.
Veröffentlicht: (2025)
Can Language Models Solve Olympiad Programming?
von: Shi, Quan, et al.
Veröffentlicht: (2024)
von: Shi, Quan, et al.
Veröffentlicht: (2024)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
von: Kautsar, Muhammad Dehan Al, et al.
Veröffentlicht: (2025)
von: Kautsar, Muhammad Dehan Al, et al.
Veröffentlicht: (2025)
Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-Tuning
von: Elshabrawy, Ahmed, et al.
Veröffentlicht: (2024)
von: Elshabrawy, Ahmed, et al.
Veröffentlicht: (2024)
Language-Specific Latent Process Hinders Cross-Lingual Performance
von: Lim, Zheng Wei, et al.
Veröffentlicht: (2025)
von: Lim, Zheng Wei, et al.
Veröffentlicht: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
von: Imam, Mohamed Fazli, et al.
Veröffentlicht: (2025)
von: Imam, Mohamed Fazli, et al.
Veröffentlicht: (2025)
The Privileged Students: On the Value of Initialization in Multilingual Knowledge Distillation
von: Wibowo, Haryo Akbarianto, et al.
Veröffentlicht: (2024)
von: Wibowo, Haryo Akbarianto, et al.
Veröffentlicht: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
von: Qorib, Muhammad Reza, et al.
Veröffentlicht: (2024)
von: Qorib, Muhammad Reza, et al.
Veröffentlicht: (2024)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
von: Cherian, Anoop, et al.
Veröffentlicht: (2024)
von: Cherian, Anoop, et al.
Veröffentlicht: (2024)
Crosslingual Reasoning through Test-Time Scaling
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2025)
From Multiple-Choice to Extractive QA: A Case Study for English and Arabic
von: Lynn, Teresa, et al.
Veröffentlicht: (2024)
von: Lynn, Teresa, et al.
Veröffentlicht: (2024)
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
von: Tasawong, Panuthep, et al.
Veröffentlicht: (2025)
von: Tasawong, Panuthep, et al.
Veröffentlicht: (2025)
The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior
von: Wang, Angelina, et al.
Veröffentlicht: (2025)
von: Wang, Angelina, et al.
Veröffentlicht: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
von: Mahdavi, Sadegh, et al.
Veröffentlicht: (2025)
von: Mahdavi, Sadegh, et al.
Veröffentlicht: (2025)
Mastering Olympiad-Level Physics with Artificial Intelligence
von: Jian, Dong-Shan, et al.
Veröffentlicht: (2025)
von: Jian, Dong-Shan, et al.
Veröffentlicht: (2025)
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
von: Li, Yafu, et al.
Veröffentlicht: (2026)
von: Li, Yafu, et al.
Veröffentlicht: (2026)
Xolver: Multi-Agent Reasoning with Holistic Experience Learning Just Like an Olympiad Team
von: Hosain, Md Tanzib, et al.
Veröffentlicht: (2025)
von: Hosain, Md Tanzib, et al.
Veröffentlicht: (2025)
P1: Mastering Physics Olympiads with Reinforcement Learning
von: Chen, Jiacheng, et al.
Veröffentlicht: (2025)
von: Chen, Jiacheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Sense Representations Are Inducible Interfaces
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2026) -
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
von: Attia, Ahmed, et al.
Veröffentlicht: (2026) -
Extracting General-use Transformers for Low-resource Languages via Knowledge Distillation
von: Cruz, Jan Christian Blaise, et al.
Veröffentlicht: (2025) -
Thank You, Stingray: Multilingual Large Language Models Can Not (Yet) Disambiguate Cross-Lingual Word Sense
von: Cahyawijaya, Samuel, et al.
Veröffentlicht: (2024) -
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
von: Mansurov, Jonibek, et al.
Veröffentlicht: (2024)