KAIO: A Collection of More Challenging Korean Questions
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Nahyun, Son, Guijin, Ko, Hyunwoo, Han, Kyubeen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
Multi-Step Reasoning in Korean and the Emergent Mirage
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
ResearchMath-14K: Scaling Research-Level Mathematics via Agents
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
di: Son, Guijin, et al.
Pubblicazione: (2023)
di: Son, Guijin, et al.
Pubblicazione: (2023)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models
di: Lee, Hanwool, et al.
Pubblicazione: (2025)
di: Lee, Hanwool, et al.
Pubblicazione: (2025)
Revisiting the Uniform Information Density Hypothesis in LLM Reasoning
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
Revisiting the UID Hypothesis in LLM Reasoning Traces
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
KoBBQ: Korean Bias Benchmark for Question Answering
di: Jin, Jiho, et al.
Pubblicazione: (2023)
di: Jin, Jiho, et al.
Pubblicazione: (2023)
Exploring the Impact of Instruction-Tuning on LLM's Susceptibility to Misinformation
di: Han, Kyubeen, et al.
Pubblicazione: (2025)
di: Han, Kyubeen, et al.
Pubblicazione: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering
di: Masry, Ahmed, et al.
Pubblicazione: (2025)
di: Masry, Ahmed, et al.
Pubblicazione: (2025)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
ESG Classification by Implicit Rule Learning via GPT-4
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
Improving Fine-grained Visual Understanding in VLMs through Text-Only Training
di: Choi, Dasol, et al.
Pubblicazione: (2024)
di: Choi, Dasol, et al.
Pubblicazione: (2024)
SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs
di: Aditi, et al.
Pubblicazione: (2025)
di: Aditi, et al.
Pubblicazione: (2025)
FunctionChat-Bench: Comprehensive Evaluation of Language Models' Generative Capabilities in Korean Tool-use Dialogs
di: Lee, Shinbok, et al.
Pubblicazione: (2024)
di: Lee, Shinbok, et al.
Pubblicazione: (2024)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence
di: Kim, Minbeom, et al.
Pubblicazione: (2024)
di: Kim, Minbeom, et al.
Pubblicazione: (2024)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
Can Large Language Models Predict Antimicrobial Resistance Gene?
di: Yoo, Hyunwoo
Pubblicazione: (2025)
di: Yoo, Hyunwoo
Pubblicazione: (2025)
Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts
di: Song, Seyoung, et al.
Pubblicazione: (2025)
di: Song, Seyoung, et al.
Pubblicazione: (2025)
Making Qwen3 Think in Korean with Reinforcement Learning
di: Lee, Jungyup, et al.
Pubblicazione: (2025)
di: Lee, Jungyup, et al.
Pubblicazione: (2025)
A Curious Class of Adpositional Multiword Expressions in Korean
di: Min, Junghyun, et al.
Pubblicazione: (2026)
di: Min, Junghyun, et al.
Pubblicazione: (2026)
One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoning
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
di: Kweon, Sunjun, et al.
Pubblicazione: (2024)
di: Kweon, Sunjun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026) -
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025) -
Multi-Step Reasoning in Korean and the Emergent Mirage
di: Son, Guijin, et al.
Pubblicazione: (2025) -
Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
di: Lee, Nahyun, et al.
Pubblicazione: (2026) -
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025)