Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Chanjun, Kim, Hyeonwoo, Kim, Dahyun, Cho, Seonghwan, Kim, Sanghoon, Lee, Sukyung, Kim, Yungi, Lee, Hwalsuk |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language Models
di: Park, Hyunbyung, et al.
Pubblicazione: (2024)
di: Park, Hyunbyung, et al.
Pubblicazione: (2024)
1 Trillion Token (1TT) Platform: A Novel Framework for Efficient Data Sharing and Compensation in Large Language Models
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
sDPO: Don't Use Your Data All at Once
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
di: Kim, Dahyun, et al.
Pubblicazione: (2023)
Evalverse: Unified and Accessible Library for Large Language Model Evaluation
di: Kim, Jihoo, et al.
Pubblicazione: (2024)
di: Kim, Jihoo, et al.
Pubblicazione: (2024)
LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents
di: Lee, Jaehoon, et al.
Pubblicazione: (2025)
di: Lee, Jaehoon, et al.
Pubblicazione: (2025)
KoBBQ: Korean Bias Benchmark for Question Answering
di: Jin, Jiho, et al.
Pubblicazione: (2023)
di: Jin, Jiho, et al.
Pubblicazione: (2023)
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
di: Shin, Hyopil, et al.
Pubblicazione: (2025)
di: Shin, Hyopil, et al.
Pubblicazione: (2025)
InstaTrans: An Instruction-Aware Translation Framework for Non-English Instruction Datasets
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
KoCoNovel: Annotated Dataset of Character Coreference in Korean Novels
di: Kim, Kyuhee, et al.
Pubblicazione: (2024)
di: Kim, Kyuhee, et al.
Pubblicazione: (2024)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
di: Jung, Sungmok, et al.
Pubblicazione: (2026)
di: Jung, Sungmok, et al.
Pubblicazione: (2026)
KoCoSa: Korean Context-aware Sarcasm Detection Dataset
di: Kim, Yumin, et al.
Pubblicazione: (2024)
di: Kim, Yumin, et al.
Pubblicazione: (2024)
KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
di: Lee, Jihyung, et al.
Pubblicazione: (2025)
di: Lee, Jihyung, et al.
Pubblicazione: (2025)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
KoDialogBench: Evaluating Conversational Understanding of Language Models with Korean Dialogue Benchmark
di: Jang, Seongbo, et al.
Pubblicazione: (2024)
di: Jang, Seongbo, et al.
Pubblicazione: (2024)
Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
di: Yu, Seunguk, et al.
Pubblicazione: (2025)
di: Yu, Seunguk, et al.
Pubblicazione: (2025)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
Model-Based Data-Centric AI: Bridging the Divide Between Academic Ideals and Industrial Pragmatism
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
CARBD-Ko: A Contextually Annotated Review Benchmark Dataset for Aspect-Level Sentiment Classification in Korean
di: Jang, Dongjun, et al.
Pubblicazione: (2024)
di: Jang, Dongjun, et al.
Pubblicazione: (2024)
KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation
di: Kim, JunSeo, et al.
Pubblicazione: (2025)
di: Kim, JunSeo, et al.
Pubblicazione: (2025)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
di: Kim, Jinyoung, et al.
Pubblicazione: (2026)
di: Kim, Jinyoung, et al.
Pubblicazione: (2026)
KoGEC : Korean Grammatical Error Correction with Pre-trained Translation Models
di: Kim, Taeeun, et al.
Pubblicazione: (2025)
di: Kim, Taeeun, et al.
Pubblicazione: (2025)
Optimizing Korean-Centric LLMs via Token Pruning
di: Kim, Hoyeol, et al.
Pubblicazione: (2026)
di: Kim, Hoyeol, et al.
Pubblicazione: (2026)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching
di: Kim, Seoyeon, et al.
Pubblicazione: (2024)
di: Kim, Seoyeon, et al.
Pubblicazione: (2024)
TriBench-Ko: Evaluating LLM Risks in Judicial Workflows
di: Lee, Haesung, et al.
Pubblicazione: (2026)
di: Lee, Haesung, et al.
Pubblicazione: (2026)
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
di: Kim, Jinpyo, et al.
Pubblicazione: (2025)
di: Kim, Jinpyo, et al.
Pubblicazione: (2025)
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
di: Lee, Jiyoung, et al.
Pubblicazione: (2024)
di: Lee, Jiyoung, et al.
Pubblicazione: (2024)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
di: Son, Guijin, et al.
Pubblicazione: (2023)
di: Son, Guijin, et al.
Pubblicazione: (2023)
Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrieval
di: Chun, Yongchan, et al.
Pubblicazione: (2025)
di: Chun, Yongchan, et al.
Pubblicazione: (2025)
KoLA: Carefully Benchmarking World Knowledge of Large Language Models
di: Yu, Jifan, et al.
Pubblicazione: (2023)
di: Yu, Jifan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024) -
Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard
di: Park, Chanjun, et al.
Pubblicazione: (2024) -
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024) -
Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language Models
di: Park, Hyunbyung, et al.
Pubblicazione: (2024) -
1 Trillion Token (1TT) Platform: A Novel Framework for Efficient Data Sharing and Compensation in Large Language Models
di: Park, Chanjun, et al.
Pubblicazione: (2024)