Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Seunguk, Kim, Kyeonghyun, Yun, Jungmin, Kim, Youngbin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse
por: Yu, Seunguk, et al.
Publicado: (2025)
por: Yu, Seunguk, et al.
Publicado: (2025)
Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation
por: Park, Keunhyeung, et al.
Publicado: (2025)
por: Park, Keunhyeung, et al.
Publicado: (2025)
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
por: Yun, Jungmin, et al.
Publicado: (2024)
por: Yun, Jungmin, et al.
Publicado: (2024)
Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language Models
por: Yu, Seunguk, et al.
Publicado: (2025)
por: Yu, Seunguk, et al.
Publicado: (2025)
Don't be a Fool: Pooling Strategies in Offensive Language Detection from User-Intended Adversarial Attacks
por: Yu, Seunguk, et al.
Publicado: (2024)
por: Yu, Seunguk, et al.
Publicado: (2024)
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
KoCoNovel: Annotated Dataset of Character Coreference in Korean Novels
por: Kim, Kyuhee, et al.
Publicado: (2024)
por: Kim, Kyuhee, et al.
Publicado: (2024)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
por: Choi, Dasol, et al.
Publicado: (2025)
por: Choi, Dasol, et al.
Publicado: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
por: Park, Chanjun, et al.
Publicado: (2024)
por: Park, Chanjun, et al.
Publicado: (2024)
KoCoSa: Korean Context-aware Sarcasm Detection Dataset
por: Kim, Yumin, et al.
Publicado: (2024)
por: Kim, Yumin, et al.
Publicado: (2024)
SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents
por: Lee, Jaehoon, et al.
Publicado: (2025)
por: Lee, Jaehoon, et al.
Publicado: (2025)
CARBD-Ko: A Contextually Annotated Review Benchmark Dataset for Aspect-Level Sentiment Classification in Korean
por: Jang, Dongjun, et al.
Publicado: (2024)
por: Jang, Dongjun, et al.
Publicado: (2024)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
por: Ko, Donghyeon, et al.
Publicado: (2025)
por: Ko, Donghyeon, et al.
Publicado: (2025)
KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation
por: Kim, JunSeo, et al.
Publicado: (2025)
por: Kim, JunSeo, et al.
Publicado: (2025)
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
por: Shin, Hyopil, et al.
Publicado: (2025)
por: Shin, Hyopil, et al.
Publicado: (2025)
CoBA: Counterbias Text Augmentation for Mitigating Various Spurious Correlations via Semantic Triples
por: Jin, Kyohoon, et al.
Publicado: (2025)
por: Jin, Kyohoon, et al.
Publicado: (2025)
Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings
por: Choi, Juhwan, et al.
Publicado: (2024)
por: Choi, Juhwan, et al.
Publicado: (2024)
UniGen: Universal Domain Generalization for Sentiment Classification via Zero-shot Dataset Generation
por: Choi, Juhwan, et al.
Publicado: (2024)
por: Choi, Juhwan, et al.
Publicado: (2024)
KoBBQ: Korean Bias Benchmark for Question Answering
por: Jin, Jiho, et al.
Publicado: (2023)
por: Jin, Jiho, et al.
Publicado: (2023)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
por: Park, Chanwoo, et al.
Publicado: (2025)
por: Park, Chanwoo, et al.
Publicado: (2025)
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
por: Jung, Sungmok, et al.
Publicado: (2026)
por: Jung, Sungmok, et al.
Publicado: (2026)
IM-BERT: Enhancing Robustness of BERT through the Implicit Euler Method
por: Kim, Mihyeon, et al.
Publicado: (2025)
por: Kim, Mihyeon, et al.
Publicado: (2025)
Unveiling Key Aspects of Fine-Tuning in Sentence Embeddings: A Representation Rank Analysis
por: Jung, Euna, et al.
Publicado: (2024)
por: Jung, Euna, et al.
Publicado: (2024)
KoGEC : Korean Grammatical Error Correction with Pre-trained Translation Models
por: Kim, Taeeun, et al.
Publicado: (2025)
por: Kim, Taeeun, et al.
Publicado: (2025)
KoDialogBench: Evaluating Conversational Understanding of Language Models with Korean Dialogue Benchmark
por: Jang, Seongbo, et al.
Publicado: (2024)
por: Jang, Seongbo, et al.
Publicado: (2024)
Optimizing Korean-Centric LLMs via Token Pruning
por: Kim, Hoyeol, et al.
Publicado: (2026)
por: Kim, Hoyeol, et al.
Publicado: (2026)
VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks
por: Choi, Juhwan, et al.
Publicado: (2024)
por: Choi, Juhwan, et al.
Publicado: (2024)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
por: Choi, Juhwan, et al.
Publicado: (2024)
por: Choi, Juhwan, et al.
Publicado: (2024)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
por: Kim, Eunsu, et al.
Publicado: (2025)
por: Kim, Eunsu, et al.
Publicado: (2025)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
por: Kim, Jinyoung, et al.
Publicado: (2026)
por: Kim, Jinyoung, et al.
Publicado: (2026)
Beyond Learning: A Training-Free Alternative to Model Adaptation
por: Yoon, Namkyung, et al.
Publicado: (2026)
por: Yoon, Namkyung, et al.
Publicado: (2026)
Make Compound Sentences Simple to Analyze: Learning to Split Sentences for Aspect-based Sentiment Analysis
por: Seo, Yongsik, et al.
Publicado: (2024)
por: Seo, Yongsik, et al.
Publicado: (2024)
Making Qwen3 Think in Korean with Reinforcement Learning
por: Lee, Jungyup, et al.
Publicado: (2025)
por: Lee, Jungyup, et al.
Publicado: (2025)
Leveraging KV Similarity for Online Structured Pruning in LLMs
por: Lee, Jungmin, et al.
Publicado: (2025)
por: Lee, Jungmin, et al.
Publicado: (2025)
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
por: Kim, Jinpyo, et al.
Publicado: (2025)
por: Kim, Jinpyo, et al.
Publicado: (2025)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
por: Son, Guijin, et al.
Publicado: (2023)
por: Son, Guijin, et al.
Publicado: (2023)
Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios
por: Lee, Sangyub, et al.
Publicado: (2026)
por: Lee, Sangyub, et al.
Publicado: (2026)
Can Language Models Evaluate Human Written Text? Case Study on Korean Student Writing for Education
por: Kim, Seungyoon, et al.
Publicado: (2024)
por: Kim, Seungyoon, et al.
Publicado: (2024)
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
por: Kim, Eunsu, et al.
Publicado: (2024)
por: Kim, Eunsu, et al.
Publicado: (2024)
Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study
por: Lim, Junghwan, et al.
Publicado: (2025)
por: Lim, Junghwan, et al.
Publicado: (2025)
Ejemplares similares
-
From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse
por: Yu, Seunguk, et al.
Publicado: (2025) -
Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation
por: Park, Keunhyeung, et al.
Publicado: (2025) -
Focus on the Core: Efficient Attention via Pruned Token Compression for Document Classification
por: Yun, Jungmin, et al.
Publicado: (2024) -
Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language Models
por: Yu, Seunguk, et al.
Publicado: (2025) -
Don't be a Fool: Pooling Strategies in Offensive Language Detection from User-Intended Adversarial Attacks
por: Yu, Seunguk, et al.
Publicado: (2024)