KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Ko, Donghyeon, Jin, Yeguk, Chae, Kyubyung, Lee, Byungwook, Jo, Chansong, In, Sookyo, Lee, Jaehong, Kim, Taesup, Kwak, Donghyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
por: Chae, Kyubyung, et al.
Publicado: (2025)
por: Chae, Kyubyung, et al.
Publicado: (2025)
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
por: Lee, Joosung, et al.
Publicado: (2026)
por: Lee, Joosung, et al.
Publicado: (2026)
Mitigating Hallucination in Abstractive Summarization with Domain-Conditional Mutual Information
por: Chae, Kyubyung, et al.
Publicado: (2024)
por: Chae, Kyubyung, et al.
Publicado: (2024)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
por: Chae, Kyubyung, et al.
Publicado: (2025)
por: Chae, Kyubyung, et al.
Publicado: (2025)
ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search
por: Lee, Hyunseok, et al.
Publicado: (2025)
por: Lee, Hyunseok, et al.
Publicado: (2025)
What If TSF: A Benchmark for Reframing Forecasting as Scenario-Guided Multimodal Forecasting
por: Jang, Jinkwan, et al.
Publicado: (2026)
por: Jang, Jinkwan, et al.
Publicado: (2026)
Model-based Preference Optimization in Abstractive Summarization without Human Feedback
por: Choi, Jaepill, et al.
Publicado: (2024)
por: Choi, Jaepill, et al.
Publicado: (2024)
KoBBQ: Korean Bias Benchmark for Question Answering
por: Jin, Jiho, et al.
Publicado: (2023)
por: Jin, Jiho, et al.
Publicado: (2023)
Beyond Case Law: Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA
por: Chae, Kyubyung, et al.
Publicado: (2026)
por: Chae, Kyubyung, et al.
Publicado: (2026)
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
por: Shin, Hyopil, et al.
Publicado: (2025)
por: Shin, Hyopil, et al.
Publicado: (2025)
When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining
por: Yeo, Juan, et al.
Publicado: (2024)
por: Yeo, Juan, et al.
Publicado: (2024)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
por: Park, Chanjun, et al.
Publicado: (2024)
por: Park, Chanjun, et al.
Publicado: (2024)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
por: Park, Chanwoo, et al.
Publicado: (2025)
por: Park, Chanwoo, et al.
Publicado: (2025)
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
por: Jung, Sungmok, et al.
Publicado: (2026)
por: Jung, Sungmok, et al.
Publicado: (2026)
Robust Domain Generalization under Divergent Marginal and Conditional Distributions
por: Yeom, Jewon, et al.
Publicado: (2026)
por: Yeom, Jewon, et al.
Publicado: (2026)
SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents
por: Lee, Jaehoon, et al.
Publicado: (2025)
por: Lee, Jaehoon, et al.
Publicado: (2025)
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
KoCoNovel: Annotated Dataset of Character Coreference in Korean Novels
por: Kim, Kyuhee, et al.
Publicado: (2024)
por: Kim, Kyuhee, et al.
Publicado: (2024)
X-PEFT: eXtremely Parameter-Efficient Fine-Tuning for Extreme Multi-Profile Scenarios
por: Kwak, Namju, et al.
Publicado: (2024)
por: Kwak, Namju, et al.
Publicado: (2024)
KoDialogBench: Evaluating Conversational Understanding of Language Models with Korean Dialogue Benchmark
por: Jang, Seongbo, et al.
Publicado: (2024)
por: Jang, Seongbo, et al.
Publicado: (2024)
KoCoSa: Korean Context-aware Sarcasm Detection Dataset
por: Kim, Yumin, et al.
Publicado: (2024)
por: Kim, Yumin, et al.
Publicado: (2024)
Factuality or Fiction? Benchmarking Modern LLMs on Ambiguous QA with Citations
por: Patel, Maya, et al.
Publicado: (2024)
por: Patel, Maya, et al.
Publicado: (2024)
SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge
por: Haas, Lukas, et al.
Publicado: (2025)
por: Haas, Lukas, et al.
Publicado: (2025)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
por: Kim, Donggeun, et al.
Publicado: (2024)
por: Kim, Donggeun, et al.
Publicado: (2024)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
por: Choi, Dasol, et al.
Publicado: (2025)
por: Choi, Dasol, et al.
Publicado: (2025)
Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
por: Jo, Yujin, et al.
Publicado: (2025)
por: Jo, Yujin, et al.
Publicado: (2025)
Dynamical Billiard and a long-time behavior of the Boltzmann equation in general 3D toroidal domains
por: Ko, Gyounghun, et al.
Publicado: (2023)
por: Ko, Gyounghun, et al.
Publicado: (2023)
KoTaP: A Panel Dataset for Corporate Tax Avoidance, Performance, and Governance in Korea
por: Na, Hyungjong, et al.
Publicado: (2025)
por: Na, Hyungjong, et al.
Publicado: (2025)
Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstition
por: Kim, Kyuhee, et al.
Publicado: (2025)
por: Kim, Kyuhee, et al.
Publicado: (2025)
Gated Low-rank Adaptation for personalized Code-Switching Automatic Speech Recognition on the low-spec devices
por: Kim, Gwantae, et al.
Publicado: (2024)
por: Kim, Gwantae, et al.
Publicado: (2024)
Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
por: Yu, Seunguk, et al.
Publicado: (2025)
por: Yu, Seunguk, et al.
Publicado: (2025)
KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
por: Lee, Jihyung, et al.
Publicado: (2025)
por: Lee, Jihyung, et al.
Publicado: (2025)
TriBench-Ko: Evaluating LLM Risks in Judicial Workflows
por: Lee, Haesung, et al.
Publicado: (2026)
por: Lee, Haesung, et al.
Publicado: (2026)
ExpertGenQA: Open-ended QA generation in Specialized Domains
por: Shahgir, Haz Sameen, et al.
Publicado: (2025)
por: Shahgir, Haz Sameen, et al.
Publicado: (2025)
Factors Associated With Health‐Promoting Behaviors Among South Korean Adults: A Cross‐Sectional Study
por: Yoonjung Kim, et al.
Publicado: (2024)
por: Yoonjung Kim, et al.
Publicado: (2024)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
por: Yang, Jian, et al.
Publicado: (2025)
por: Yang, Jian, et al.
Publicado: (2025)
CARBD-Ko: A Contextually Annotated Review Benchmark Dataset for Aspect-Level Sentiment Classification in Korean
por: Jang, Dongjun, et al.
Publicado: (2024)
por: Jang, Dongjun, et al.
Publicado: (2024)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
por: Lee, Nahyun, et al.
Publicado: (2026)
por: Lee, Nahyun, et al.
Publicado: (2026)
BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios
por: Lee, Yunseung, et al.
Publicado: (2026)
por: Lee, Yunseung, et al.
Publicado: (2026)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
Ejemplares similares
-
From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment
por: Chae, Kyubyung, et al.
Publicado: (2025) -
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
por: Lee, Joosung, et al.
Publicado: (2026) -
Mitigating Hallucination in Abstractive Summarization with Domain-Conditional Mutual Information
por: Chae, Kyubyung, et al.
Publicado: (2024) -
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
por: Chae, Kyubyung, et al.
Publicado: (2025) -
ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search
por: Lee, Hyunseok, et al.
Publicado: (2025)