Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pyeon, Goun, Heo, Inbum, Jung, Jeesu, Hwang, Taewook, Namgoong, Hyuk, Seo, Hyein, Han, Yerim, Kim, Eunbin, Kang, Hyeonseok, Jung, Sangkeun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis
par: Heo, Inbum, et autres
Publié: (2026)
par: Heo, Inbum, et autres
Publié: (2026)
LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis
par: Heo, Inbum, et autres
Publié: (2025)
par: Heo, Inbum, et autres
Publié: (2025)
What Drives Paper Acceptance? A Process-Centric Analysis of Modern Peer Review
par: Jung, Sangkeun, et autres
Publié: (2025)
par: Jung, Sangkeun, et autres
Publié: (2025)
Exploring Domain Robust Lightweight Reward Models based on Router Mechanism
par: Namgoong, Hyuk, et autres
Publié: (2024)
par: Namgoong, Hyuk, et autres
Publié: (2024)
Employing Layerwised Unsupervised Learning to Lessen Data and Loss Requirements in Forward-Forward Algorithms
par: Hwang, Taewook, et autres
Publié: (2024)
par: Hwang, Taewook, et autres
Publié: (2024)
Guidance-Based Prompt Data Augmentation in Specialized Domains for Named Entity Recognition
par: Kang, Hyeonseok, et autres
Publié: (2024)
par: Kang, Hyeonseok, et autres
Publié: (2024)
Reasoning Steps as Curriculum: Using Depth of Thought as a Difficulty Signal for Tuning LLMs
par: Jung, Jeesu, et autres
Publié: (2025)
par: Jung, Jeesu, et autres
Publié: (2025)
ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction
par: Jung, Jeesu, et autres
Publié: (2025)
par: Jung, Jeesu, et autres
Publié: (2025)
FEAT: A Preference Feedback Dataset through a Cost-Effective Auto-Generation and Labeling Framework for English AI Tutoring
par: Seo, Hyein, et autres
Publié: (2025)
par: Seo, Hyein, et autres
Publié: (2025)
A Pilot Study on the Short‐Term Effects of an Electric Knee–Ankle–Foot Orthosis on Gait Performance and Physiological Cost Index in Patients With Hemiplegia: Influence of Initial Balance Ability Assessed by the Berg Balance Scale
par: Hyuk-Jae Choi, et autres
Publié: (2026)
par: Hyuk-Jae Choi, et autres
Publié: (2026)
Does Incomplete Syntax Influence Korean Language Model? Focusing on Word Order and Case Markers
par: Kim, Jong Myoung, et autres
Publié: (2024)
par: Kim, Jong Myoung, et autres
Publié: (2024)
Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory
par: Goo, Sungwoo, et autres
Publié: (2026)
par: Goo, Sungwoo, et autres
Publié: (2026)
SC-Lane: Slope-aware and Consistent Road Height Estimation Framework for 3D Lane Detection
par: Park, Chaesong, et autres
Publié: (2025)
par: Park, Chaesong, et autres
Publié: (2025)
On the robustness of ChatGPT in teaching Korean Mathematics
par: Nguyen, Phuong-Nam, et autres
Publié: (2025)
par: Nguyen, Phuong-Nam, et autres
Publié: (2025)
Won: Establishing Best Practices for Korean Financial NLP
par: Son, Guijin, et autres
Publié: (2025)
par: Son, Guijin, et autres
Publié: (2025)
Unraveling the Complexities of Hepatitis B Virus Control: A Mathematical Modeling Approach
par: Malik Muhammad Ibrahim, et autres
Publié: (2025)
par: Malik Muhammad Ibrahim, et autres
Publié: (2025)
MathSpeech: Leveraging Small LMs for Accurate Conversion in Mathematical Speech-to-Formula
par: Hyeon, Sieun, et autres
Publié: (2024)
par: Hyeon, Sieun, et autres
Publié: (2024)
Pattern of Metastasis as a Risk Factor for Brain Metastasis in Patients With Breast Cancer: A Time‐Dependent Cox Regression
par: Eunbin Park, et autres
Publié: (2026)
par: Eunbin Park, et autres
Publié: (2026)
Technology Innovations and the Development of Distance Education: Korean Experience.
par: Jung, Insung
Publié: (2000)
par: Jung, Insung
Publié: (2000)
HeightLane: BEV Heightmap guided 3D Lane Detection
par: Park, Chaesong, et autres
Publié: (2024)
par: Park, Chaesong, et autres
Publié: (2024)
Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models
par: Lee, Jung Hyun, et autres
Publié: (2024)
par: Lee, Jung Hyun, et autres
Publié: (2024)
Towards Robust Mathematical Reasoning
par: Luong, Thang, et autres
Publié: (2025)
par: Luong, Thang, et autres
Publié: (2025)
AlephZero and Mathematical Experience
par: DeDeo, Simon
Publié: (2023)
par: DeDeo, Simon
Publié: (2023)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
par: Hwang, Hyeonbin, et autres
Publié: (2024)
par: Hwang, Hyeonbin, et autres
Publié: (2024)
Health Benefits of Family Visits for Older Korean Women Living Alone
par: Soo‐Ji Hwang, et autres
Publié: (2026)
par: Soo‐Ji Hwang, et autres
Publié: (2026)
Review of the genus Elasmostethus (Hemiptera: Heteroptera: Acanthosomatidae) from the Korean Peninsula
par: Jung, Sunghoon
Publié: (2017)
par: Jung, Sunghoon
Publié: (2017)
LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model
par: Jang, Youngjoon, et autres
Publié: (2026)
par: Jang, Youngjoon, et autres
Publié: (2026)
MathReader : Text-to-Speech for Mathematical Documents
par: Hyeon, Sieun, et autres
Publié: (2025)
par: Hyeon, Sieun, et autres
Publié: (2025)
Pride, Not Prejudice
par: Chung, Eunbin
Publié: (2022)
par: Chung, Eunbin
Publié: (2022)
Pride, Not Prejudice
par: Chung, Eunbin
Publié: (2022)
par: Chung, Eunbin
Publié: (2022)
Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems
par: Golladay, Samuel, et autres
Publié: (2025)
par: Golladay, Samuel, et autres
Publié: (2025)
Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
par: Kuang, Jiayi, et autres
Publié: (2025)
par: Kuang, Jiayi, et autres
Publié: (2025)
AI-assisted Automated Short Answer Grading of Handwritten University Level Mathematics Exams
par: Liu, Tianyi, et autres
Publié: (2024)
par: Liu, Tianyi, et autres
Publié: (2024)
CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam
par: Khrulev, Ruslan
Publié: (2025)
par: Khrulev, Ruslan
Publié: (2025)
V-Math: An Agentic Approach to the Vietnamese National High School Graduation Mathematics Exams
par: Nguyen, Duong Q., et autres
Publié: (2025)
par: Nguyen, Duong Q., et autres
Publié: (2025)
MathDoc: Benchmarking Structured Extraction and Active Refusal on Noisy Mathematics Exam Papers
par: Zhou, Chenyue, et autres
Publié: (2026)
par: Zhou, Chenyue, et autres
Publié: (2026)
PAD: Towards Efficient Data Generation for Transfer Learning Using Phrase Alignment
par: Kim, Jong Myoung, et autres
Publié: (2025)
par: Kim, Jong Myoung, et autres
Publié: (2025)
LANGALIGN: Enhancing Non-English Language Models via Cross-Lingual Embedding Alignment
par: Kim, Jong Myoung, et autres
Publié: (2025)
par: Kim, Jong Myoung, et autres
Publié: (2025)
MathBridge: A Large Corpus Dataset for Translating Spoken Mathematical Expressions into $LaTeX$ Formulas for Improved Readability
par: Jung, Kyudan, et autres
Publié: (2024)
par: Jung, Kyudan, et autres
Publié: (2024)
Korean Christian Missionaries in High‐Risk Countries: Interaction with International Religious Networks and Domestic Response
par: Jihye Jung
Publié: (2024)
par: Jihye Jung
Publié: (2024)
Documents similaires
-
LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis
par: Heo, Inbum, et autres
Publié: (2026) -
LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis
par: Heo, Inbum, et autres
Publié: (2025) -
What Drives Paper Acceptance? A Process-Centric Analysis of Modern Peer Review
par: Jung, Sangkeun, et autres
Publié: (2025) -
Exploring Domain Robust Lightweight Reward Models based on Router Mechanism
par: Namgoong, Hyuk, et autres
Publié: (2024) -
Employing Layerwised Unsupervised Learning to Lessen Data and Loss Requirements in Forward-Forward Algorithms
par: Hwang, Taewook, et autres
Publié: (2024)