Multi-Step Reasoning in Korean and the Emergent Mirage
Fuente:
arXiv
Salvato in:
| Autori principali: | Son, Guijin, Ko, Hyunwoo, Choi, Dasol |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
KAIO: A Collection of More Challenging Korean Questions
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
Improving Fine-grained Visual Understanding in VLMs through Text-Only Training
di: Choi, Dasol, et al.
Pubblicazione: (2024)
di: Choi, Dasol, et al.
Pubblicazione: (2024)
Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Redefining Evaluation Standards: A Unified Framework for Evaluating the Korean Capabilities of Language Models
di: Lee, Hanwool, et al.
Pubblicazione: (2025)
di: Lee, Hanwool, et al.
Pubblicazione: (2025)
ResearchMath-14K: Scaling Research-Level Mathematics via Agents
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
Revisiting the UID Hypothesis in LLM Reasoning Traces
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
Revisiting the Uniform Information Density Hypothesis in LLM Reasoning
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
di: Son, Guijin, et al.
Pubblicazione: (2023)
di: Son, Guijin, et al.
Pubblicazione: (2023)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
No Language Data Left Behind: A Comparative Study of CJK Language Datasets in the Hugging Face Ecosystem
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models
di: Choi, Dasol, et al.
Pubblicazione: (2026)
di: Choi, Dasol, et al.
Pubblicazione: (2026)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
KORMo: Korean Open Reasoning Model for Everyone
di: Kim, Minjun, et al.
Pubblicazione: (2025)
di: Kim, Minjun, et al.
Pubblicazione: (2025)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
ESG Classification by Implicit Rule Learning via GPT-4
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
di: Chi, Haoang, et al.
Pubblicazione: (2025)
di: Chi, Haoang, et al.
Pubblicazione: (2025)
The Mirage of Model Editing: Revisiting Evaluation in the Wild
di: Yang, Wanli, et al.
Pubblicazione: (2025)
di: Yang, Wanli, et al.
Pubblicazione: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoning
di: Jain, Kushal, et al.
Pubblicazione: (2023)
di: Jain, Kushal, et al.
Pubblicazione: (2023)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
IndicGEC: Powerful Models, or a Measurement Mirage?
di: Vajjala, Sowmya
Pubblicazione: (2025)
di: Vajjala, Sowmya
Pubblicazione: (2025)
Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
di: Zhao, Chengshuai, et al.
Pubblicazione: (2025)
di: Zhao, Chengshuai, et al.
Pubblicazione: (2025)
From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning
di: Purohit, Kiran, et al.
Pubblicazione: (2026)
di: Purohit, Kiran, et al.
Pubblicazione: (2026)
KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations
di: Kweon, Sunjun, et al.
Pubblicazione: (2024)
di: Kweon, Sunjun, et al.
Pubblicazione: (2024)
Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
di: Ling, Zipeng, et al.
Pubblicazione: (2026)
di: Ling, Zipeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025) -
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
di: Choi, Dasol, et al.
Pubblicazione: (2025) -
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025) -
KAIO: A Collection of More Challenging Korean Questions
di: Lee, Nahyun, et al.
Pubblicazione: (2025) -
Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
di: Son, Guijin, et al.
Pubblicazione: (2025)