Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Jo, Hwiyeol, Lee, Joosung, Lee, Jaehone, Lee, Sang-Woo, Park, Joonsuk, Yoo, Kang Min |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Hallucination Detection via Future Context
by: Lee, Joosung, et al.
Published: (2025)
by: Lee, Joosung, et al.
Published: (2025)
ZeroDL: Zero-shot Distribution Learning for Text Clustering via Large Language Models
by: Jo, Hwiyeol, et al.
Published: (2024)
by: Jo, Hwiyeol, et al.
Published: (2024)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
by: Park, Cheonbok, et al.
Published: (2025)
by: Park, Cheonbok, et al.
Published: (2025)
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
by: Lee, Joosung, et al.
Published: (2026)
by: Lee, Joosung, et al.
Published: (2026)
Enhanced Facet Generation with LLM Editing
by: Lee, Joosung, et al.
Published: (2024)
by: Lee, Joosung, et al.
Published: (2024)
Does "Reasoning" with Large Language Models Improve Recognizing, Generating, and Reframing Unhelpful Thoughts?
by: Qi, Yilin, et al.
Published: (2025)
by: Qi, Yilin, et al.
Published: (2025)
Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speech
by: Woo, Sang Hoon, et al.
Published: (2025)
by: Woo, Sang Hoon, et al.
Published: (2025)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
by: Kim, Wonjoong, et al.
Published: (2025)
by: Kim, Wonjoong, et al.
Published: (2025)
FeRG-LLM : Feature Engineering by Reason Generation Large Language Models
by: Ko, Jeonghyun, et al.
Published: (2025)
by: Ko, Jeonghyun, et al.
Published: (2025)
Mentor-KD: Making Small Language Models Better Multi-step Reasoners
by: Lee, Hojae, et al.
Published: (2024)
by: Lee, Hojae, et al.
Published: (2024)
Integrated Framework for LLM Evaluation with Answer Generation
by: Lee, Sujeong, et al.
Published: (2025)
by: Lee, Sujeong, et al.
Published: (2025)
OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models
by: Kim, Seunghee, et al.
Published: (2026)
by: Kim, Seunghee, et al.
Published: (2026)
Return of EM: Entity-driven Answer Set Expansion for QA Evaluation
by: Lee, Dongryeol, et al.
Published: (2024)
by: Lee, Dongryeol, et al.
Published: (2024)
Modeling Layered Consciousness with Multi-Agent Large Language Models
by: Kim, Sang Hun, et al.
Published: (2025)
by: Kim, Sang Hun, et al.
Published: (2025)
Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought
by: Lee, Jooyoung, et al.
Published: (2024)
by: Lee, Jooyoung, et al.
Published: (2024)
Aligning Large Language Models by On-Policy Self-Judgment
by: Lee, Sangkyu, et al.
Published: (2024)
by: Lee, Sangkyu, et al.
Published: (2024)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
by: Khalifa, Muhammad, et al.
Published: (2023)
by: Khalifa, Muhammad, et al.
Published: (2023)
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
by: Lee, Sangjun, et al.
Published: (2025)
by: Lee, Sangjun, et al.
Published: (2025)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs
by: Kim, Jaehyung, et al.
Published: (2024)
by: Kim, Jaehyung, et al.
Published: (2024)
Applying Large Language Models and Chain-of-Thought for Automatic Scoring
by: Lee, Gyeong-Geon, et al.
Published: (2023)
by: Lee, Gyeong-Geon, et al.
Published: (2023)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
by: Lee, Donggyu, et al.
Published: (2025)
by: Lee, Donggyu, et al.
Published: (2025)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
by: Kim, June-Woo, et al.
Published: (2025)
by: Kim, June-Woo, et al.
Published: (2025)
EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
by: Bae, Kyunghoon, et al.
Published: (2025)
by: Bae, Kyunghoon, et al.
Published: (2025)
Hierarchical Deconstruction of LLM Reasoning: A Graph-Based Framework for Analyzing Knowledge Utilization
by: Ko, Miyoung, et al.
Published: (2024)
by: Ko, Miyoung, et al.
Published: (2024)
Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models
by: Lee, Jung Hyun, et al.
Published: (2024)
by: Lee, Jung Hyun, et al.
Published: (2024)
LLM+AL: Bridging Large Language Models and Action Languages for Complex Reasoning about Actions
by: Ishay, Adam, et al.
Published: (2025)
by: Ishay, Adam, et al.
Published: (2025)
Lost in the Noise: How Reasoning Models Fail with Contextual Distractors
by: Lee, Seongyun, et al.
Published: (2026)
by: Lee, Seongyun, et al.
Published: (2026)
Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts
by: Lee, Sang-Woo, et al.
Published: (2025)
by: Lee, Sang-Woo, et al.
Published: (2025)
Fast and Accurate Contextual Knowledge Extraction Using Cascading Language Model Chains and Candidate Answers
by: Harris, Lee
Published: (2025)
by: Harris, Lee
Published: (2025)
Peri-LN: Revisiting Normalization Layer in the Transformer Architecture
by: Kim, Jeonghoon, et al.
Published: (2025)
by: Kim, Jeonghoon, et al.
Published: (2025)
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
by: Choi, ChangSu, et al.
Published: (2024)
by: Choi, ChangSu, et al.
Published: (2024)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
by: Jung, Dahyun, et al.
Published: (2025)
by: Jung, Dahyun, et al.
Published: (2025)
Prompt-based Depth Pruning of Large Language Models
by: Wee, Juyun, et al.
Published: (2025)
by: Wee, Juyun, et al.
Published: (2025)
Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
by: Oh, Jungsuk, et al.
Published: (2025)
by: Oh, Jungsuk, et al.
Published: (2025)
Zero-shot Commonsense Reasoning over Machine Imagination
by: Park, Hyuntae, et al.
Published: (2024)
by: Park, Hyuntae, et al.
Published: (2024)
Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales
by: Kwon, Taeyoon, et al.
Published: (2023)
by: Kwon, Taeyoon, et al.
Published: (2023)
EXAONE Deep: Reasoning Enhanced Language Models
by: Bae, Kyunghoon, et al.
Published: (2025)
by: Bae, Kyunghoon, et al.
Published: (2025)
Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models
by: Kim, Jiyeon, et al.
Published: (2026)
by: Kim, Jiyeon, et al.
Published: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
by: Xu, Ancheng, et al.
Published: (2024)
by: Xu, Ancheng, et al.
Published: (2024)
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
by: Xu, Rongwu, et al.
Published: (2024)
by: Xu, Rongwu, et al.
Published: (2024)
Similar Items
-
Enhancing Hallucination Detection via Future Context
by: Lee, Joosung, et al.
Published: (2025) -
ZeroDL: Zero-shot Distribution Learning for Text Clustering via Large Language Models
by: Jo, Hwiyeol, et al.
Published: (2024) -
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
by: Park, Cheonbok, et al.
Published: (2025) -
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
by: Lee, Joosung, et al.
Published: (2026) -
Enhanced Facet Generation with LLM Editing
by: Lee, Joosung, et al.
Published: (2024)