Evaluating Step-by-step Reasoning Traces: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Jinu, Hockenmaier, Julia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReasoningFlow: Semantic Structure of Complex Reasoning Traces
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
par: Kim, Seungone, et autres
Publié: (2025)
par: Kim, Seungone, et autres
Publié: (2025)
Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures
par: Sidhu, Risham, et autres
Publié: (2026)
par: Sidhu, Risham, et autres
Publié: (2026)
Entailment-Preserving First-order Logic Representations in Natural Language Entailment
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
par: Haldar, Rajarshi, et autres
Publié: (2025)
par: Haldar, Rajarshi, et autres
Publié: (2025)
SymBa: Symbolic Backward Chaining for Structured Natural Language Reasoning
par: Lee, Jinu, et autres
Publié: (2024)
par: Lee, Jinu, et autres
Publié: (2024)
Analyzing the Performance of Large Language Models on Code Summarization
par: Haldar, Rajarshi, et autres
Publié: (2024)
par: Haldar, Rajarshi, et autres
Publié: (2024)
A Multi-Perspective Architecture for Semantic Code Search
par: Haldar, Rajarshi, et autres
Publié: (2020)
par: Haldar, Rajarshi, et autres
Publié: (2020)
Do LLMs Really Think Step-by-step In Implicit Reasoning?
par: Yu, Yijiong
Publié: (2024)
par: Yu, Yijiong
Publié: (2024)
Evaluating Step-by-Step Reasoning through Symbolic Verification
par: Zhang, Yi-Fan, et autres
Publié: (2022)
par: Zhang, Yi-Fan, et autres
Publié: (2022)
How Reliable are Causal Probing Interventions?
par: Canby, Marc, et autres
Publié: (2024)
par: Canby, Marc, et autres
Publié: (2024)
RAISE: Enhancing Scientific Reasoning in LLMs via Step-by-Step Retrieval
par: Oh, Minhae, et autres
Publié: (2025)
par: Oh, Minhae, et autres
Publié: (2025)
Large Language Model for Discrete Optimization Problems: Evaluation and Step-by-step Reasoning
par: Qian, Tianhao, et autres
Publié: (2026)
par: Qian, Tianhao, et autres
Publié: (2026)
ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning
par: Qiao, Ziqing, et autres
Publié: (2025)
par: Qiao, Ziqing, et autres
Publié: (2025)
LegalSearchLM: Rethinking Legal Case Retrieval as Legal Elements Generation
par: Kim, Chaeeun, et autres
Publié: (2025)
par: Kim, Chaeeun, et autres
Publié: (2025)
Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring
par: Belkhiter, Yannis, et autres
Publié: (2025)
par: Belkhiter, Yannis, et autres
Publié: (2025)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
par: Hao, Shibo, et autres
Publié: (2024)
par: Hao, Shibo, et autres
Publié: (2024)
MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics
par: Chen, Xinghe, et autres
Publié: (2026)
par: Chen, Xinghe, et autres
Publié: (2026)
A Survey on Feedback-based Multi-step Reasoning for Large Language Models on Mathematics
par: Wei, Ting-Ruen, et autres
Publié: (2025)
par: Wei, Ting-Ruen, et autres
Publié: (2025)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning
par: Huang, Jerry, et autres
Publié: (2025)
par: Huang, Jerry, et autres
Publié: (2025)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
par: Lee, Daniel, et autres
Publié: (2026)
par: Lee, Daniel, et autres
Publié: (2026)
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
par: Kim, Jaehoon, et autres
Publié: (2025)
par: Kim, Jaehoon, et autres
Publié: (2025)
Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation
par: Islam, Khondoker Ittehadul, et autres
Publié: (2025)
par: Islam, Khondoker Ittehadul, et autres
Publié: (2025)
A Survey of Explainable Knowledge Tracing
par: Bai, Yanhong, et autres
Publié: (2024)
par: Bai, Yanhong, et autres
Publié: (2024)
Mentor-KD: Making Small Language Models Better Multi-step Reasoners
par: Lee, Hojae, et autres
Publié: (2024)
par: Lee, Hojae, et autres
Publié: (2024)
Evaluating LLMs' Reasoning Over Ordered Procedural Steps
par: Anika, Adrita, et autres
Publié: (2025)
par: Anika, Adrita, et autres
Publié: (2025)
Investigating the Shortcomings of LLMs in Step-by-Step Legal Reasoning
par: Mishra, Venkatesh, et autres
Publié: (2025)
par: Mishra, Venkatesh, et autres
Publié: (2025)
RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code
par: Gautam, Dhruv, et autres
Publié: (2025)
par: Gautam, Dhruv, et autres
Publié: (2025)
Multi-Step Reasoning with Large Language Models, a Survey
par: Plaat, Aske, et autres
Publié: (2024)
par: Plaat, Aske, et autres
Publié: (2024)
Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym
par: Kaesberg, Lars Benedikt, et autres
Publié: (2026)
par: Kaesberg, Lars Benedikt, et autres
Publié: (2026)
Is Sarcasm Detection A Step-by-Step Reasoning Process in Large Language Models?
par: Yao, Ben, et autres
Publié: (2024)
par: Yao, Ben, et autres
Publié: (2024)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
par: Pan, Liangming, et autres
Publié: (2026)
par: Pan, Liangming, et autres
Publié: (2026)
What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
par: Do, Heejin, et autres
Publié: (2025)
par: Do, Heejin, et autres
Publié: (2025)
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
par: Pathak, Manas, et autres
Publié: (2026)
par: Pathak, Manas, et autres
Publié: (2026)
Instruct Large Language Models to Generate Scientific Literature Survey Step by Step
par: Lai, Yuxuan, et autres
Publié: (2024)
par: Lai, Yuxuan, et autres
Publié: (2024)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
par: Cao, Lang, et autres
Publié: (2024)
par: Cao, Lang, et autres
Publié: (2024)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
par: Lee, Kyumin, et autres
Publié: (2025)
par: Lee, Kyumin, et autres
Publié: (2025)
Documents similaires
-
ReasoningFlow: Semantic Structure of Complex Reasoning Traces
par: Lee, Jinu, et autres
Publié: (2025) -
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025) -
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
par: Kim, Seungone, et autres
Publié: (2025) -
Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures
par: Sidhu, Risham, et autres
Publié: (2026) -
Entailment-Preserving First-order Logic Representations in Natural Language Entailment
par: Lee, Jinu, et autres
Publié: (2025)