An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Mingzhong, Yeo, Teresa, Solar-Lezama, Armando, Zhi-Xuan, Tan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating Robustness of Reward Models for Mathematical Reasoning
por: Kim, Sunghwan, et al.
Publicado: (2024)
por: Kim, Sunghwan, et al.
Publicado: (2024)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
por: Kang, Deokhyung, et al.
Publicado: (2025)
por: Kang, Deokhyung, et al.
Publicado: (2025)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
por: Oh, Jungwoo, et al.
Publicado: (2026)
por: Oh, Jungwoo, et al.
Publicado: (2026)
EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths
por: Li, Zhening, et al.
Publicado: (2025)
por: Li, Zhening, et al.
Publicado: (2025)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
por: Lewis, Martha, et al.
Publicado: (2024)
por: Lewis, Martha, et al.
Publicado: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
por: Lin, Haowei, et al.
Publicado: (2025)
por: Lin, Haowei, et al.
Publicado: (2025)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
por: Khalid, Irtaza, et al.
Publicado: (2025)
por: Khalid, Irtaza, et al.
Publicado: (2025)
Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
por: Ioannou, Antreas, et al.
Publicado: (2025)
por: Ioannou, Antreas, et al.
Publicado: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
Towards Reasoning Ability of Small Language Models
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
por: Zhu, Kaijie, et al.
Publicado: (2023)
por: Zhu, Kaijie, et al.
Publicado: (2023)
Evaluating Interventional Reasoning Capabilities of Large Language Models
por: Kasetty, Tejas, et al.
Publicado: (2024)
por: Kasetty, Tejas, et al.
Publicado: (2024)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
por: Guo, Zhenyuan, et al.
Publicado: (2026)
por: Guo, Zhenyuan, et al.
Publicado: (2026)
Competitive Programming with Large Reasoning Models
por: OpenAI, et al.
Publicado: (2025)
por: OpenAI, et al.
Publicado: (2025)
Large Language Model Reasoning Failures
por: Song, Peiyang, et al.
Publicado: (2026)
por: Song, Peiyang, et al.
Publicado: (2026)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
por: Li, Yawei, et al.
Publicado: (2026)
por: Li, Yawei, et al.
Publicado: (2026)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
por: Li, Xiaoyuan, et al.
Publicado: (2024)
por: Li, Xiaoyuan, et al.
Publicado: (2024)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
por: Gu, Xiaojie, et al.
Publicado: (2026)
por: Gu, Xiaojie, et al.
Publicado: (2026)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
por: Malghan, Arjun R.
Publicado: (2025)
por: Malghan, Arjun R.
Publicado: (2025)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
por: Huang, Jiameng, et al.
Publicado: (2025)
por: Huang, Jiameng, et al.
Publicado: (2025)
Compositional Causal Reasoning Evaluation in Language Models
por: Maasch, Jacqueline R. M. A., et al.
Publicado: (2025)
por: Maasch, Jacqueline R. M. A., et al.
Publicado: (2025)
Can Large Language Models Reason and Plan?
por: Kambhampati, Subbarao
Publicado: (2024)
por: Kambhampati, Subbarao
Publicado: (2024)
Rethinking Entropy Regularization in Large Reasoning Models
por: Jiang, Yuxian, et al.
Publicado: (2025)
por: Jiang, Yuxian, et al.
Publicado: (2025)
Auto-Evolve: Enhancing Large Language Model's Performance via Self-Reasoning Framework
por: Aswani, Krishna, et al.
Publicado: (2024)
por: Aswani, Krishna, et al.
Publicado: (2024)
A Survey of Reinforcement Learning for Large Reasoning Models
por: Zhang, Kaiyan, et al.
Publicado: (2025)
por: Zhang, Kaiyan, et al.
Publicado: (2025)
Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning
por: Hwang, Jaedong, et al.
Publicado: (2025)
por: Hwang, Jaedong, et al.
Publicado: (2025)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
MeMo: Memory as a Model
por: Quek, Ryan Wei Heng, et al.
Publicado: (2026)
por: Quek, Ryan Wei Heng, et al.
Publicado: (2026)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
por: Chung, Tsz Ting, et al.
Publicado: (2025)
por: Chung, Tsz Ting, et al.
Publicado: (2025)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
por: Düzkar, Kemal
Publicado: (2026)
por: Düzkar, Kemal
Publicado: (2026)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
por: Jin, Renren, et al.
Publicado: (2025)
por: Jin, Renren, et al.
Publicado: (2025)
Offline Learning and Forgetting for Reasoning with Large Language Models
por: Ni, Tianwei, et al.
Publicado: (2025)
por: Ni, Tianwei, et al.
Publicado: (2025)
The Role of Deductive and Inductive Reasoning in Large Language Models
por: Cai, Chengkun, et al.
Publicado: (2024)
por: Cai, Chengkun, et al.
Publicado: (2024)
A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap
por: Khan, Sheraz, et al.
Publicado: (2025)
por: Khan, Sheraz, et al.
Publicado: (2025)
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
por: Do, Quyet V., et al.
Publicado: (2026)
por: Do, Quyet V., et al.
Publicado: (2026)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Self-Training Elicits Concise Reasoning in Large Language Models
por: Munkhbat, Tergel, et al.
Publicado: (2025)
por: Munkhbat, Tergel, et al.
Publicado: (2025)
Early Stopping for Large Reasoning Models via Confidence Dynamics
por: Hosseini, Parsa, et al.
Publicado: (2026)
por: Hosseini, Parsa, et al.
Publicado: (2026)
Ejemplares similares
-
Evaluating Robustness of Reward Models for Mathematical Reasoning
por: Kim, Sunghwan, et al.
Publicado: (2024) -
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
por: Kang, Deokhyung, et al.
Publicado: (2025) -
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
por: Oh, Jungwoo, et al.
Publicado: (2026) -
EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths
por: Li, Zhening, et al.
Publicado: (2025) -
Evaluating the Robustness of Analogical Reasoning in Large Language Models
por: Lewis, Martha, et al.
Publicado: (2024)