An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Mingzhong, Yeo, Teresa, Solar-Lezama, Armando, Zhi-Xuan, Tan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Robustness of Reward Models for Mathematical Reasoning
par: Kim, Sunghwan, et autres
Publié: (2024)
par: Kim, Sunghwan, et autres
Publié: (2024)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
par: Kang, Deokhyung, et autres
Publié: (2025)
par: Kang, Deokhyung, et autres
Publié: (2025)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
par: Oh, Jungwoo, et autres
Publié: (2026)
par: Oh, Jungwoo, et autres
Publié: (2026)
EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths
par: Li, Zhening, et autres
Publié: (2025)
par: Li, Zhening, et autres
Publié: (2025)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
par: Lewis, Martha, et autres
Publié: (2024)
par: Lewis, Martha, et autres
Publié: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
par: Lin, Haowei, et autres
Publié: (2025)
par: Lin, Haowei, et autres
Publié: (2025)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
par: Khalid, Irtaza, et autres
Publié: (2025)
par: Khalid, Irtaza, et autres
Publié: (2025)
Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
par: Ioannou, Antreas, et autres
Publié: (2025)
par: Ioannou, Antreas, et autres
Publié: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Towards Reasoning Ability of Small Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Evaluating Interventional Reasoning Capabilities of Large Language Models
par: Kasetty, Tejas, et autres
Publié: (2024)
par: Kasetty, Tejas, et autres
Publié: (2024)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
par: Guo, Zhenyuan, et autres
Publié: (2026)
par: Guo, Zhenyuan, et autres
Publié: (2026)
Competitive Programming with Large Reasoning Models
par: OpenAI, et autres
Publié: (2025)
par: OpenAI, et autres
Publié: (2025)
Large Language Model Reasoning Failures
par: Song, Peiyang, et autres
Publié: (2026)
par: Song, Peiyang, et autres
Publié: (2026)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
par: Li, Yawei, et autres
Publié: (2026)
par: Li, Yawei, et autres
Publié: (2026)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
par: Li, Xiaoyuan, et autres
Publié: (2024)
par: Li, Xiaoyuan, et autres
Publié: (2024)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
par: Malghan, Arjun R.
Publié: (2025)
par: Malghan, Arjun R.
Publié: (2025)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
Compositional Causal Reasoning Evaluation in Language Models
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
par: Maasch, Jacqueline R. M. A., et autres
Publié: (2025)
Can Large Language Models Reason and Plan?
par: Kambhampati, Subbarao
Publié: (2024)
par: Kambhampati, Subbarao
Publié: (2024)
Rethinking Entropy Regularization in Large Reasoning Models
par: Jiang, Yuxian, et autres
Publié: (2025)
par: Jiang, Yuxian, et autres
Publié: (2025)
Auto-Evolve: Enhancing Large Language Model's Performance via Self-Reasoning Framework
par: Aswani, Krishna, et autres
Publié: (2024)
par: Aswani, Krishna, et autres
Publié: (2024)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning
par: Hwang, Jaedong, et autres
Publié: (2025)
par: Hwang, Jaedong, et autres
Publié: (2025)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
MeMo: Memory as a Model
par: Quek, Ryan Wei Heng, et autres
Publié: (2026)
par: Quek, Ryan Wei Heng, et autres
Publié: (2026)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
par: Düzkar, Kemal
Publié: (2026)
par: Düzkar, Kemal
Publié: (2026)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
Offline Learning and Forgetting for Reasoning with Large Language Models
par: Ni, Tianwei, et autres
Publié: (2025)
par: Ni, Tianwei, et autres
Publié: (2025)
The Role of Deductive and Inductive Reasoning in Large Language Models
par: Cai, Chengkun, et autres
Publié: (2024)
par: Cai, Chengkun, et autres
Publié: (2024)
A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap
par: Khan, Sheraz, et autres
Publié: (2025)
par: Khan, Sheraz, et autres
Publié: (2025)
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
par: Do, Quyet V., et autres
Publié: (2026)
par: Do, Quyet V., et autres
Publié: (2026)
Efficient Reasoning with Hidden Thinking
par: Shen, Xuan, et autres
Publié: (2025)
par: Shen, Xuan, et autres
Publié: (2025)
Self-Training Elicits Concise Reasoning in Large Language Models
par: Munkhbat, Tergel, et autres
Publié: (2025)
par: Munkhbat, Tergel, et autres
Publié: (2025)
Early Stopping for Large Reasoning Models via Confidence Dynamics
par: Hosseini, Parsa, et autres
Publié: (2026)
par: Hosseini, Parsa, et autres
Publié: (2026)
Documents similaires
-
Evaluating Robustness of Reward Models for Mathematical Reasoning
par: Kim, Sunghwan, et autres
Publié: (2024) -
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
par: Kang, Deokhyung, et autres
Publié: (2025) -
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
par: Oh, Jungwoo, et autres
Publié: (2026) -
EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths
par: Li, Zhening, et autres
Publié: (2025) -
Evaluating the Robustness of Analogical Reasoning in Large Language Models
par: Lewis, Martha, et autres
Publié: (2024)