Enregistré dans:
| Auteurs principaux: | Agarwal, Shradha, Rajbhar, Deepak, J, Tariq |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.16675 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?
par: Sun, Henan, et autres
Publié: (2026)
par: Sun, Henan, et autres
Publié: (2026)
Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models
par: Guo, Dadi, et autres
Publié: (2025)
par: Guo, Dadi, et autres
Publié: (2025)
CombiBench: Benchmarking LLM Capability for Combinatorial Mathematics
par: Liu, Junqi, et autres
Publié: (2025)
par: Liu, Junqi, et autres
Publié: (2025)
LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories
par: Kang, Liwei, et autres
Publié: (2026)
par: Kang, Liwei, et autres
Publié: (2026)
AlgOS: Algorithm Operating System
par: Salt, Llewyn, et autres
Publié: (2025)
par: Salt, Llewyn, et autres
Publié: (2025)
Riemann-Bench: A Benchmark for Moonshot Mathematics
par: Garre, Suhaas, et autres
Publié: (2026)
par: Garre, Suhaas, et autres
Publié: (2026)
Revealing Interpretable Failure Modes of VLMs
par: Chaudhary, Isha, et autres
Publié: (2026)
par: Chaudhary, Isha, et autres
Publié: (2026)
ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization
par: Tso, Joseph, et autres
Publié: (2026)
par: Tso, Joseph, et autres
Publié: (2026)
Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking
par: Feuer, Benjamin, et autres
Publié: (2024)
par: Feuer, Benjamin, et autres
Publié: (2024)
Large Language Models and Mathematical Reasoning Failures
par: Boye, Johan, et autres
Publié: (2025)
par: Boye, Johan, et autres
Publié: (2025)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2025)
par: Kim, Eunsu, et autres
Publié: (2025)
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean
par: Long, Wentao, et autres
Publié: (2026)
par: Long, Wentao, et autres
Publié: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
par: Anokhin, Petr, et autres
Publié: (2025)
par: Anokhin, Petr, et autres
Publié: (2025)
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning
par: Wang, Qinsi, et autres
Publié: (2026)
par: Wang, Qinsi, et autres
Publié: (2026)
SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
par: Li, Kuan, et autres
Publié: (2026)
par: Li, Kuan, et autres
Publié: (2026)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
par: Teleki, Maria, et autres
Publié: (2025)
par: Teleki, Maria, et autres
Publié: (2025)
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
par: Markowitz, Elan, et autres
Publié: (2025)
par: Markowitz, Elan, et autres
Publié: (2025)
MorphoBench: A Benchmark with Difficulty Adaptive to Model Reasoning
par: Wang, Xukai, et autres
Publié: (2025)
par: Wang, Xukai, et autres
Publié: (2025)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
par: Zheng, Chujie, et autres
Publié: (2024)
par: Zheng, Chujie, et autres
Publié: (2024)
The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models
par: Kim, Dueun, et autres
Publié: (2026)
par: Kim, Dueun, et autres
Publié: (2026)
IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch
par: Biyani, Param, et autres
Publié: (2025)
par: Biyani, Param, et autres
Publié: (2025)
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
par: Ma, Haoxuan, et autres
Publié: (2026)
par: Ma, Haoxuan, et autres
Publié: (2026)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
par: Moore, Robert J., et autres
Publié: (2026)
par: Moore, Robert J., et autres
Publié: (2026)
RoMath: A Mathematical Reasoning Benchmark in Romanian
par: Cosma, Adrian, et autres
Publié: (2024)
par: Cosma, Adrian, et autres
Publié: (2024)
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
par: Zhao, Junjie, et autres
Publié: (2026)
par: Zhao, Junjie, et autres
Publié: (2026)
Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications
par: Vinay, Vaishali
Publié: (2025)
par: Vinay, Vaishali
Publié: (2025)
CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays
par: Lee, Hyungyung, et autres
Publié: (2025)
par: Lee, Hyungyung, et autres
Publié: (2025)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
par: Glazer, Elliot, et autres
Publié: (2024)
par: Glazer, Elliot, et autres
Publié: (2024)
AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence
par: Lubrano, Kate M., et autres
Publié: (2026)
par: Lubrano, Kate M., et autres
Publié: (2026)
LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues
par: Sehgal, Neil K. R., et autres
Publié: (2026)
par: Sehgal, Neil K. R., et autres
Publié: (2026)
OckBench: Measuring the Efficiency of LLM Reasoning
par: Du, Zheng, et autres
Publié: (2025)
par: Du, Zheng, et autres
Publié: (2025)
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
par: Maniparambil, Mayug, et autres
Publié: (2026)
par: Maniparambil, Mayug, et autres
Publié: (2026)
FractalBench: Diagnosing Visual-Mathematical Reasoning Through Recursive Program Synthesis
par: Ondras, Jan, et autres
Publié: (2025)
par: Ondras, Jan, et autres
Publié: (2025)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
par: Xu, Qiang, et autres
Publié: (2026)
par: Xu, Qiang, et autres
Publié: (2026)
FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning
par: Mao, Mingyang, et autres
Publié: (2026)
par: Mao, Mingyang, et autres
Publié: (2026)
Documents similaires
-
AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?
par: Sun, Henan, et autres
Publié: (2026) -
Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models
par: Guo, Dadi, et autres
Publié: (2025) -
CombiBench: Benchmarking LLM Capability for Combinatorial Mathematics
par: Liu, Junqi, et autres
Publié: (2025) -
LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories
par: Kang, Liwei, et autres
Publié: (2026) -
AlgOS: Algorithm Operating System
par: Salt, Llewyn, et autres
Publié: (2025)