MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Lei, Dong, Shan, Xu, Yuhui, Dong, Hanze, Wang, Yalu, Saha, Amrita, Lim, Ee-Peng, Xiong, Caiming, Sahoo, Doyen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024)
par: Zhao, Zirui, et autres
Publié: (2024)
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
ThinK: Thinner Key Cache by Query-Driven Pruning
par: Xu, Yuhui, et autres
Publié: (2024)
par: Xu, Yuhui, et autres
Publié: (2024)
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Reward Models Identify Consistency, Not Causality
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
XForecast: Evaluating Natural Language Explanations for Time Series Forecasting
par: Aksu, Taha, et autres
Publié: (2024)
par: Aksu, Taha, et autres
Publié: (2024)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
par: Xu, Yiheng, et autres
Publié: (2024)
par: Xu, Yiheng, et autres
Publié: (2024)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025)
par: Yang, Liangwei, et autres
Publié: (2025)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
The Whole is Better than the Sum: Using Aggregated Demonstrations in In-Context Learning for Sequential Recommendation
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
On Reasoning Behind Next Occupation Recommendation
par: Dong, Shan, et autres
Publié: (2026)
par: Dong, Shan, et autres
Publié: (2026)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules
par: Le, Hung, et autres
Publié: (2023)
par: Le, Hung, et autres
Publié: (2023)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions
par: Liang, Zhenwen, et autres
Publié: (2024)
par: Liang, Zhenwen, et autres
Publié: (2024)
GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation
par: Aksu, Taha, et autres
Publié: (2024)
par: Aksu, Taha, et autres
Publié: (2024)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
par: Li, Can, et autres
Publié: (2025)
par: Li, Can, et autres
Publié: (2025)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025)
par: Xue, Boyang, et autres
Publié: (2025)
Unified Training of Universal Time Series Forecasting Transformers
par: Woo, Gerald, et autres
Publié: (2024)
par: Woo, Gerald, et autres
Publié: (2024)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
par: Li, Jierui, et autres
Publié: (2024)
par: Li, Jierui, et autres
Publié: (2024)
UniTST: Effectively Modeling Inter-Series and Intra-Series Dependencies for Multivariate Time Series Forecasting
par: Liu, Juncheng, et autres
Publié: (2024)
par: Liu, Juncheng, et autres
Publié: (2024)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
par: Hong, Zijin, et autres
Publié: (2025)
par: Hong, Zijin, et autres
Publié: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
RoMath: A Mathematical Reasoning Benchmark in Romanian
par: Cosma, Adrian, et autres
Publié: (2024)
par: Cosma, Adrian, et autres
Publié: (2024)
PerfCodeGen: Improving Performance of LLM Generated Code with Execution Feedback
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
par: Li, Chengpeng, et autres
Publié: (2024)
par: Li, Chengpeng, et autres
Publié: (2024)
Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision
par: Du, Wei, et autres
Publié: (2025)
par: Du, Wei, et autres
Publié: (2025)
Summary of a Haystack: A Challenge to Long-Context LLMs and RAG Systems
par: Laban, Philippe, et autres
Publié: (2024)
par: Laban, Philippe, et autres
Publié: (2024)
We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
par: Qiao, Runqi, et autres
Publié: (2025)
par: Qiao, Runqi, et autres
Publié: (2025)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
par: Dekoninck, Jasper, et autres
Publié: (2026)
par: Dekoninck, Jasper, et autres
Publié: (2026)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs
par: Zhang, Yuanhe, et autres
Publié: (2025)
par: Zhang, Yuanhe, et autres
Publié: (2025)
Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions
par: Zhang, David Junhao, et autres
Publié: (2024)
par: Zhang, David Junhao, et autres
Publié: (2024)
Documents similaires
-
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024) -
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025) -
ThinK: Thinner Key Cache by Query-Driven Pruning
par: Xu, Yuhui, et autres
Publié: (2024) -
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025) -
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)