Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Bofei, Song, Feifan, Yang, Zhe, Cai, Zefan, Miao, Yibo, Dong, Qingxiu, Li, Lei, Ma, Chenghao, Chen, Liang, Xu, Runxin, Tang, Zhengyang, Wang, Benyou, Zan, Daoguang, Quan, Shanghaoran, Zhang, Ge, Sha, Lei, Zhang, Yichang, Ren, Xuancheng, Liu, Tianyu, Chang, Baobao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards a Unified View of Preference Learning for Large Language Models: A Survey
by: Gao, Bofei, et al.
Published: (2024)
by: Gao, Bofei, et al.
Published: (2024)
Aligning CodeLLMs with Direct Preference Optimization
by: Miao, Yibo, et al.
Published: (2024)
by: Miao, Yibo, et al.
Published: (2024)
LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback
by: Gao, Bofei, et al.
Published: (2024)
by: Gao, Bofei, et al.
Published: (2024)
DMoERM: Recipes of Mixture-of-Experts for Effective Reward Modeling
by: Quan, Shanghaoran
Published: (2024)
by: Quan, Shanghaoran
Published: (2024)
Automatically Generating Numerous Context-Driven SFT Data for LLMs across Diverse Granularity
by: Quan, Shanghaoran
Published: (2024)
by: Quan, Shanghaoran
Published: (2024)
Language Models can Self-Lengthen to Generate Long Texts
by: Quan, Shanghaoran, et al.
Published: (2024)
by: Quan, Shanghaoran, et al.
Published: (2024)
CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings
by: Quan, Shanghaoran, et al.
Published: (2025)
by: Quan, Shanghaoran, et al.
Published: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
by: Tang, Zhengyang, et al.
Published: (2024)
by: Tang, Zhengyang, et al.
Published: (2024)
Mathematical Opportunities in Digital Twins (MATH-DT)
by: Antil, Harbir
Published: (2024)
by: Antil, Harbir
Published: (2024)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
by: Yu, Zhouliang, et al.
Published: (2025)
by: Yu, Zhouliang, et al.
Published: (2025)
Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset
by: Wang, Ke, et al.
Published: (2024)
by: Wang, Ke, et al.
Published: (2024)
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
by: Zhang, Bo-Wen, et al.
Published: (2024)
by: Zhang, Bo-Wen, et al.
Published: (2024)
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning
by: Zhang, Di, et al.
Published: (2024)
by: Zhang, Di, et al.
Published: (2024)
CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
by: Zan, Lei, et al.
Published: (2025)
by: Zan, Lei, et al.
Published: (2025)
The MATH--Open Source Application for Easier Learning of Numerical Mathematics
by: Glaser-Opitz, Henrich, et al.
Published: (2016)
by: Glaser-Opitz, Henrich, et al.
Published: (2016)
Qwen2.5-Coder Technical Report
by: Hui, Binyuan, et al.
Published: (2024)
by: Hui, Binyuan, et al.
Published: (2024)
EEFSUVA: A New Mathematical Olympiad Benchmark
by: Khatibi, Nicole N, et al.
Published: (2025)
by: Khatibi, Nicole N, et al.
Published: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
by: Gao, Songyang, et al.
Published: (2025)
by: Gao, Songyang, et al.
Published: (2025)
Report on the 61st Annual International Mathematical Olympiad
by: Bajnok, Bela, et al.
Published: (2024)
by: Bajnok, Bela, et al.
Published: (2024)
Report on the 63rd Annual International Mathematical Olympiad
by: Bajnok, Béla
Published: (2025)
by: Bajnok, Béla
Published: (2025)
Math Matters of the Past (The Very First Mathematical Olympiads)
by: Fomin, Dmitri
Published: (2025)
by: Fomin, Dmitri
Published: (2025)
Report on the 50th Annual USA Mathematical Olympiad
by: Bajnok, Bela
Published: (2024)
by: Bajnok, Bela
Published: (2024)
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
by: Saha, Soumadeep, et al.
Published: (2025)
by: Saha, Soumadeep, et al.
Published: (2025)
U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
by: Chernyshev, Konstantin, et al.
Published: (2024)
by: Chernyshev, Konstantin, et al.
Published: (2024)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
by: He, Chaoqun, et al.
Published: (2024)
by: He, Chaoqun, et al.
Published: (2024)
Brains vs. Bytes: Evaluating LLM Proficiency in Olympiad Mathematics
by: Mahdavi, Hamed, et al.
Published: (2025)
by: Mahdavi, Hamed, et al.
Published: (2025)
Report on the 12th Annual USA Junior Mathematical Olympiad
by: Bajnok, Bela, et al.
Published: (2024)
by: Bajnok, Bela, et al.
Published: (2024)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
by: Cherian, Anoop, et al.
Published: (2024)
by: Cherian, Anoop, et al.
Published: (2024)
SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance
by: Singh, Kunal, et al.
Published: (2025)
by: Singh, Kunal, et al.
Published: (2025)
Can Language Models Solve Olympiad Programming?
by: Shi, Quan, et al.
Published: (2024)
by: Shi, Quan, et al.
Published: (2024)
A GAN-based data poisoning framework against anomaly detection in vertical federated learning
by: Chen, Xiaolin, et al.
Published: (2024)
by: Chen, Xiaolin, et al.
Published: (2024)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
by: Sun, Kai, et al.
Published: (2024)
by: Sun, Kai, et al.
Published: (2024)
Report on the 49th Annual United States of America Mathematical Olympiad
by: Bajnok, Bela
Published: (2024)
by: Bajnok, Bela
Published: (2024)
A Survey on In-context Learning
by: Dong, Qingxiu, et al.
Published: (2022)
by: Dong, Qingxiu, et al.
Published: (2022)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
by: Chen, Zhuofan, et al.
Published: (2025)
by: Chen, Zhuofan, et al.
Published: (2025)
HOW TO OVERCOME MATH ANXIETY?
by: FLORES, LEROY A.
Published: (2025)
by: FLORES, LEROY A.
Published: (2025)
How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
by: Yao, Jian, et al.
Published: (2025)
by: Yao, Jian, et al.
Published: (2025)
Multi-Agent Collaboration for Multilingual Code Instruction Tuning
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
by: Chen, Liang, et al.
Published: (2024)
by: Chen, Liang, et al.
Published: (2024)
Similar Items
-
Towards a Unified View of Preference Learning for Large Language Models: A Survey
by: Gao, Bofei, et al.
Published: (2024) -
Aligning CodeLLMs with Direct Preference Optimization
by: Miao, Yibo, et al.
Published: (2024) -
LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback
by: Gao, Bofei, et al.
Published: (2024) -
DMoERM: Recipes of Mixture-of-Experts for Effective Reward Modeling
by: Quan, Shanghaoran
Published: (2024) -
Automatically Generating Numerous Context-Driven SFT Data for LLMs across Diverse Granularity
by: Quan, Shanghaoran
Published: (2024)