Orca-Math: Unlocking the potential of SLMs in Grade School Math
Fuente:
arXiv
Guardado en:
| Autores principales: | Mitra, Arindam, Khanpour, Hamed, Rosset, Corby, Awadallah, Ahmed |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
AgentInstruct: Toward Generative Teaching with Agentic Flows
por: Mitra, Arindam, et al.
Publicado: (2024)
por: Mitra, Arindam, et al.
Publicado: (2024)
EasyMath: A 0-shot Math Benchmark for SLMs
por: Karki, Drishya, et al.
Publicado: (2025)
por: Karki, Drishya, et al.
Publicado: (2025)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
por: Xie, Tengyang, et al.
Publicado: (2024)
por: Xie, Tengyang, et al.
Publicado: (2024)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
por: Xu, Liang, et al.
Publicado: (2024)
por: Xu, Liang, et al.
Publicado: (2024)
Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents
por: Pahuja, Vardaan, et al.
Publicado: (2025)
por: Pahuja, Vardaan, et al.
Publicado: (2025)
Researchy Questions: A Dataset of Multi-Perspective, Decompositional Questions for LLM Web Agents
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
por: Balunović, Mislav, et al.
Publicado: (2025)
por: Balunović, Mislav, et al.
Publicado: (2025)
Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process
por: Ye, Tian, et al.
Publicado: (2024)
por: Ye, Tian, et al.
Publicado: (2024)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
por: Tian, Shi-Yu, et al.
Publicado: (2025)
por: Tian, Shi-Yu, et al.
Publicado: (2025)
MegaMath: Pushing the Limits of Open Math Corpora
por: Zhou, Fan, et al.
Publicado: (2025)
por: Zhou, Fan, et al.
Publicado: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
por: Liu, Xianyang, et al.
Publicado: (2025)
por: Liu, Xianyang, et al.
Publicado: (2025)
MathBuddy: A Multimodal System for Affective Math Tutoring
por: Kar, Debanjana, et al.
Publicado: (2025)
por: Kar, Debanjana, et al.
Publicado: (2025)
Physics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math Problems
por: Ye, Tian, et al.
Publicado: (2024)
por: Ye, Tian, et al.
Publicado: (2024)
Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes
por: Christ, Bryan R., et al.
Publicado: (2024)
por: Christ, Bryan R., et al.
Publicado: (2024)
ControlMath: Controllable Data Generation Promotes Math Generalist Models
por: Chen, Nuo, et al.
Publicado: (2024)
por: Chen, Nuo, et al.
Publicado: (2024)
ChatGPT as a Math Questioner? Evaluating ChatGPT on Generating Pre-university Math Questions
por: Van Long, Phuoc Pham, et al.
Publicado: (2023)
por: Van Long, Phuoc Pham, et al.
Publicado: (2023)
MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning
por: Li, Chengpeng, et al.
Publicado: (2023)
por: Li, Chengpeng, et al.
Publicado: (2023)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
por: Wang, Zengzhi, et al.
Publicado: (2023)
por: Wang, Zengzhi, et al.
Publicado: (2023)
Adversarial Math Word Problem Generation
por: Xie, Roy, et al.
Publicado: (2024)
por: Xie, Roy, et al.
Publicado: (2024)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
por: Fang, Meng, et al.
Publicado: (2024)
por: Fang, Meng, et al.
Publicado: (2024)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
por: Liu, Zihan, et al.
Publicado: (2024)
por: Liu, Zihan, et al.
Publicado: (2024)
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
por: An, Shengnan, et al.
Publicado: (2025)
por: An, Shengnan, et al.
Publicado: (2025)
Automatic Pair Construction for Contrastive Post-training
por: Xu, Canwen, et al.
Publicado: (2023)
por: Xu, Canwen, et al.
Publicado: (2023)
Can LLMs Master Math? Investigating Large Language Models on Math Stack Exchange
por: Satpute, Ankit, et al.
Publicado: (2024)
por: Satpute, Ankit, et al.
Publicado: (2024)
REAMS: Reasoning Enhanced Algorithm for Maths Solving
por: Singh, Eishkaran, et al.
Publicado: (2025)
por: Singh, Eishkaran, et al.
Publicado: (2025)
Self-Consistency Boosts Calibration for Math Reasoning
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Let's Verify Math Questions Step by Step
por: Shen, Chengyu, et al.
Publicado: (2025)
por: Shen, Chengyu, et al.
Publicado: (2025)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
por: Yuan, Fan, et al.
Publicado: (2025)
por: Yuan, Fan, et al.
Publicado: (2025)
OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset
por: Toshniwal, Shubham, et al.
Publicado: (2024)
por: Toshniwal, Shubham, et al.
Publicado: (2024)
OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data
por: Toshniwal, Shubham, et al.
Publicado: (2024)
por: Toshniwal, Shubham, et al.
Publicado: (2024)
RoMath: A Mathematical Reasoning Benchmark in Romanian
por: Cosma, Adrian, et al.
Publicado: (2024)
por: Cosma, Adrian, et al.
Publicado: (2024)
Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
por: Tonga, Junior Cedric, et al.
Publicado: (2025)
por: Tonga, Junior Cedric, et al.
Publicado: (2025)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
por: Mahabadi, Rabeeh Karimi, et al.
Publicado: (2025)
por: Mahabadi, Rabeeh Karimi, et al.
Publicado: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
por: Albalak, Alon, et al.
Publicado: (2025)
por: Albalak, Alon, et al.
Publicado: (2025)
RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)
por: Cuclea, Luca-Ncolae, et al.
Publicado: (2026)
por: Cuclea, Luca-Ncolae, et al.
Publicado: (2026)
MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code
por: Lu, Zimu, et al.
Publicado: (2024)
por: Lu, Zimu, et al.
Publicado: (2024)
Fara-7B: An Efficient Agentic Model for Computer Use
por: Awadallah, Ahmed, et al.
Publicado: (2025)
por: Awadallah, Ahmed, et al.
Publicado: (2025)
AlphaMath Almost Zero: Process Supervision without Process
por: Chen, Guoxin, et al.
Publicado: (2024)
por: Chen, Guoxin, et al.
Publicado: (2024)
MIND: Math Informed syNthetic Dialogues for Pretraining LLMs
por: Akter, Syeda Nahida, et al.
Publicado: (2024)
por: Akter, Syeda Nahida, et al.
Publicado: (2024)
Ejemplares similares
-
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024) -
AgentInstruct: Toward Generative Teaching with Agentic Flows
por: Mitra, Arindam, et al.
Publicado: (2024) -
EasyMath: A 0-shot Math Benchmark for SLMs
por: Karki, Drishya, et al.
Publicado: (2025) -
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
por: Xie, Tengyang, et al.
Publicado: (2024) -
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
por: Xu, Liang, et al.
Publicado: (2024)