Common 7B Language Models Already Possess Strong Math Capabilities
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Chen, Wang, Weiqi, Hu, Jingcheng, Wei, Yixuan, Zheng, Nanning, Hu, Han, Zhang, Zheng, Peng, Houwen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Do Large Language Models Possess Sensitive to Sentiment?
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
von: Ding, Jiayu, et al.
Veröffentlicht: (2025)
von: Ding, Jiayu, et al.
Veröffentlicht: (2025)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
von: Ni, Bolin, et al.
Veröffentlicht: (2024)
von: Ni, Bolin, et al.
Veröffentlicht: (2024)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
von: Luo, Haipeng, et al.
Veröffentlicht: (2025)
von: Luo, Haipeng, et al.
Veröffentlicht: (2025)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
von: Li, Loka, et al.
Veröffentlicht: (2024)
von: Li, Loka, et al.
Veröffentlicht: (2024)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
von: Han, Wenhan, et al.
Veröffentlicht: (2025)
von: Han, Wenhan, et al.
Veröffentlicht: (2025)
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
von: Yang, Ruihan, et al.
Veröffentlicht: (2024)
von: Yang, Ruihan, et al.
Veröffentlicht: (2024)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
von: Huan, Maggie, et al.
Veröffentlicht: (2025)
von: Huan, Maggie, et al.
Veröffentlicht: (2025)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
AI Scientists Fail Without Strong Implementation Capability
von: Zhu, Minjun, et al.
Veröffentlicht: (2025)
von: Zhu, Minjun, et al.
Veröffentlicht: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
von: Sun, Yiyou, et al.
Veröffentlicht: (2025)
von: Sun, Yiyou, et al.
Veröffentlicht: (2025)
Make Your LLM Fully Utilize the Context
von: An, Shengnan, et al.
Veröffentlicht: (2024)
von: An, Shengnan, et al.
Veröffentlicht: (2024)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
von: Peng, Shuai, et al.
Veröffentlicht: (2024)
von: Peng, Shuai, et al.
Veröffentlicht: (2024)
Learning From Mistakes Makes LLM Better Reasoner
von: An, Shengnan, et al.
Veröffentlicht: (2023)
von: An, Shengnan, et al.
Veröffentlicht: (2023)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
von: Liu, Yulong, et al.
Veröffentlicht: (2024)
von: Liu, Yulong, et al.
Veröffentlicht: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
Training-Free Test-Time Contrastive Learning for Large Language Models
von: Zheng, Kaiwen, et al.
Veröffentlicht: (2026)
von: Zheng, Kaiwen, et al.
Veröffentlicht: (2026)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models
von: Yu, Longhui, et al.
Veröffentlicht: (2023)
von: Yu, Longhui, et al.
Veröffentlicht: (2023)
Case-Based or Rule-Based: How Do Transformers Do the Math?
von: Hu, Yi, et al.
Veröffentlicht: (2024)
von: Hu, Yi, et al.
Veröffentlicht: (2024)
CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement
von: Ren, Jing, et al.
Veröffentlicht: (2025)
von: Ren, Jing, et al.
Veröffentlicht: (2025)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
von: Liu, Biao, et al.
Veröffentlicht: (2024)
von: Liu, Biao, et al.
Veröffentlicht: (2024)
Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes
von: Christ, Bryan R., et al.
Veröffentlicht: (2024)
von: Christ, Bryan R., et al.
Veröffentlicht: (2024)
The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
von: Zhu, Yubo, et al.
Veröffentlicht: (2025)
von: Zhu, Yubo, et al.
Veröffentlicht: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
von: Liu, Zihan, et al.
Veröffentlicht: (2024)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
von: Su, Jiamin, et al.
Veröffentlicht: (2025)
von: Su, Jiamin, et al.
Veröffentlicht: (2025)
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
von: Shao, Hanyin, et al.
Veröffentlicht: (2023)
von: Shao, Hanyin, et al.
Veröffentlicht: (2023)
Debate-to-Detect: Reformulating Misinformation Detection as a Real-World Debate with Large Language Models
von: Han, Chen, et al.
Veröffentlicht: (2025)
von: Han, Chen, et al.
Veröffentlicht: (2025)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
von: Li, Qingyao, et al.
Veröffentlicht: (2023)
von: Li, Qingyao, et al.
Veröffentlicht: (2023)
Improving Bilingual Capabilities of Language Models to Support Diverse Linguistic Practices in Education
von: Syamkumar, Anand, et al.
Veröffentlicht: (2024)
von: Syamkumar, Anand, et al.
Veröffentlicht: (2024)
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
von: Fang, Meng, et al.
Veröffentlicht: (2024)
von: Fang, Meng, et al.
Veröffentlicht: (2024)
Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm
von: Babarczy, Anna, et al.
Veröffentlicht: (2026)
von: Babarczy, Anna, et al.
Veröffentlicht: (2026)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
IIMedGPT: Promoting Large Language Model Capabilities of Medical Tasks by Efficient Human Preference Alignment
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Do Large Language Models Possess Sensitive to Sentiment?
von: Liu, Yang, et al.
Veröffentlicht: (2024) -
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
von: Ding, Jiayu, et al.
Veröffentlicht: (2025) -
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
von: Ni, Bolin, et al.
Veröffentlicht: (2024) -
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
von: Luo, Haipeng, et al.
Veröffentlicht: (2025) -
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
von: Li, Loka, et al.
Veröffentlicht: (2024)