Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Huan, Maggie, Li, Yuetai, Zheng, Tuney, Xu, Xiaoyu, Kim, Seungone, Du, Minxin, Poovendran, Radha, Neubig, Graham, Yue, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Temporal Sampling for Forgotten Reasoning in LLMs
di: Li, Yuetai, et al.
Pubblicazione: (2025)
di: Li, Yuetai, et al.
Pubblicazione: (2025)
Small Models Struggle to Learn from Strong Reasoners
di: Li, Yuetai, et al.
Pubblicazione: (2025)
di: Li, Yuetai, et al.
Pubblicazione: (2025)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Simulating Environments with Reasoning Models for Agent Training
di: Li, Yuetai, et al.
Pubblicazione: (2025)
di: Li, Yuetai, et al.
Pubblicazione: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
di: Kim, Seungone, et al.
Pubblicazione: (2025)
di: Kim, Seungone, et al.
Pubblicazione: (2025)
Structural Reasoning Improves Molecular Understanding of LLM
di: Jang, Yunhui, et al.
Pubblicazione: (2024)
di: Jang, Yunhui, et al.
Pubblicazione: (2024)
Demystifying Long Chain-of-Thought Reasoning in LLMs
di: Yeo, Edward, et al.
Pubblicazione: (2025)
di: Yeo, Edward, et al.
Pubblicazione: (2025)
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
FREESON: Retriever-Free Retrieval-Augmented Reasoning via Corpus-Traversing MCTS
di: Kim, Chaeeun, et al.
Pubblicazione: (2025)
di: Kim, Chaeeun, et al.
Pubblicazione: (2025)
Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
di: Kim, Minwu, et al.
Pubblicazione: (2025)
di: Kim, Minwu, et al.
Pubblicazione: (2025)
M-Prometheus: A Suite of Open Multilingual LLM Judges
di: Pombal, José, et al.
Pubblicazione: (2025)
di: Pombal, José, et al.
Pubblicazione: (2025)
Fill in the Blank: Exploring and Enhancing LLM Capabilities for Backward Reasoning in Math Word Problems
di: Deb, Aniruddha, et al.
Pubblicazione: (2023)
di: Deb, Aniruddha, et al.
Pubblicazione: (2023)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think
di: Lee, Seongyun, et al.
Pubblicazione: (2025)
di: Lee, Seongyun, et al.
Pubblicazione: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
di: Liu, Xianyang, et al.
Pubblicazione: (2025)
di: Liu, Xianyang, et al.
Pubblicazione: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
MathConstruct: Challenging LLM Reasoning with Constructive Proofs
di: Balunović, Mislav, et al.
Pubblicazione: (2025)
di: Balunović, Mislav, et al.
Pubblicazione: (2025)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
di: Song, Yueqi, et al.
Pubblicazione: (2025)
di: Song, Yueqi, et al.
Pubblicazione: (2025)
Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
The WidthWall: A Strict Expressivity Hierarchy for Hypergraph Neural Networks
di: Jiang, Fengqing, et al.
Pubblicazione: (2026)
di: Jiang, Fengqing, et al.
Pubblicazione: (2026)
Polyhedral Instability Governs Regret in Online Learning
di: Li, Yuetai, et al.
Pubblicazione: (2026)
di: Li, Yuetai, et al.
Pubblicazione: (2026)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
Evaluating Language Models as Synthetic Data Generators
di: Kim, Seungone, et al.
Pubblicazione: (2024)
di: Kim, Seungone, et al.
Pubblicazione: (2024)
Better Instruction-Following Through Minimum Bayes Risk
di: Wu, Ian, et al.
Pubblicazione: (2024)
di: Wu, Ian, et al.
Pubblicazione: (2024)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
di: Feng, Yichen, et al.
Pubblicazione: (2025)
di: Feng, Yichen, et al.
Pubblicazione: (2025)
MAmmoTH2: Scaling Instructions from the Web
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
Utilizing Training Data to Improve LLM Reasoning for Tabular Understanding
di: Gao, Chufan, et al.
Pubblicazione: (2025)
di: Gao, Chufan, et al.
Pubblicazione: (2025)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
di: Lee, Young-Jun, et al.
Pubblicazione: (2025)
di: Lee, Young-Jun, et al.
Pubblicazione: (2025)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
di: Kim, Eunsu, et al.
Pubblicazione: (2024)
di: Kim, Eunsu, et al.
Pubblicazione: (2024)
MathBode: Measuring the Stability of LLM Reasoning using Frequency Response
di: Wang, Charles L.
Pubblicazione: (2025)
di: Wang, Charles L.
Pubblicazione: (2025)
FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
di: Seegmiller, Parker, et al.
Pubblicazione: (2025)
di: Seegmiller, Parker, et al.
Pubblicazione: (2025)
ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2025)
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
di: Xu, Zhangchen, et al.
Pubblicazione: (2025) -
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
di: Jiang, Fengqing, et al.
Pubblicazione: (2025) -
Temporal Sampling for Forgotten Reasoning in LLMs
di: Li, Yuetai, et al.
Pubblicazione: (2025) -
Small Models Struggle to Learn from Strong Reasoners
di: Li, Yuetai, et al.
Pubblicazione: (2025) -
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)