PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Yao, Fan, Dengdong, Nie, Jianzheng, Xu, Fan, Chen, Jie, Zhou, Bin, Tian, Yonghong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent
di: Lu, Yao, et al.
Pubblicazione: (2026)
di: Lu, Yao, et al.
Pubblicazione: (2026)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
di: Seed, ByteDance, et al.
Pubblicazione: (2025)
di: Seed, ByteDance, et al.
Pubblicazione: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
di: Chen, Huayu, et al.
Pubblicazione: (2025)
di: Chen, Huayu, et al.
Pubblicazione: (2025)
Offline Learning and Forgetting for Reasoning with Large Language Models
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
di: Wang, Siyuan, et al.
Pubblicazione: (2025)
di: Wang, Siyuan, et al.
Pubblicazione: (2025)
Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning
di: Tian, Changyuan, et al.
Pubblicazione: (2025)
di: Tian, Changyuan, et al.
Pubblicazione: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
di: Liu, Zihan, et al.
Pubblicazione: (2024)
di: Liu, Zihan, et al.
Pubblicazione: (2024)
VerityMath: Advancing Mathematical Reasoning by Self-Verification Through Unit Consistency
di: Han, Vernon Toh Yan, et al.
Pubblicazione: (2023)
di: Han, Vernon Toh Yan, et al.
Pubblicazione: (2023)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
di: Shao, Zhihong, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
di: Liu, Wentao, et al.
Pubblicazione: (2024)
di: Liu, Wentao, et al.
Pubblicazione: (2024)
Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning
di: Oh, Minjae, et al.
Pubblicazione: (2025)
di: Oh, Minjae, et al.
Pubblicazione: (2025)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling
di: Yang, Jiangnan, et al.
Pubblicazione: (2026)
di: Yang, Jiangnan, et al.
Pubblicazione: (2026)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness
di: Chen, Sirui, et al.
Pubblicazione: (2025)
di: Chen, Sirui, et al.
Pubblicazione: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math
di: Xu, Haoran, et al.
Pubblicazione: (2025)
di: Xu, Haoran, et al.
Pubblicazione: (2025)
MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning
di: Li, Chengpeng, et al.
Pubblicazione: (2023)
di: Li, Chengpeng, et al.
Pubblicazione: (2023)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models for Math Reasoning Tasks
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance
di: Qian, Lingfei, et al.
Pubblicazione: (2025)
di: Qian, Lingfei, et al.
Pubblicazione: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
di: Chen, Mingyang, et al.
Pubblicazione: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2025)
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2025)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process
di: Ye, Tian, et al.
Pubblicazione: (2024)
di: Ye, Tian, et al.
Pubblicazione: (2024)
REAMS: Reasoning Enhanced Algorithm for Maths Solving
di: Singh, Eishkaran, et al.
Pubblicazione: (2025)
di: Singh, Eishkaran, et al.
Pubblicazione: (2025)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
di: He, Zhiwei, et al.
Pubblicazione: (2025)
di: He, Zhiwei, et al.
Pubblicazione: (2025)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
di: Yu, Yongcan, et al.
Pubblicazione: (2026)
di: Yu, Yongcan, et al.
Pubblicazione: (2026)
Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
di: Chen, Zui, et al.
Pubblicazione: (2024)
di: Chen, Zui, et al.
Pubblicazione: (2024)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
di: Xu, Liang, et al.
Pubblicazione: (2024)
di: Xu, Liang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent
di: Lu, Yao, et al.
Pubblicazione: (2026) -
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
di: Chen, Yang, et al.
Pubblicazione: (2025) -
Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
di: Seed, ByteDance, et al.
Pubblicazione: (2025) -
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
di: Chen, Huayu, et al.
Pubblicazione: (2025) -
Offline Learning and Forgetting for Reasoning with Large Language Models
di: Ni, Tianwei, et al.
Pubblicazione: (2025)