START: Self-taught Reasoner with Tools
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Chengpeng, Xue, Mingfeng, Zhang, Zhenru, Yang, Jiaxi, Zhang, Beichen, Wang, Xiang, Yu, Bowen, Hui, Binyuan, Lin, Junyang, Liu, Dayiheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
di: Yang, An, et al.
Pubblicazione: (2024)
di: Yang, An, et al.
Pubblicazione: (2024)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
Teaching Language Models to Reason with Tools
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
di: Li, Chengpeng, et al.
Pubblicazione: (2024)
di: Li, Chengpeng, et al.
Pubblicazione: (2024)
CoRT: Code-integrated Reasoning within Thinking
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
Synthesizing Text-to-SQL Data from Weak and Strong LLMs
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
di: Ye, Ziang, et al.
Pubblicazione: (2024)
di: Ye, Ziang, et al.
Pubblicazione: (2024)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
di: Bao, Keqin, et al.
Pubblicazione: (2025)
di: Bao, Keqin, et al.
Pubblicazione: (2025)
SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner
di: Zhang, Lei, et al.
Pubblicazione: (2025)
di: Zhang, Lei, et al.
Pubblicazione: (2025)
PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization
di: Zhang, Jiajun, et al.
Pubblicazione: (2025)
di: Zhang, Jiajun, et al.
Pubblicazione: (2025)
CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings
di: Quan, Shanghaoran, et al.
Pubblicazione: (2025)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2025)
WorldPM: Scaling Human Preference Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2025)
di: Wang, Binghai, et al.
Pubblicazione: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
Language Models can Self-Lengthen to Generate Long Texts
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
Evaluating and Aligning CodeLLMs on Human Preference
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
SWE-RM: Execution-free Feedback For Software Engineering Agents
di: Shum, KaShun, et al.
Pubblicazione: (2025)
di: Shum, KaShun, et al.
Pubblicazione: (2025)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
di: Fang, Yi, et al.
Pubblicazione: (2026)
di: Fang, Yi, et al.
Pubblicazione: (2026)
Qwen2.5 Technical Report
di: Qwen, et al.
Pubblicazione: (2024)
di: Qwen, et al.
Pubblicazione: (2024)
Unified Data Selection for LLM Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
Scaling Agentic Verifier for Competitive Coding
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
di: Dong, Guanting, et al.
Pubblicazione: (2023)
di: Dong, Guanting, et al.
Pubblicazione: (2023)
From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
Multi-Agent Collaboration for Multilingual Code Instruction Tuning
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
Qwen2.5-Coder Technical Report
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
di: Zhang, Kai, et al.
Pubblicazione: (2026)
di: Zhang, Kai, et al.
Pubblicazione: (2026)
DataMan: Data Manager for Pre-training Large Language Models
di: Peng, Ru, et al.
Pubblicazione: (2025)
di: Peng, Ru, et al.
Pubblicazione: (2025)
Existing LLMs Are Not Self-Consistent For Simple Tasks
di: Lin, Zhenru, et al.
Pubblicazione: (2025)
di: Lin, Zhenru, et al.
Pubblicazione: (2025)
Qwen3 Technical Report
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
A Preliminary Study of the Intrinsic Relationship between Complexity and Alignment
di: Zhao, Yingxiu, et al.
Pubblicazione: (2023)
di: Zhao, Yingxiu, et al.
Pubblicazione: (2023)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
di: Qi, Chengwen, et al.
Pubblicazione: (2025)
IFEvalCode: Controlled Code Generation
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
di: Yang, An, et al.
Pubblicazione: (2024) -
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024) -
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025) -
Teaching Language Models to Reason with Tools
di: Li, Chengpeng, et al.
Pubblicazione: (2025) -
DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning
di: Li, Chengpeng, et al.
Pubblicazione: (2024)