How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dionisopoulos, Lucas, Majamaki, Nicklas, Ammanabrolu, Prithviraj |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
par: Kim, Bosung, et autres
Publié: (2025)
par: Kim, Bosung, et autres
Publié: (2025)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
par: Wang, Ruiyi, et autres
Publié: (2025)
par: Wang, Ruiyi, et autres
Publié: (2025)
Preference-Based Learning in Audio Applications: A Systematic Analysis
par: Broukhim, Aaron, et autres
Publié: (2025)
par: Broukhim, Aaron, et autres
Publié: (2025)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
par: Shen, Yiran, et autres
Publié: (2025)
par: Shen, Yiran, et autres
Publié: (2025)
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
par: Cui, Brandon, et autres
Publié: (2026)
par: Cui, Brandon, et autres
Publié: (2026)
VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
par: Kang, Haoqiang, et autres
Publié: (2025)
par: Kang, Haoqiang, et autres
Publié: (2025)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
par: Tan, Zelin, et autres
Publié: (2025)
par: Tan, Zelin, et autres
Publié: (2025)
Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess
par: Hwang, Dongyoon, et autres
Publié: (2025)
par: Hwang, Dongyoon, et autres
Publié: (2025)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
par: Liu, Jincheng, et autres
Publié: (2025)
par: Liu, Jincheng, et autres
Publié: (2025)
Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
par: Matsutani, Kohsei, et autres
Publié: (2026)
par: Matsutani, Kohsei, et autres
Publié: (2026)
Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight
par: Cui, Christopher Z., et autres
Publié: (2026)
par: Cui, Christopher Z., et autres
Publié: (2026)
ChessQA: Evaluating Large Language Models for Chess Understanding
par: Wen, Qianfeng, et autres
Publié: (2025)
par: Wen, Qianfeng, et autres
Publié: (2025)
Data-Efficient Training by Evolved Sampling
par: Cheng, Ziheng, et autres
Publié: (2025)
par: Cheng, Ziheng, et autres
Publié: (2025)
Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
par: Akter, Syeda Nahida, et autres
Publié: (2025)
par: Akter, Syeda Nahida, et autres
Publié: (2025)
Implicit Search via Discrete Diffusion: A Study on Chess
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Generating Creative Chess Puzzles
par: Feng, Xidong, et autres
Publié: (2025)
par: Feng, Xidong, et autres
Publié: (2025)
Liquid Reasoning Transformers: A Sudoku-Based Prototype for Chess-Scale Algorithmic Tasks
par: Sahni, Shivansh, et autres
Publié: (2025)
par: Sahni, Shivansh, et autres
Publié: (2025)
Amortized Planning with Large-Scale Transformers: A Case Study on Chess
par: Ruoss, Anian, et autres
Publié: (2024)
par: Ruoss, Anian, et autres
Publié: (2024)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
par: Javanmard, Adel, et autres
Publié: (2026)
par: Javanmard, Adel, et autres
Publié: (2026)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
par: Hu, Pingbang, et autres
Publié: (2026)
par: Hu, Pingbang, et autres
Publié: (2026)
Complete Chess Games Enable LLM Become A Chess Master
par: Zhang, Yinqi, et autres
Publié: (2025)
par: Zhang, Yinqi, et autres
Publié: (2025)
Human-aligned Chess with a Bit of Search
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Enhancing Chess Reinforcement Learning with Graph Representation
par: Rigaux, Tomas, et autres
Publié: (2024)
par: Rigaux, Tomas, et autres
Publié: (2024)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
par: Chen, Zui, et autres
Publié: (2024)
par: Chen, Zui, et autres
Publié: (2024)
Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training
par: Nepal, Aadim, et autres
Publié: (2025)
par: Nepal, Aadim, et autres
Publié: (2025)
Towards Piece-by-Piece Explanations for Chess Positions with SHAP
par: Spinnato, Francesco
Publié: (2025)
par: Spinnato, Francesco
Publié: (2025)
Iterative Inference in a Chess-Playing Neural Network
par: Sandmann, Elias, et autres
Publié: (2025)
par: Sandmann, Elias, et autres
Publié: (2025)
Diversifying AI: Towards Creative Chess with AlphaZero
par: Zahavy, Tom, et autres
Publié: (2023)
par: Zahavy, Tom, et autres
Publié: (2023)
Mastering Chinese Chess AI (Xiangqi) Without Search
par: Chen, Yu, et autres
Publié: (2024)
par: Chen, Yu, et autres
Publié: (2024)
Self-Evolving Curriculum for LLM Reasoning
par: Chen, Xiaoyin, et autres
Publié: (2025)
par: Chen, Xiaoyin, et autres
Publié: (2025)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Oracle-Guided Soft Shielding for Safe Move Prediction in Chess
par: Rajendran, Prajit T, et autres
Publié: (2026)
par: Rajendran, Prajit T, et autres
Publié: (2026)
Mixture of Masters: Sparse Chess Language Models with Player Routing
par: Frisoni, Giacomo, et autres
Publié: (2026)
par: Frisoni, Giacomo, et autres
Publié: (2026)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Evaluating In Silico Creativity: An Expert Review of AI Chess Compositions
par: Veeriah, Vivek, et autres
Publié: (2025)
par: Veeriah, Vivek, et autres
Publié: (2025)
Learning to Reason Efficiently with A* Post-Training
par: Opedal, Andreas, et autres
Publié: (2026)
par: Opedal, Andreas, et autres
Publié: (2026)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
Documents similaires
-
Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
par: Kim, Bosung, et autres
Publié: (2025) -
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
par: Wang, Ruiyi, et autres
Publié: (2025) -
Preference-Based Learning in Audio Applications: A Systematic Analysis
par: Broukhim, Aaron, et autres
Publié: (2025) -
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
par: Shen, Yiran, et autres
Publié: (2025) -
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
par: Cui, Brandon, et autres
Publié: (2026)