Improving Rationality in the Reasoning Process of Language Models through Self-playing Game
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Pinzheng, Li, Juntao, Tang, Zecheng, Gui, Haijia, zhang, Min |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Revisiting Long-context Modeling from Context Denoising Perspective
by: Tang, Zecheng, et al.
Published: (2025)
by: Tang, Zecheng, et al.
Published: (2025)
Revealing and Mitigating Over-Attention in Knowledge Editing
by: Wang, Pinzheng, et al.
Published: (2025)
by: Wang, Pinzheng, et al.
Published: (2025)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
by: Wang, Pinzheng, et al.
Published: (2026)
by: Wang, Pinzheng, et al.
Published: (2026)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
by: Liu, Weijie, et al.
Published: (2024)
by: Liu, Weijie, et al.
Published: (2024)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
by: Ji, Baibei, et al.
Published: (2026)
by: Ji, Baibei, et al.
Published: (2026)
Revealing and Mitigating the Local Pattern Shortcuts of Mamba
by: You, Wangjie, et al.
Published: (2024)
by: You, Wangjie, et al.
Published: (2024)
LOGO -- Long cOntext aliGnment via efficient preference Optimization
by: Tang, Zecheng, et al.
Published: (2024)
by: Tang, Zecheng, et al.
Published: (2024)
DERMARK: A Dynamic, Efficient and Robust Multi-bit Watermark for Large Language Models
by: Lin, Qihao, et al.
Published: (2025)
by: Lin, Qihao, et al.
Published: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
by: Tang, Zecheng, et al.
Published: (2025)
by: Tang, Zecheng, et al.
Published: (2025)
Mastering the Game of Go with Self-play Experience Replay
by: Liu, Jingbin, et al.
Published: (2026)
by: Liu, Jingbin, et al.
Published: (2026)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
by: Tang, Zecheng, et al.
Published: (2026)
by: Tang, Zecheng, et al.
Published: (2026)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
by: Gui, Jiayi, et al.
Published: (2024)
by: Gui, Jiayi, et al.
Published: (2024)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
by: Zhou, Xin, et al.
Published: (2025)
by: Zhou, Xin, et al.
Published: (2025)
Learnable Game-theoretic Policy Optimization for Data-centric Self-explanation Rationalization
by: Zhao, Yunxiao, et al.
Published: (2025)
by: Zhao, Yunxiao, et al.
Published: (2025)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
Timo: Towards Better Temporal Reasoning for Language Models
by: Su, Zhaochen, et al.
Published: (2024)
by: Su, Zhaochen, et al.
Published: (2024)
Improving Language Model Reasoning with Self-motivated Learning
by: Feng, Yunlong, et al.
Published: (2024)
by: Feng, Yunlong, et al.
Published: (2024)
Rethinking Negative Instances for Generative Named Entity Recognition
by: Ding, Yuyang, et al.
Published: (2024)
by: Ding, Yuyang, et al.
Published: (2024)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
by: Liao, Yi, et al.
Published: (2025)
by: Liao, Yi, et al.
Published: (2025)
Rationality Check! Benchmarking the Rationality of Large Language Models
by: Zhou, Zhilun, et al.
Published: (2025)
by: Zhou, Zhilun, et al.
Published: (2025)
Games played by Exponential Weights Algorithms
by: d'Andrea, Maurizio, et al.
Published: (2024)
by: d'Andrea, Maurizio, et al.
Published: (2024)
Fennec: Fine-grained Language Model Evaluation and Correction Extended through Branching and Bridging
by: Liang, Xiaobo, et al.
Published: (2024)
by: Liang, Xiaobo, et al.
Published: (2024)
Improving Retrieval Augmented Language Model with Self-Reasoning
by: Xia, Yuan, et al.
Published: (2024)
by: Xia, Yuan, et al.
Published: (2024)
A Survey on Self-play Methods in Reinforcement Learning
by: Zhang, Ruize, et al.
Published: (2024)
by: Zhang, Ruize, et al.
Published: (2024)
Large Language Models Can Self-Improve in Long-context Reasoning
by: Li, Siheng, et al.
Published: (2024)
by: Li, Siheng, et al.
Published: (2024)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
by: Hudi, Frederikus, et al.
Published: (2025)
by: Hudi, Frederikus, et al.
Published: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
by: Zhou, Jiayi, et al.
Published: (2024)
by: Zhou, Jiayi, et al.
Published: (2024)
MentalArena: Self-play Training of Language Models for Diagnosis and Treatment of Mental Health Disorders
by: Li, Cheng, et al.
Published: (2024)
by: Li, Cheng, et al.
Published: (2024)
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
by: Zhao, Andrew, et al.
Published: (2025)
by: Zhao, Andrew, et al.
Published: (2025)
Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning
by: Yu, Song, et al.
Published: (2025)
by: Yu, Song, et al.
Published: (2025)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
by: Tang, Zecheng, et al.
Published: (2026)
by: Tang, Zecheng, et al.
Published: (2026)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
A Hierarchical Language Model For Interpretable Graph Reasoning
by: Khurana, Sambhav, et al.
Published: (2024)
by: Khurana, Sambhav, et al.
Published: (2024)
Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language Models
by: Jeong, Minbyul, et al.
Published: (2024)
by: Jeong, Minbyul, et al.
Published: (2024)
Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective
by: You, Wangjie, et al.
Published: (2025)
by: You, Wangjie, et al.
Published: (2025)
Advancing Large Language Model Attribution through Self-Improving
by: Huang, Lei, et al.
Published: (2024)
by: Huang, Lei, et al.
Published: (2024)
Instruction-Driven Game Engines on Large Language Models
by: Wu, Hongqiu, et al.
Published: (2024)
by: Wu, Hongqiu, et al.
Published: (2024)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
by: Yin, Qiyue, et al.
Published: (2025)
by: Yin, Qiyue, et al.
Published: (2025)
Beyond Confidence: The Rhythms of Reasoning in Generative Models
by: Liu, Deyuan, et al.
Published: (2026)
by: Liu, Deyuan, et al.
Published: (2026)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
by: Xi, Zhiheng, et al.
Published: (2023)
by: Xi, Zhiheng, et al.
Published: (2023)
Similar Items
-
Revisiting Long-context Modeling from Context Denoising Perspective
by: Tang, Zecheng, et al.
Published: (2025) -
Revealing and Mitigating Over-Attention in Knowledge Editing
by: Wang, Pinzheng, et al.
Published: (2025) -
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
by: Wang, Pinzheng, et al.
Published: (2026) -
MemLong: Memory-Augmented Retrieval for Long Text Modeling
by: Liu, Weijie, et al.
Published: (2024) -
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
by: Ji, Baibei, et al.
Published: (2026)