SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Bo, Guertler, Leon, Yu, Simon, Liu, Zichen, Qi, Penghui, Balcells, Daniel, Liu, Mickel, Tan, Cheston, Shi, Weiyan, Lin, Min, Lee, Wee Sun, Jaques, Natasha |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TextArena
by: Guertler, Leon, et al.
Published: (2025)
by: Guertler, Leon, et al.
Published: (2025)
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
by: Liu, Mickel, et al.
Published: (2025)
by: Liu, Mickel, et al.
Published: (2025)
STLM Engineering Report: Dropout
by: Hillier, Dylan, et al.
Published: (2024)
by: Hillier, Dylan, et al.
Published: (2024)
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
Super Tiny Language Models
by: Hillier, Dylan, et al.
Published: (2024)
by: Hillier, Dylan, et al.
Published: (2024)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
by: Wan, Yanming, et al.
Published: (2025)
by: Wan, Yanming, et al.
Published: (2025)
Multi Agent Reinforcement Learning for Sequential Satellite Assignment Problems
by: Holder, Joshua, et al.
Published: (2024)
by: Holder, Joshua, et al.
Published: (2024)
Learning to summarize user information for personalized reinforcement learning from human feedback
by: Nam, Hyunji, et al.
Published: (2025)
by: Nam, Hyunji, et al.
Published: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
by: Nagar, Aishik, et al.
Published: (2024)
by: Nagar, Aishik, et al.
Published: (2024)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
by: Yuan, Huining, et al.
Published: (2025)
by: Yuan, Huining, et al.
Published: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
by: Qi, Penghui, et al.
Published: (2025)
by: Qi, Penghui, et al.
Published: (2025)
Cross-environment Cooperation Enables Zero-shot Multi-agent Coordination
by: Jha, Kunal, et al.
Published: (2025)
by: Jha, Kunal, et al.
Published: (2025)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
by: Xie, Yunfei, et al.
Published: (2026)
by: Xie, Yunfei, et al.
Published: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
by: Ning, Yansong, et al.
Published: (2025)
by: Ning, Yansong, et al.
Published: (2025)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
by: Huang, Xinyu, et al.
Published: (2025)
by: Huang, Xinyu, et al.
Published: (2025)
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
by: Li, Xu, et al.
Published: (2026)
by: Li, Xu, et al.
Published: (2026)
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning
by: Xue, Zhenghai, et al.
Published: (2025)
by: Xue, Zhenghai, et al.
Published: (2025)
Understanding R1-Zero-Like Training: A Critical Perspective
by: Liu, Zichen, et al.
Published: (2025)
by: Liu, Zichen, et al.
Published: (2025)
An Efficient Open World Environment for Multi-Agent Social Learning
by: Ye, Eric, et al.
Published: (2025)
by: Ye, Eric, et al.
Published: (2025)
SPIRAL: Self-Play Incremental Racing Algorithm for Learning in Multi-Drone Competitions
by: Akgün, Onur
Published: (2025)
by: Akgün, Onur
Published: (2025)
TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?
by: Zong, Yikun, et al.
Published: (2026)
by: Zong, Yikun, et al.
Published: (2026)
Efficacy of Language Model Self-Play in Non-Zero-Sum Games
by: Liao, Austen, et al.
Published: (2024)
by: Liao, Austen, et al.
Published: (2024)
AllReduce Scheduling with Hierarchical Deep Reinforcement Learning
by: Wei, Yufan, et al.
Published: (2025)
by: Wei, Yufan, et al.
Published: (2025)
Leveraging Team Correlation for Approximating Equilibrium in Two-Team Zero-Sum Games
by: Liu, Naming, et al.
Published: (2024)
by: Liu, Naming, et al.
Published: (2024)
GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
by: Wang, Di, et al.
Published: (2025)
by: Wang, Di, et al.
Published: (2025)
Multi-Player Zero-Sum Markov Games with Networked Separable Interactions
by: Park, Chanwoo, et al.
Published: (2023)
by: Park, Chanwoo, et al.
Published: (2023)
Computing Ex Ante Equilibrium in Heterogeneous Zero-Sum Team Games
by: Liu, Naming, et al.
Published: (2024)
by: Liu, Naming, et al.
Published: (2024)
TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning
by: Li, Chusen, et al.
Published: (2026)
by: Li, Chusen, et al.
Published: (2026)
Fast and Furious Symmetric Learning in Zero-Sum Games: Gradient Descent as Fictitious Play
by: Lazarsfeld, John, et al.
Published: (2025)
by: Lazarsfeld, John, et al.
Published: (2025)
Offline Two-Player Zero-Sum Markov Games with KL Regularization
by: Chen, Claire, et al.
Published: (2026)
by: Chen, Claire, et al.
Published: (2026)
STUPD: A Synthetic Dataset for Spatial and Temporal Relation Reasoning
by: Agrawal, Palaash, et al.
Published: (2023)
by: Agrawal, Palaash, et al.
Published: (2023)
Automatic Identification of Samples in Hip-Hop Music via Multi-Loss Training and an Artificial Dataset
by: Cheston, Huw, et al.
Published: (2025)
by: Cheston, Huw, et al.
Published: (2025)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
by: Wei, Quan, et al.
Published: (2025)
by: Wei, Quan, et al.
Published: (2025)
Triplet-Structured Knowledge Integration for Multi-Turn Medical Reasoning
by: Meng, Zhaohan, et al.
Published: (2025)
by: Meng, Zhaohan, et al.
Published: (2025)
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
by: Jaiswal, Shantanu, et al.
Published: (2024)
by: Jaiswal, Shantanu, et al.
Published: (2024)
Model-Based Reinforcement Learning for Offline Zero-Sum Markov Games
by: Yan, Yuling, et al.
Published: (2022)
by: Yan, Yuling, et al.
Published: (2022)
Continual Reinforcement Learning by Planning with Online World Models
by: Liu, Zichen, et al.
Published: (2025)
by: Liu, Zichen, et al.
Published: (2025)
Multi-Garment Customized Model Generation
by: Liu, Yichen, et al.
Published: (2024)
by: Liu, Yichen, et al.
Published: (2024)
Multi-Agent Reinforcement Learning for Sample-Efficient Deep Neural Network Mapping
by: Krishnan, Srivatsan, et al.
Published: (2025)
by: Krishnan, Srivatsan, et al.
Published: (2025)
Similar Items
-
TextArena
by: Guertler, Leon, et al.
Published: (2025) -
Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
by: Liu, Mickel, et al.
Published: (2025) -
STLM Engineering Report: Dropout
by: Hillier, Dylan, et al.
Published: (2024) -
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
by: Abdulhai, Marwa, et al.
Published: (2025) -
Super Tiny Language Models
by: Hillier, Dylan, et al.
Published: (2024)