SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Wenkai, Liu, Shunyu, Zhou, Yang, Zhang, Kongcheng, Zheng, Tongya, Chen, Kaixuan, Song, Mingli, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Reasoning with Reinforced Functional Token Tuning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
Odyssey: Empowering Minecraft Agents with Open-World Skills
par: Liu, Shunyu, et autres
Publié: (2024)
par: Liu, Shunyu, et autres
Publié: (2024)
Unveiling Global Interactive Patterns across Graphs: Towards Interpretable Graph Neural Networks
par: Wang, Yuwen, et autres
Publié: (2024)
par: Wang, Yuwen, et autres
Publié: (2024)
Towards Efficient LLM-aware Heterogeneous Graph Learning
par: Li, Wenda, et autres
Publié: (2025)
par: Li, Wenda, et autres
Publié: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
Learning a Mini-batch Graph Transformer via Two-stage Interaction Augmentation
par: Li, Wenda, et autres
Publié: (2024)
par: Li, Wenda, et autres
Publié: (2024)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
par: Ying, Yuchen, et autres
Publié: (2026)
par: Ying, Yuchen, et autres
Publié: (2026)
Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?
par: Zhou, Yihe, et autres
Publié: (2023)
par: Zhou, Yihe, et autres
Publié: (2023)
Spatiotemporal-Augmented Graph Neural Networks for Human Mobility Simulation
par: Wang, Yu, et autres
Publié: (2023)
par: Wang, Yu, et autres
Publié: (2023)
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Parallelized Planning-Acting for Efficient LLM-based Multi-Agent Systems in Minecraft
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
A Survey of Direct Preference Optimization
par: Liu, Shunyu, et autres
Publié: (2025)
par: Liu, Shunyu, et autres
Publié: (2025)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
par: Qing, Yunpeng, et autres
Publié: (2022)
par: Qing, Yunpeng, et autres
Publié: (2022)
From GNNs to Trees: Multi-Granular Interpretability for Graph Neural Networks
par: Yang, Jie, et autres
Publié: (2025)
par: Yang, Jie, et autres
Publié: (2025)
Disentangled Condensation for Large-scale Graphs
par: Xiao, Zhenbang, et autres
Publié: (2024)
par: Xiao, Zhenbang, et autres
Publié: (2024)
Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning
par: Liu, Shunyu, et autres
Publié: (2022)
par: Liu, Shunyu, et autres
Publié: (2022)
Self-Play Preference Optimization for Language Model Alignment
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
par: Qing, Yunpeng, et autres
Publié: (2024)
par: Qing, Yunpeng, et autres
Publié: (2024)
Curriculum Negative Mining For Temporal Networks
par: Chen, Ziyue, et autres
Publié: (2024)
par: Chen, Ziyue, et autres
Publié: (2024)
Model Hemorrhage and the Robustness Limits of Large Language Models
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Simple Graph Condensation
par: Xiao, Zhenbang, et autres
Publié: (2024)
par: Xiao, Zhenbang, et autres
Publié: (2024)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
par: Yang, Ziyi, et autres
Publié: (2025)
par: Yang, Ziyi, et autres
Publié: (2025)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
par: Du, Dong, et autres
Publié: (2025)
par: Du, Dong, et autres
Publié: (2025)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
par: Li, Hongyu, et autres
Publié: (2024)
par: Li, Hongyu, et autres
Publié: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
par: Chen, Zixiang, et autres
Publié: (2024)
par: Chen, Zixiang, et autres
Publié: (2024)
A Survey on Self-Evolution of Large Language Models
par: Tao, Zhengwei, et autres
Publié: (2024)
par: Tao, Zhengwei, et autres
Publié: (2024)
A Survey on Agentic Multimodal Large Language Models
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
LLM-Gomoku: A Large Language Model-Based System for Strategic Gomoku with Self-Play and Reinforcement Learning
par: Wang, Hui
Publié: (2025)
par: Wang, Hui
Publié: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
par: Bao, Rong, et autres
Publié: (2024)
par: Bao, Rong, et autres
Publié: (2024)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
par: Zou, Wei, et autres
Publié: (2025)
par: Zou, Wei, et autres
Publié: (2025)
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
par: Zhang, Shengtao, et autres
Publié: (2026)
par: Zhang, Shengtao, et autres
Publié: (2026)
Distilling Rule-based Knowledge into Large Language Models
par: Yang, Wenkai, et autres
Publié: (2023)
par: Yang, Wenkai, et autres
Publié: (2023)
Uncertainty Aware Learning for Language Model Alignment
par: Wang, Yikun, et autres
Publié: (2024)
par: Wang, Yikun, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Documents similaires
-
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025) -
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
par: Zhang, Kongcheng, et autres
Publié: (2025) -
Reasoning with Reinforced Functional Token Tuning
par: Zhang, Kongcheng, et autres
Publié: (2025) -
Odyssey: Empowering Minecraft Agents with Open-World Skills
par: Liu, Shunyu, et autres
Publié: (2024) -
Unveiling Global Interactive Patterns across Graphs: Towards Interpretable Graph Neural Networks
par: Wang, Yuwen, et autres
Publié: (2024)