SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Ziyi, Shen, Weizhou, Li, Chenliang, Chen, Ruijun, Wan, Fanqi, Yan, Ming, Quan, Xiaojun, Huang, Fei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
by: Wan, Fanqi, et al.
Published: (2025)
by: Wan, Fanqi, et al.
Published: (2025)
FuseChat: Knowledge Fusion of Chat Models
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
BlockPruner: Fine-grained Pruning for Large Language Models
by: Zhong, Longguang, et al.
Published: (2024)
by: Zhong, Longguang, et al.
Published: (2024)
Self-Evolution Fine-Tuning for Policy Optimization
by: Chen, Ruijun, et al.
Published: (2024)
by: Chen, Ruijun, et al.
Published: (2024)
SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
by: Chen, Hongzhan, et al.
Published: (2024)
by: Chen, Hongzhan, et al.
Published: (2024)
ProFuser: Progressive Fusion of Large Language Models
by: Shi, Tianyuan, et al.
Published: (2024)
by: Shi, Tianyuan, et al.
Published: (2024)
Knowledge Distillation of Black-Box Large Language Models
by: Chen, Hongzhan, et al.
Published: (2024)
by: Chen, Hongzhan, et al.
Published: (2024)
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
by: Shen, Weizhou, et al.
Published: (2025)
by: Shen, Weizhou, et al.
Published: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
by: Peng, Miao, et al.
Published: (2026)
by: Peng, Miao, et al.
Published: (2026)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
by: Sun, Huashan, et al.
Published: (2025)
by: Sun, Huashan, et al.
Published: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
by: Yang, Ziyi, et al.
Published: (2024)
by: Yang, Ziyi, et al.
Published: (2024)
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
by: Shen, Weizhou, et al.
Published: (2024)
by: Shen, Weizhou, et al.
Published: (2024)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
by: Lei, Xuanyu, et al.
Published: (2025)
by: Lei, Xuanyu, et al.
Published: (2025)
FuseChat-3.0: Preference Optimization Meets Heterogeneous Model Fusion
by: Yang, Ziyi, et al.
Published: (2025)
by: Yang, Ziyi, et al.
Published: (2025)
Mutual-Taught for Co-adapting Policy and Reward Models
by: Shi, Tianyuan, et al.
Published: (2025)
by: Shi, Tianyuan, et al.
Published: (2025)
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
by: Shen, Weizhou, et al.
Published: (2025)
by: Shen, Weizhou, et al.
Published: (2025)
FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
by: Zhong, Longguang, et al.
Published: (2025)
by: Zhong, Longguang, et al.
Published: (2025)
Knowledge Fusion of Chat LLMs: A Preliminary Technical Report
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
by: Lu, Zhiyuan, et al.
Published: (2026)
by: Lu, Zhiyuan, et al.
Published: (2026)
Knowledge Fusion of Large Language Models
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
by: Gao, Shiping, et al.
Published: (2025)
by: Gao, Shiping, et al.
Published: (2025)
Lookahead Routing for Large Language Models
by: Huang, Canbin, et al.
Published: (2025)
by: Huang, Canbin, et al.
Published: (2025)
ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
by: Liu, Tianjian, et al.
Published: (2025)
by: Liu, Tianjian, et al.
Published: (2025)
VisPlay: Self-Evolving Vision-Language Models from Images
by: He, Yicheng, et al.
Published: (2025)
by: He, Yicheng, et al.
Published: (2025)
Knowledge Verification to Nip Hallucination in the Bud
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
by: Luo, Fuwen, et al.
Published: (2025)
by: Luo, Fuwen, et al.
Published: (2025)
PsyPlay: Personality-Infused Role-Playing Conversational Agents
by: Yang, Tao, et al.
Published: (2025)
by: Yang, Tao, et al.
Published: (2025)
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
by: Ren, Qingyu, et al.
Published: (2026)
by: Ren, Qingyu, et al.
Published: (2026)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
A Controllable Examination for Long-Context Language Models
by: Yang, Yijun, et al.
Published: (2025)
by: Yang, Yijun, et al.
Published: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
by: Chen, Hongzhan, et al.
Published: (2025)
by: Chen, Hongzhan, et al.
Published: (2025)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
by: Zhang, Qizheng, et al.
Published: (2025)
by: Zhang, Qizheng, et al.
Published: (2025)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
by: Zhang, Xu, et al.
Published: (2024)
by: Zhang, Xu, et al.
Published: (2024)
ThinkSwitcher: When to Think Hard, When to Think Fast
by: Liang, Guosheng, et al.
Published: (2025)
by: Liang, Guosheng, et al.
Published: (2025)
Language Models as Continuous Self-Evolving Data Engineers
by: Wang, Peidong, et al.
Published: (2024)
by: Wang, Peidong, et al.
Published: (2024)
COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
by: Wan, Guangya, et al.
Published: (2025)
by: Wan, Guangya, et al.
Published: (2025)
Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
by: Liu, Zijun, et al.
Published: (2025)
by: Liu, Zijun, et al.
Published: (2025)
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
by: Yang, Cheng, et al.
Published: (2025)
by: Yang, Cheng, et al.
Published: (2025)
Training-Free Long-Context Scaling of Large Language Models
by: An, Chenxin, et al.
Published: (2024)
by: An, Chenxin, et al.
Published: (2024)
TSUBASA: Improving Long-Horizon Personalization via Evolving Memory and Self-Learning with Context Distillation
by: Zhang, Xinliang Frederick, et al.
Published: (2026)
by: Zhang, Xinliang Frederick, et al.
Published: (2026)
Similar Items
-
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
by: Wan, Fanqi, et al.
Published: (2025) -
FuseChat: Knowledge Fusion of Chat Models
by: Wan, Fanqi, et al.
Published: (2024) -
BlockPruner: Fine-grained Pruning for Large Language Models
by: Zhong, Longguang, et al.
Published: (2024) -
Self-Evolution Fine-Tuning for Policy Optimization
by: Chen, Ruijun, et al.
Published: (2024) -
SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
by: Chen, Hongzhan, et al.
Published: (2024)