LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Siyuan, Zhang, Gaokai, Zhang, Li Lyna, Shang, Ning, Yang, Fan, Chen, Dongyao, Yang, Mao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LongRoPE2: Near-Lossless LLM Context Window Scaling
por: Shang, Ning, et al.
Publicado: (2025)
por: Shang, Ning, et al.
Publicado: (2025)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
por: Huang, Xijie, et al.
Publicado: (2023)
por: Huang, Xijie, et al.
Publicado: (2023)
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
por: Ding, Yiran, et al.
Publicado: (2024)
por: Ding, Yiran, et al.
Publicado: (2024)
rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset
por: Liu, Yifei, et al.
Publicado: (2025)
por: Liu, Yifei, et al.
Publicado: (2025)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
por: Guan, Xinyu, et al.
Publicado: (2025)
por: Guan, Xinyu, et al.
Publicado: (2025)
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers
por: Qi, Zhenting, et al.
Publicado: (2024)
por: Qi, Zhenting, et al.
Publicado: (2024)
Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection
por: Wang, Yutong, et al.
Publicado: (2026)
por: Wang, Yutong, et al.
Publicado: (2026)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
por: Du, Dong, et al.
Publicado: (2025)
por: Du, Dong, et al.
Publicado: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
por: Chen, Zhuoen, et al.
Publicado: (2026)
por: Chen, Zhuoen, et al.
Publicado: (2026)
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
por: Song, Mingyang, et al.
Publicado: (2025)
por: Song, Mingyang, et al.
Publicado: (2025)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
por: Lei, Xuanyu, et al.
Publicado: (2025)
por: Lei, Xuanyu, et al.
Publicado: (2025)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
por: Lv, Minxuan, et al.
Publicado: (2026)
por: Lv, Minxuan, et al.
Publicado: (2026)
rStar2-Agent: Agentic Reasoning Technical Report
por: Shang, Ning, et al.
Publicado: (2025)
por: Shang, Ning, et al.
Publicado: (2025)
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
por: Wan, Fanqi, et al.
Publicado: (2025)
por: Wan, Fanqi, et al.
Publicado: (2025)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
por: Ling, Zhan, et al.
Publicado: (2025)
por: Ling, Zhan, et al.
Publicado: (2025)
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
por: Shi, Yaorui, et al.
Publicado: (2025)
por: Shi, Yaorui, et al.
Publicado: (2025)
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
por: Wei, Yuxiang, et al.
Publicado: (2025)
por: Wei, Yuxiang, et al.
Publicado: (2025)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
por: Wu, Jinyang, et al.
Publicado: (2025)
por: Wu, Jinyang, et al.
Publicado: (2025)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
por: Ping, Bowen, et al.
Publicado: (2026)
por: Ping, Bowen, et al.
Publicado: (2026)
PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts
por: Yu, Mo, et al.
Publicado: (2025)
por: Yu, Mo, et al.
Publicado: (2025)
ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
por: Chen, Jianghao, et al.
Publicado: (2025)
por: Chen, Jianghao, et al.
Publicado: (2025)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
por: Lu, Xingyu, et al.
Publicado: (2026)
por: Lu, Xingyu, et al.
Publicado: (2026)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
por: Xu, Xin, et al.
Publicado: (2026)
por: Xu, Xin, et al.
Publicado: (2026)
Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
por: Seed, ByteDance, et al.
Publicado: (2025)
por: Seed, ByteDance, et al.
Publicado: (2025)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
por: Chen, Guanzheng, et al.
Publicado: (2026)
por: Chen, Guanzheng, et al.
Publicado: (2026)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
por: Chen, Jierun, et al.
Publicado: (2025)
por: Chen, Jierun, et al.
Publicado: (2025)
Segment-Level Attribution for Selective Learning of Long Reasoning Traces
por: Wang, Siyuan, et al.
Publicado: (2026)
por: Wang, Siyuan, et al.
Publicado: (2026)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
por: Yang, Ziyi, et al.
Publicado: (2025)
por: Yang, Ziyi, et al.
Publicado: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
por: Peng, Miao, et al.
Publicado: (2026)
por: Peng, Miao, et al.
Publicado: (2026)
Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval
por: Zhang, Yuwei, et al.
Publicado: (2025)
por: Zhang, Yuwei, et al.
Publicado: (2025)
Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation
por: Chen, Jiamin, et al.
Publicado: (2025)
por: Chen, Jiamin, et al.
Publicado: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
por: Deng, Hexuan, et al.
Publicado: (2025)
por: Deng, Hexuan, et al.
Publicado: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
por: Li, Haozhan, et al.
Publicado: (2025)
por: Li, Haozhan, et al.
Publicado: (2025)
LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism
por: Gu, Diandian, et al.
Publicado: (2024)
por: Gu, Diandian, et al.
Publicado: (2024)
TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
por: Shi, Yucheng, et al.
Publicado: (2025)
por: Shi, Yucheng, et al.
Publicado: (2025)
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
por: Ji, Mengmeng, et al.
Publicado: (2026)
por: Ji, Mengmeng, et al.
Publicado: (2026)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning
por: Acikgoz, Emre Can, et al.
Publicado: (2025)
por: Acikgoz, Emre Can, et al.
Publicado: (2025)
Ejemplares similares
-
LongRoPE2: Near-Lossless LLM Context Window Scaling
por: Shang, Ning, et al.
Publicado: (2025) -
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
por: Huang, Xijie, et al.
Publicado: (2023) -
LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
por: Ding, Yiran, et al.
Publicado: (2024) -
rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset
por: Liu, Yifei, et al.
Publicado: (2025) -
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
por: Guan, Xinyu, et al.
Publicado: (2025)