RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Dong, Yihong, Jiang, Xue, Tao, Yongding, Liu, Huanyu, Zhang, Kechi, Mou, Lili, Cao, Rongyu, Ma, Yingwei, Chen, Jue, Li, Binhua, Jin, Zhi, Huang, Fei, Li, Yongbin, Li, Ge |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
por: Ma, Yingwei, et al.
Publicado: (2025)
por: Ma, Yingwei, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues
por: Lin, Yalan, et al.
Publicado: (2024)
por: Lin, Yalan, et al.
Publicado: (2024)
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
por: Ma, Yingwei, et al.
Publicado: (2024)
por: Ma, Yingwei, et al.
Publicado: (2024)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
por: Liu, Huanyu, et al.
Publicado: (2025)
por: Liu, Huanyu, et al.
Publicado: (2025)
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion?
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
Format-Adapter: Improving Reasoning Capability of LLMs by Adapting Suitable Format
por: Wang, Dingzirui, et al.
Publicado: (2025)
por: Wang, Dingzirui, et al.
Publicado: (2025)
Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement
por: Ma, Yingwei, et al.
Publicado: (2024)
por: Ma, Yingwei, et al.
Publicado: (2024)
Large Language Model Unlearning for Source Code
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
Do Code LLMs Understand Design Patterns?
por: Pan, Zhenyu, et al.
Publicado: (2025)
por: Pan, Zhenyu, et al.
Publicado: (2025)
ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
por: Liu, Huanyu, et al.
Publicado: (2025)
por: Liu, Huanyu, et al.
Publicado: (2025)
Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
por: Cheng, Jie, et al.
Publicado: (2024)
por: Cheng, Jie, et al.
Publicado: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling
por: Dong, Yihong, et al.
Publicado: (2025)
por: Dong, Yihong, et al.
Publicado: (2025)
Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model
por: Dong, Yihong, et al.
Publicado: (2025)
por: Dong, Yihong, et al.
Publicado: (2025)
aiXcoder-7B-v2: Training LLMs to Fully Utilize the Long Context in Repository-level Code Completion
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
FAN: Fourier Analysis Networks
por: Dong, Yihong, et al.
Publicado: (2024)
por: Dong, Yihong, et al.
Publicado: (2024)
In-Context Transfer Learning: Demonstration Synthesis by Transferring Similar Tasks
por: Wang, Dingzirui, et al.
Publicado: (2024)
por: Wang, Dingzirui, et al.
Publicado: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
IntentCoding: Amplifying User Intent in Code Generation
por: Fang, Zheng, et al.
Publicado: (2026)
por: Fang, Zheng, et al.
Publicado: (2026)
From I/O to Code with Discovery Agent
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing
por: Cheng, Wei, et al.
Publicado: (2026)
por: Cheng, Wei, et al.
Publicado: (2026)
Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search
por: Li, Guochang, et al.
Publicado: (2025)
por: Li, Guochang, et al.
Publicado: (2025)
Think Anywhere in Code Generation
por: Jiang, Xue, et al.
Publicado: (2026)
por: Jiang, Xue, et al.
Publicado: (2026)
StackTrans: From Large Language Model to Large Pushdown Automata Model
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
HiRoPE: Length Extrapolation for Code Models Using Hierarchical Position
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration
por: Wang, Yunkun, et al.
Publicado: (2025)
por: Wang, Yunkun, et al.
Publicado: (2025)
A Survey on Code Generation with LLM-based Agents
por: Dong, Yihong, et al.
Publicado: (2025)
por: Dong, Yihong, et al.
Publicado: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration
por: Wang, Yunkun, et al.
Publicado: (2024)
por: Wang, Yunkun, et al.
Publicado: (2024)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
Do Transformers Have the Ability for Periodicity Generalization?
por: Liu, Huanyu, et al.
Publicado: (2026)
por: Liu, Huanyu, et al.
Publicado: (2026)
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
Rethinking Repetition Problems of LLMs in Code Generation
por: Dong, Yihong, et al.
Publicado: (2025)
por: Dong, Yihong, et al.
Publicado: (2025)
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence
por: Hou, Guiyang, et al.
Publicado: (2025)
por: Hou, Guiyang, et al.
Publicado: (2025)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
por: Yang, Jiaxi, et al.
Publicado: (2023)
por: Yang, Jiaxi, et al.
Publicado: (2023)
RAGEN-2: Reasoning Collapse in Agentic RL
por: Wang, Zihan, et al.
Publicado: (2026)
por: Wang, Zihan, et al.
Publicado: (2026)
Ejemplares similares
-
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
por: Jiang, Xue, et al.
Publicado: (2025) -
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
por: Ma, Yingwei, et al.
Publicado: (2025) -
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025) -
LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues
por: Lin, Yalan, et al.
Publicado: (2024) -
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
por: Ma, Yingwei, et al.
Publicado: (2024)