Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Junhao, Zhang, Teng, Zhao, Xiaoyan, Cheng, Hong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CARL: Criticality-Aware Agentic Reinforcement Learning
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
von: Xiao, Teng, et al.
Veröffentlicht: (2026)
von: Xiao, Teng, et al.
Veröffentlicht: (2026)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
Self-Distilled Agentic Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
von: Zou, Jiaru, et al.
Veröffentlicht: (2025)
Skill Set Optimization: Reinforcing Language Model Behavior via Transferable Skills
von: Nottingham, Kolby, et al.
Veröffentlicht: (2024)
von: Nottingham, Kolby, et al.
Veröffentlicht: (2024)
Agentic Reinforcement Learning for Real-World Code Repair
von: Zhu, Siyu, et al.
Veröffentlicht: (2025)
von: Zhu, Siyu, et al.
Veröffentlicht: (2025)
Agentic Reinforced Policy Optimization
von: Dong, Guanting, et al.
Veröffentlicht: (2025)
von: Dong, Guanting, et al.
Veröffentlicht: (2025)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
von: Wu, Xixi, et al.
Veröffentlicht: (2026)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2026)
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2026)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
von: Chen, Zhengyu, et al.
Veröffentlicht: (2025)
von: Chen, Zhengyu, et al.
Veröffentlicht: (2025)
Internalizing World Models via Self-Play Finetuning for Agentic RL
von: Chen, Shiqi, et al.
Veröffentlicht: (2025)
von: Chen, Shiqi, et al.
Veröffentlicht: (2025)
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
von: Jiang, Guochao, et al.
Veröffentlicht: (2026)
von: Jiang, Guochao, et al.
Veröffentlicht: (2026)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
von: Shen, Yiyang, et al.
Veröffentlicht: (2026)
von: Shen, Yiyang, et al.
Veröffentlicht: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
von: Xu, Ran, et al.
Veröffentlicht: (2025)
von: Xu, Ran, et al.
Veröffentlicht: (2025)
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
von: Zhong, Shanshan, et al.
Veröffentlicht: (2026)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2026)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
von: Xu, Ran, et al.
Veröffentlicht: (2026)
von: Xu, Ran, et al.
Veröffentlicht: (2026)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
von: Liu, Chi, et al.
Veröffentlicht: (2025)
von: Liu, Chi, et al.
Veröffentlicht: (2025)
Can LLMs Learn New Concepts Incrementally without Forgetting?
von: Zheng, Junhao, et al.
Veröffentlicht: (2024)
von: Zheng, Junhao, et al.
Veröffentlicht: (2024)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
von: Tang, Xinyu, et al.
Veröffentlicht: (2025)
SAGE-32B: Agentic Reasoning via Iterative Distillation
von: Jha, Basab, et al.
Veröffentlicht: (2026)
von: Jha, Basab, et al.
Veröffentlicht: (2026)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
von: Zhang, Haozhen, et al.
Veröffentlicht: (2026)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2026)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
von: Wang, Siwei, et al.
Veröffentlicht: (2025)
von: Wang, Siwei, et al.
Veröffentlicht: (2025)
MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
von: Wang, Ziqing, et al.
Veröffentlicht: (2026)
von: Wang, Ziqing, et al.
Veröffentlicht: (2026)
Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
von: Zhang, Jinghao, et al.
Veröffentlicht: (2025)
von: Zhang, Jinghao, et al.
Veröffentlicht: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
von: Chen, Yi, et al.
Veröffentlicht: (2025)
von: Chen, Yi, et al.
Veröffentlicht: (2025)
AFlow: Automating Agentic Workflow Generation
von: Zhang, Jiayi, et al.
Veröffentlicht: (2024)
von: Zhang, Jiayi, et al.
Veröffentlicht: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
PEARL: Towards Permutation-Resilient LLMs
von: Chen, Liang, et al.
Veröffentlicht: (2025)
von: Chen, Liang, et al.
Veröffentlicht: (2025)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
von: Lu, Zhicong, et al.
Veröffentlicht: (2026)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
von: Min, Do June, et al.
Veröffentlicht: (2024)
von: Min, Do June, et al.
Veröffentlicht: (2024)
Towards Lifelong Learning of Large Language Models: A Survey
von: Zheng, Junhao, et al.
Veröffentlicht: (2024)
von: Zheng, Junhao, et al.
Veröffentlicht: (2024)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
von: Shi, Taiwei, et al.
Veröffentlicht: (2025)
von: Shi, Taiwei, et al.
Veröffentlicht: (2025)
ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
von: Bian, Tingcheng, et al.
Veröffentlicht: (2026)
von: Bian, Tingcheng, et al.
Veröffentlicht: (2026)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
Can Models Learn Skill Composition from Examples?
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CARL: Criticality-Aware Agentic Reinforcement Learning
von: Shen, Leyang, et al.
Veröffentlicht: (2025) -
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
von: Xiao, Teng, et al.
Veröffentlicht: (2026) -
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
von: Wu, Jinyang, et al.
Veröffentlicht: (2026) -
Self-Distilled Agentic Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026) -
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)