SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Zhengxi, Yao, Zhiyuan, Wu, Jinyang, Han, Chengcheng, Gu, Qi, Cai, Xunliang, Lu, Weiming, Xiao, Jun, Zhuang, Yueting, Shen, Yongliang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Distilled Agentic Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
von: Zhu, Jiapeng, et al.
Veröffentlicht: (2026)
von: Zhu, Jiapeng, et al.
Veröffentlicht: (2026)
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
von: Wang, Aozhe, et al.
Veröffentlicht: (2026)
von: Wang, Aozhe, et al.
Veröffentlicht: (2026)
GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
von: Wu, Zheng, et al.
Veröffentlicht: (2026)
von: Wu, Zheng, et al.
Veröffentlicht: (2026)
UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2025)
von: Lu, Zhengxi, et al.
Veröffentlicht: (2025)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
von: Tang, Fei, et al.
Veröffentlicht: (2026)
von: Tang, Fei, et al.
Veröffentlicht: (2026)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
von: Tang, Fei, et al.
Veröffentlicht: (2025)
von: Tang, Fei, et al.
Veröffentlicht: (2025)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
von: Shi, Yaorui, et al.
Veröffentlicht: (2026)
von: Shi, Yaorui, et al.
Veröffentlicht: (2026)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
von: Tang, Fei, et al.
Veröffentlicht: (2026)
von: Tang, Fei, et al.
Veröffentlicht: (2026)
UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
von: Wu, Xingyu, et al.
Veröffentlicht: (2025)
von: Wu, Xingyu, et al.
Veröffentlicht: (2025)
Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow
von: Zhang, Wenqi, et al.
Veröffentlicht: (2023)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2023)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
von: Du, Yong, et al.
Veröffentlicht: (2025)
von: Du, Yong, et al.
Veröffentlicht: (2025)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
von: Wu, Jinyang, et al.
Veröffentlicht: (2026)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
von: Yuan, Fan, et al.
Veröffentlicht: (2025)
von: Yuan, Fan, et al.
Veröffentlicht: (2025)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
von: Xu, Haolei, et al.
Veröffentlicht: (2025)
von: Xu, Haolei, et al.
Veröffentlicht: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
Let LRMs Break Free from Overthinking via Self-Braking Tuning
von: Zhao, Haoran, et al.
Veröffentlicht: (2025)
von: Zhao, Haoran, et al.
Veröffentlicht: (2025)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
von: Lyu, Shangke, et al.
Veröffentlicht: (2025)
von: Lyu, Shangke, et al.
Veröffentlicht: (2025)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
von: Xu, Haolei, et al.
Veröffentlicht: (2025)
von: Xu, Haolei, et al.
Veröffentlicht: (2025)
Structural-Temporal Coupling Anomaly Detection with Dynamic Graph Transformer
von: Zong, Chang, et al.
Veröffentlicht: (2025)
von: Zong, Chang, et al.
Veröffentlicht: (2025)
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
von: Chen, Tongbo, et al.
Veröffentlicht: (2026)
von: Chen, Tongbo, et al.
Veröffentlicht: (2026)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
von: He, Zhongyu, et al.
Veröffentlicht: (2026)
von: He, Zhongyu, et al.
Veröffentlicht: (2026)
GroundAct: Can LLM Agents Ground Actions in Environmental States?
von: Wang, Zixuan, et al.
Veröffentlicht: (2025)
von: Wang, Zixuan, et al.
Veröffentlicht: (2025)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
von: Zhang, Wenqi, et al.
Veröffentlicht: (2025)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2025)
GaVaMoE: Gaussian-Variational Gated Mixture of Experts for Explainable Recommendation
von: Tang, Fei, et al.
Veröffentlicht: (2024)
von: Tang, Fei, et al.
Veröffentlicht: (2024)
TaskBench: Benchmarking Large Language Models for Task Automation
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
von: Hong, Haitao, et al.
Veröffentlicht: (2025)
von: Hong, Haitao, et al.
Veröffentlicht: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
von: Wang, Jianing, et al.
Veröffentlicht: (2026)
von: Wang, Jianing, et al.
Veröffentlicht: (2026)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
von: Xu, Haolei, et al.
Veröffentlicht: (2026)
von: Xu, Haolei, et al.
Veröffentlicht: (2026)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
von: Tang, Fei, et al.
Veröffentlicht: (2025)
von: Tang, Fei, et al.
Veröffentlicht: (2025)
Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
von: He, Mingqian, et al.
Veröffentlicht: (2025)
von: He, Mingqian, et al.
Veröffentlicht: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2024)
$V_0$: A Generalist Value Model for Any Policy at State Zero
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2026)
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2026)
Advancing Process Verification for Large Language Models via Tree-Based Preference Learning
von: He, Mingqian, et al.
Veröffentlicht: (2024)
von: He, Mingqian, et al.
Veröffentlicht: (2024)
TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind
von: Hou, Guiyang, et al.
Veröffentlicht: (2024)
von: Hou, Guiyang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Self-Distilled Agentic Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2026) -
Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
von: Zhu, Jiapeng, et al.
Veröffentlicht: (2026) -
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
von: Wang, Aozhe, et al.
Veröffentlicht: (2026) -
GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
von: Wu, Zheng, et al.
Veröffentlicht: (2026) -
UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2025)