SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Shanshan, Lu, Yi, Ning, Jingjie, Wan, Yibing, Feng, Lihan, Ao, Yuyi, Ribeiro, Leonardo F. R., Dreyer, Markus, Ammirati, Sean, Xiong, Chenyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web
di: Zhong, Shanshan, et al.
Pubblicazione: (2026)
di: Zhong, Shanshan, et al.
Pubblicazione: (2026)
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
di: Lei, Yingtie, et al.
Pubblicazione: (2026)
di: Lei, Yingtie, et al.
Pubblicazione: (2026)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
di: Han, Tingxu, et al.
Pubblicazione: (2026)
di: Han, Tingxu, et al.
Pubblicazione: (2026)
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
di: Zhou, Yifan, et al.
Pubblicazione: (2026)
di: Zhou, Yifan, et al.
Pubblicazione: (2026)
Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes
di: Ning, Jingjie, et al.
Pubblicazione: (2026)
di: Ning, Jingjie, et al.
Pubblicazione: (2026)
Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality
di: Ling, George, et al.
Pubblicazione: (2026)
di: Ling, George, et al.
Pubblicazione: (2026)
What Generative Search Engines Like and How to Optimize Web Content Cooperatively
di: Wu, Yujiang, et al.
Pubblicazione: (2025)
di: Wu, Yujiang, et al.
Pubblicazione: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
FunBench: Benchmarking Fundus Reading Skills of MLLMs
di: Wei, Qijie, et al.
Pubblicazione: (2025)
di: Wei, Qijie, et al.
Pubblicazione: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests
di: Ning, Jingjie, et al.
Pubblicazione: (2026)
di: Ning, Jingjie, et al.
Pubblicazione: (2026)
Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning
di: Chen, Chishui, et al.
Pubblicazione: (2026)
di: Chen, Chishui, et al.
Pubblicazione: (2026)
SkillEvolver: Skill Learning as a Meta-Skill
di: Zhang, Genrui, et al.
Pubblicazione: (2026)
di: Zhang, Genrui, et al.
Pubblicazione: (2026)
The Role of Skills and Tasks in Gender Gaps in Latin America
di: Cristian Bonavida, et al.
Pubblicazione: (2026)
di: Cristian Bonavida, et al.
Pubblicazione: (2026)
The Future of Skill: What Is It to Be Skilled at Work?
di: Niklasson, Axel, et al.
Pubblicazione: (2024)
di: Niklasson, Axel, et al.
Pubblicazione: (2024)
SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks
di: Wen, Yongyan, et al.
Pubblicazione: (2024)
di: Wen, Yongyan, et al.
Pubblicazione: (2024)
Continual Robot Skill and Task Learning via Dialogue
di: Gu, Weiwei, et al.
Pubblicazione: (2024)
di: Gu, Weiwei, et al.
Pubblicazione: (2024)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
di: Kang, Hao, et al.
Pubblicazione: (2024)
di: Kang, Hao, et al.
Pubblicazione: (2024)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
di: Wang, Tevin, et al.
Pubblicazione: (2025)
di: Wang, Tevin, et al.
Pubblicazione: (2025)
Learning to Plan & Schedule with Reinforcement-Learned Bimanual Robot Skills
di: Wan, Weikang, et al.
Pubblicazione: (2025)
di: Wan, Weikang, et al.
Pubblicazione: (2025)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
di: Hao, Ce, et al.
Pubblicazione: (2023)
di: Hao, Ce, et al.
Pubblicazione: (2023)
ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills
di: He, Tairan, et al.
Pubblicazione: (2025)
di: He, Tairan, et al.
Pubblicazione: (2025)
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?
di: Chen, Shiqi, et al.
Pubblicazione: (2026)
di: Chen, Shiqi, et al.
Pubblicazione: (2026)
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
di: Cui, Fan, et al.
Pubblicazione: (2026)
di: Cui, Fan, et al.
Pubblicazione: (2026)
A semi-automatic procedure for 3D survey of cultural heritage objects: the case of the archaeological Dynamic Collections
di: Ammirati, Luisa
Pubblicazione: (2023)
di: Ammirati, Luisa
Pubblicazione: (2023)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
Tasks, Skills, and Institutions
Pubblicazione: (2023)
Pubblicazione: (2023)
Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation
di: Zhu, Yihang, et al.
Pubblicazione: (2025)
di: Zhu, Yihang, et al.
Pubblicazione: (2025)
Incremental Learning of Retrievable Skills For Efficient Continual Task Adaptation
di: Lee, Daehee, et al.
Pubblicazione: (2024)
di: Lee, Daehee, et al.
Pubblicazione: (2024)
DexSkills: Skill Segmentation Using Haptic Data for Learning Autonomous Long-Horizon Robotic Manipulation Tasks
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
SkillTester: Benchmarking Utility and Security of Agent Skills
di: Wang, Leye, et al.
Pubblicazione: (2026)
di: Wang, Leye, et al.
Pubblicazione: (2026)
SkillTrade A Website For Learning New Skills
di: Purushotham, Rajanala, et al.
Pubblicazione: (2025)
di: Purushotham, Rajanala, et al.
Pubblicazione: (2025)
LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks
di: Chandwani, Abhishek, et al.
Pubblicazione: (2026)
di: Chandwani, Abhishek, et al.
Pubblicazione: (2026)
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
Physics of Skill Learning
di: Liu, Ziming, et al.
Pubblicazione: (2025)
di: Liu, Ziming, et al.
Pubblicazione: (2025)
Learning Skills: Elementary.
Pubblicazione: (1980)
Pubblicazione: (1980)
Learning Skills: Secondary.
Pubblicazione: (1980)
Pubblicazione: (1980)
Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model
di: Hu, Zhaofeng, et al.
Pubblicazione: (2025)
di: Hu, Zhaofeng, et al.
Pubblicazione: (2025)
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
di: Jin, Chang, et al.
Pubblicazione: (2026)
di: Jin, Chang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web
di: Zhong, Shanshan, et al.
Pubblicazione: (2026) -
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
di: Li, Xiangyi, et al.
Pubblicazione: (2026) -
SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
di: Lei, Yingtie, et al.
Pubblicazione: (2026) -
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
di: Han, Tingxu, et al.
Pubblicazione: (2026) -
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
di: Zhou, Yifan, et al.
Pubblicazione: (2026)