SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
Fuente:
arXiv
Saved in:
| Main Authors: | Lei, Yingtie, Wan, Zhongwei, Zhang, Jiankun, Alam, Samiul, Zhong, Zixuan, Huang, Peizhou, Wang, Xin, Zhang, Jingxuan, Zhou, Donghao, Hsieh, Yunta, Dou, Zhihao, Shen, Hui, Xu, Yan, Dimitriadis, Dimitrios, Zhang, Tuo, Zhang, Mi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
by: Huang, Peizhou, et al.
Published: (2026)
by: Huang, Peizhou, et al.
Published: (2026)
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
by: Zhang, Jingxuan, et al.
Published: (2026)
by: Zhang, Jingxuan, et al.
Published: (2026)
GPT-FL: Generative Pre-trained Model-Assisted Federated Learning
by: Zhang, Tuo, et al.
Published: (2023)
by: Zhang, Tuo, et al.
Published: (2023)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
by: Wan, Zhongwei, et al.
Published: (2026)
by: Wan, Zhongwei, et al.
Published: (2026)
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
Leveraging Uncertainty Estimation for Efficient LLM Routing
by: Zhang, Tuo, et al.
Published: (2025)
by: Zhang, Tuo, et al.
Published: (2025)
The Internet of Things in the Era of Generative AI: Vision and Challenges
by: Wang, Xin, et al.
Published: (2024)
by: Wang, Xin, et al.
Published: (2024)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
by: Jiang, Yukun, et al.
Published: (2026)
by: Jiang, Yukun, et al.
Published: (2026)
From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution
by: Wang, Junjie, et al.
Published: (2026)
by: Wang, Junjie, et al.
Published: (2026)
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
by: Zhou, Yifan, et al.
Published: (2026)
by: Zhou, Yifan, et al.
Published: (2026)
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents
by: Mi, Qirui, et al.
Published: (2026)
by: Mi, Qirui, et al.
Published: (2026)
MMSpec: Benchmarking Speculative Decoding for Vision-Language Models
by: Shen, Hui, et al.
Published: (2026)
by: Shen, Hui, et al.
Published: (2026)
Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study
by: Jing, Yixiao, et al.
Published: (2026)
by: Jing, Yixiao, et al.
Published: (2026)
PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement
by: Zhang, Tuo, et al.
Published: (2026)
by: Zhang, Tuo, et al.
Published: (2026)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
by: Jin, Chang, et al.
Published: (2026)
by: Jin, Chang, et al.
Published: (2026)
An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration
by: Zhang, Dutao, et al.
Published: (2026)
by: Zhang, Dutao, et al.
Published: (2026)
ModSkill: Physical Character Skill Modularization
by: Huang, Yiming, et al.
Published: (2025)
by: Huang, Yiming, et al.
Published: (2025)
ProSkill: Segment-Level Skill Assessment in Procedural Videos
by: Mazzamuto, Michele, et al.
Published: (2026)
by: Mazzamuto, Michele, et al.
Published: (2026)
ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations
by: Zhu, Jie, et al.
Published: (2026)
by: Zhu, Jie, et al.
Published: (2026)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
by: Li, Sijia, et al.
Published: (2025)
by: Li, Sijia, et al.
Published: (2025)
SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision
by: Liu, Yuxuan, et al.
Published: (2026)
by: Liu, Yuxuan, et al.
Published: (2026)
Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
SkillEvolver: Skill Learning as a Meta-Skill
by: Zhang, Genrui, et al.
Published: (2026)
by: Zhang, Genrui, et al.
Published: (2026)
UI-Evol: Automatic Knowledge Evolving for Computer Use Agents
by: Zhang, Ziyun, et al.
Published: (2025)
by: Zhang, Ziyun, et al.
Published: (2025)
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
A Self-Attention-Driven Deep Denoiser Model for Real Time Lung Sound Denoising in Noisy Environments
by: Shuvo, Samiul Based, et al.
Published: (2024)
by: Shuvo, Samiul Based, et al.
Published: (2024)
SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos
by: Huang, Xiyang, et al.
Published: (2026)
by: Huang, Xiyang, et al.
Published: (2026)
"Do Not Mention This to the User": Detecting and Understanding Malicious Agent Skills
by: Liu, Yi, et al.
Published: (2026)
by: Liu, Yi, et al.
Published: (2026)
FedAIoT: A Federated Learning Benchmark for Artificial Intelligence of Things
by: Alam, Samiul, et al.
Published: (2023)
by: Alam, Samiul, et al.
Published: (2023)
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
by: Li, Xiangyi, et al.
Published: (2026)
by: Li, Xiangyi, et al.
Published: (2026)
Efficient Large Language Models: A Survey
by: Wan, Zhongwei, et al.
Published: (2023)
by: Wan, Zhongwei, et al.
Published: (2023)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
by: Zhang, Haozhen, et al.
Published: (2026)
by: Zhang, Haozhen, et al.
Published: (2026)
Procedural Skills and Emergency Medicine Common Program Requirements: It's Time to Address Skill Decay
by: Nicholas Pokrajac, et al.
Published: (2025)
by: Nicholas Pokrajac, et al.
Published: (2025)
SkillOrchestra: Learning to Route Agents via Skill Transfer
by: Wang, Jiayu, et al.
Published: (2026)
by: Wang, Jiayu, et al.
Published: (2026)
Effective Procedures for Teaching Reference Study Skills.
by: Cushenbery, Donald C.
Published: (1979)
by: Cushenbery, Donald C.
Published: (1979)
Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries
by: Zeng, Kun, et al.
Published: (2026)
by: Zeng, Kun, et al.
Published: (2026)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
by: Chen, Zhihao, et al.
Published: (2026)
by: Chen, Zhihao, et al.
Published: (2026)
Labor Market Adaptive Skill Transition Optimization: A Formalized Algorithmic Framework Inspired by Labor Market & Skill Transition Research
by: Zhang, Jincheng
Published: (2025)
by: Zhang, Jincheng
Published: (2025)
RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis
by: Tao, Zhengwei, et al.
Published: (2026)
by: Tao, Zhengwei, et al.
Published: (2026)
Similar Items
-
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
by: Huang, Peizhou, et al.
Published: (2026) -
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
by: Zhang, Jingxuan, et al.
Published: (2026) -
GPT-FL: Generative Pre-trained Model-Assisted Federated Learning
by: Zhang, Tuo, et al.
Published: (2023) -
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
by: Wan, Zhongwei, et al.
Published: (2026) -
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression
by: Wang, Xin, et al.
Published: (2025)