SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Boyuan, Fatemi, Michael Y., Jin, Xiaolong, Wang, Zora Zhiruo, Gandhi, Apurva, Song, Yueqi, Gu, Yu, Srinivasa, Jayanth, Liu, Gaowen, Neubig, Graham, Su, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inducing Programmatic Skills for Agentic Tasks
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
Go-Browse: Training Web Agents with Structured Exploration
par: Gandhi, Apurva, et autres
Publié: (2025)
par: Gandhi, Apurva, et autres
Publié: (2025)
Agent Workflow Memory
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
Training Versatile Coding Agents in Synthetic Environments
par: Zhu, Yiqi, et autres
Publié: (2025)
par: Zhu, Yiqi, et autres
Publié: (2025)
Benchmarking Failures in Tool-Augmented Language Models
par: Treviño, Eduardo, et autres
Publié: (2025)
par: Treviño, Eduardo, et autres
Publié: (2025)
CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web Navigation
par: Huq, Faria, et autres
Publié: (2025)
par: Huq, Faria, et autres
Publié: (2025)
How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance
par: Khanuja, Simran, et autres
Publié: (2024)
par: Khanuja, Simran, et autres
Publié: (2024)
Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval
par: Zhang, Yuwei, et autres
Publié: (2025)
par: Zhang, Yuwei, et autres
Publié: (2025)
Modeling Distinct Human Interaction in Web Agents
par: Huq, Faria, et autres
Publié: (2026)
par: Huq, Faria, et autres
Publié: (2026)
Diverse Score Distillation
par: Xu, Yanbo, et autres
Publié: (2024)
par: Xu, Yanbo, et autres
Publié: (2024)
Beyond Browsing: API-Based Web Agents
par: Song, Yueqi, et autres
Publié: (2024)
par: Song, Yueqi, et autres
Publié: (2024)
CodeRAG-Bench: Can Retrieval Augment Code Generation?
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
RAGGED: Towards Informed Design of Scalable and Stable RAG Systems
par: Hsia, Jennifer, et autres
Publié: (2024)
par: Hsia, Jennifer, et autres
Publié: (2024)
Recursive Agent Optimization
par: Gandhi, Apurva, et autres
Publié: (2026)
par: Gandhi, Apurva, et autres
Publié: (2026)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
par: Song, Yueqi, et autres
Publié: (2024)
par: Song, Yueqi, et autres
Publié: (2024)
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
par: Waghjale, Siddhant, et autres
Publié: (2024)
par: Waghjale, Siddhant, et autres
Publié: (2024)
Open-world Multi-label Text Classification with Extremely Weak Supervision
par: Li, Xintong, et autres
Publié: (2024)
par: Li, Xintong, et autres
Publié: (2024)
How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench
par: Mishra, Venkatesh, et autres
Publié: (2025)
par: Mishra, Venkatesh, et autres
Publié: (2025)
What Are Tools Anyway? A Survey from the Language Model Perspective
par: Wang, Zhiruo, et autres
Publié: (2024)
par: Wang, Zhiruo, et autres
Publié: (2024)
Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge Injection
par: Zhang, Yuwei, et autres
Publié: (2025)
par: Zhang, Yuwei, et autres
Publié: (2025)
FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
par: Saeidi, Amir, et autres
Publié: (2026)
par: Saeidi, Amir, et autres
Publié: (2026)
Answer is All You Need: Instruction-following Text Embedding via Answering the Question
par: Peng, Letian, et autres
Publié: (2024)
par: Peng, Letian, et autres
Publié: (2024)
A Retrieve-and-Read Framework for Knowledge Graph Link Prediction
par: Pahuja, Vardaan, et autres
Publié: (2022)
par: Pahuja, Vardaan, et autres
Publié: (2022)
ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition
par: Kulkarni, Anay, et autres
Publié: (2026)
par: Kulkarni, Anay, et autres
Publié: (2026)
Epistemic Skills: Logical Dynamics of Knowing and Forgetting
par: Liang, Xiaolong, et autres
Publié: (2024)
par: Liang, Xiaolong, et autres
Publié: (2024)
AutoPresent: Designing Structured Visuals from Scratch
par: Ge, Jiaxin, et autres
Publié: (2025)
par: Ge, Jiaxin, et autres
Publié: (2025)
Hone Your Job Search Skills
Publié: (2024)
Publié: (2024)
Epistemic Skills: Reasoning about Knowledge and Oblivion
par: Liang, Xiaolong, et autres
Publié: (2025)
par: Liang, Xiaolong, et autres
Publié: (2025)
Investigating the Shortcomings of LLMs in Step-by-Step Legal Reasoning
par: Mishra, Venkatesh, et autres
Publié: (2025)
par: Mishra, Venkatesh, et autres
Publié: (2025)
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
par: Nyandwi, Jean de Dieu, et autres
Publié: (2025)
par: Nyandwi, Jean de Dieu, et autres
Publié: (2025)
ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory
par: Xiao, Yunzhong, et autres
Publié: (2025)
par: Xiao, Yunzhong, et autres
Publié: (2025)
Better Synthetic Data by Retrieving and Transforming Existing Datasets
par: Gandhi, Saumya, et autres
Publié: (2024)
par: Gandhi, Saumya, et autres
Publié: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
par: Zhou, Kaiwen, et autres
Publié: (2025)
par: Zhou, Kaiwen, et autres
Publié: (2025)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
par: Yin, Fan, et autres
Publié: (2024)
par: Yin, Fan, et autres
Publié: (2024)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
par: Song, Yueqi, et autres
Publié: (2025)
par: Song, Yueqi, et autres
Publié: (2025)
Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO
par: Tian, Yu, et autres
Publié: (2026)
par: Tian, Yu, et autres
Publié: (2026)
Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex Environments
par: Gu, Yu, et autres
Publié: (2024)
par: Gu, Yu, et autres
Publié: (2024)
The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1
par: Zhou, Kaiwen, et autres
Publié: (2025)
par: Zhou, Kaiwen, et autres
Publié: (2025)
Documents similaires
-
Inducing Programmatic Skills for Agentic Tasks
par: Wang, Zora Zhiruo, et autres
Publié: (2025) -
Go-Browse: Training Web Agents with Structured Exploration
par: Gandhi, Apurva, et autres
Publié: (2025) -
Agent Workflow Memory
par: Wang, Zora Zhiruo, et autres
Publié: (2024) -
Training Versatile Coding Agents in Synthetic Environments
par: Zhu, Yiqi, et autres
Publié: (2025) -
Benchmarking Failures in Tool-Augmented Language Models
par: Treviño, Eduardo, et autres
Publié: (2025)