What Are Tools Anyway? A Survey from the Language Model Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhiruo, Cheng, Zhoujun, Zhu, Hao, Fried, Daniel, Neubig, Graham |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic Tasks
par: Wang, Zhiruo, et autres
Publié: (2024)
par: Wang, Zhiruo, et autres
Publié: (2024)
How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
par: Waghjale, Siddhant, et autres
Publié: (2024)
par: Waghjale, Siddhant, et autres
Publié: (2024)
API-Assisted Code Generation for Question Answering on Varied Table Structures
par: Cao, Yihan, et autres
Publié: (2023)
par: Cao, Yihan, et autres
Publié: (2023)
Agent Workflow Memory
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
Inducing Programmatic Skills for Agentic Tasks
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
par: Wang, Zora Zhiruo, et autres
Publié: (2025)
Benchmarking Failures in Tool-Augmented Language Models
par: Treviño, Eduardo, et autres
Publié: (2025)
par: Treviño, Eduardo, et autres
Publié: (2025)
Effective Strategies for Asynchronous Software Engineering Agents
par: Geng, Jiayi, et autres
Publié: (2026)
par: Geng, Jiayi, et autres
Publié: (2026)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web Navigation
par: Huq, Faria, et autres
Publié: (2025)
par: Huq, Faria, et autres
Publié: (2025)
SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents
par: Zhou, Xuhui, et autres
Publié: (2023)
par: Zhou, Xuhui, et autres
Publié: (2023)
Training Versatile Coding Agents in Synthetic Environments
par: Zhu, Yiqi, et autres
Publié: (2025)
par: Zhu, Yiqi, et autres
Publié: (2025)
Language Modeling with Editable External Knowledge
par: Li, Belinda Z., et autres
Publié: (2024)
par: Li, Belinda Z., et autres
Publié: (2024)
Tool Learning with Large Language Models: A Survey
par: Qu, Changle, et autres
Publié: (2024)
par: Qu, Changle, et autres
Publié: (2024)
H2HTalk: Evaluating Large Language Models as Emotional Companion
par: Wang, Boyang, et autres
Publié: (2025)
par: Wang, Boyang, et autres
Publié: (2025)
WebArena: A Realistic Web Environment for Building Autonomous Agents
par: Zhou, Shuyan, et autres
Publié: (2023)
par: Zhou, Shuyan, et autres
Publié: (2023)
Accumulating Context Changes the Beliefs of Language Models
par: Geng, Jiayi, et autres
Publié: (2025)
par: Geng, Jiayi, et autres
Publié: (2025)
Overtrained Language Models Are Harder to Fine-Tune
par: Springer, Jacob Mitchell, et autres
Publié: (2025)
par: Springer, Jacob Mitchell, et autres
Publié: (2025)
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
par: Cheng, Zihao, et autres
Publié: (2025)
par: Cheng, Zihao, et autres
Publié: (2025)
A Survey on Evaluation of Large Language Models
par: Chang, Yupeng, et autres
Publié: (2023)
par: Chang, Yupeng, et autres
Publié: (2023)
A Survey on Model Compression for Large Language Models
par: Zhu, Xunyu, et autres
Publié: (2023)
par: Zhu, Xunyu, et autres
Publié: (2023)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
A Survey on Collaborative Mechanisms Between Large and Small Language Models
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
A Survey on the Honesty of Large Language Models
par: Li, Siheng, et autres
Publié: (2024)
par: Li, Siheng, et autres
Publié: (2024)
Divergences between Language Models and Human Brains
par: Zhou, Yuchen, et autres
Publié: (2023)
par: Zhou, Yuchen, et autres
Publié: (2023)
RAGGED: Towards Informed Design of Scalable and Stable RAG Systems
par: Hsia, Jennifer, et autres
Publié: (2024)
par: Hsia, Jennifer, et autres
Publié: (2024)
A Survey on Large Language Models for Mathematical Reasoning
par: Wang, Peng-Yuan, et autres
Publié: (2025)
par: Wang, Peng-Yuan, et autres
Publié: (2025)
SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning
par: Zhao, Chenyang, et autres
Publié: (2024)
par: Zhao, Chenyang, et autres
Publié: (2024)
Alignment for Honesty
par: Yang, Yuqing, et autres
Publié: (2023)
par: Yang, Yuqing, et autres
Publié: (2023)
Tree Search for Language Model Agents
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
par: Li, Junlong, et autres
Publié: (2025)
par: Li, Junlong, et autres
Publié: (2025)
Knowledge Editing for Large Language Models: A Survey
par: Wang, Song, et autres
Publié: (2023)
par: Wang, Song, et autres
Publié: (2023)
A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?
par: Zhang, Qiyuan, et autres
Publié: (2025)
par: Zhang, Qiyuan, et autres
Publié: (2025)
A Survey on Large Language Models from General Purpose to Medical Applications: Datasets, Methodologies, and Evaluations
par: Wang, Jinqiang, et autres
Publié: (2024)
par: Wang, Jinqiang, et autres
Publié: (2024)
Data Management For Training Large Language Models: A Survey
par: Wang, Zige, et autres
Publié: (2023)
par: Wang, Zige, et autres
Publié: (2023)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
par: Bertsch, Amanda, et autres
Publié: (2025)
par: Bertsch, Amanda, et autres
Publié: (2025)
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
Efficient Large Language Models: A Survey
par: Wan, Zhongwei, et autres
Publié: (2023)
par: Wan, Zhongwei, et autres
Publié: (2023)
Document Intelligence in the Era of Large Language Models: A Survey
par: Wang, Weishi, et autres
Publié: (2025)
par: Wang, Weishi, et autres
Publié: (2025)
Evaluation of AI Ethics Tools in Language Models: A Developers' Perspective Case Study
par: Silva, Jhessica, et autres
Publié: (2025)
par: Silva, Jhessica, et autres
Publié: (2025)
Documents similaires
-
TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic Tasks
par: Wang, Zhiruo, et autres
Publié: (2024) -
How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations
par: Wang, Zora Zhiruo, et autres
Publié: (2025) -
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
par: Waghjale, Siddhant, et autres
Publié: (2024) -
API-Assisted Code Generation for Question Answering on Varied Table Structures
par: Cao, Yihan, et autres
Publié: (2023) -
Agent Workflow Memory
par: Wang, Zora Zhiruo, et autres
Publié: (2024)