ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Junjie, Li, Guanyu, Gao, Songyang, Huang, Caishuang, Wu, Yilong, Li, Sixian, Fan, Xiaoran, Dou, Shihan, Ji, Tao, Zhang, Qi, Gui, Tao, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
di: Huang, Caishuang, et al.
Pubblicazione: (2026)
di: Huang, Caishuang, et al.
Pubblicazione: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
CCTU: A Benchmark for Tool Use under Complex Constraints
di: Ye, Junjie, et al.
Pubblicazione: (2026)
di: Ye, Junjie, et al.
Pubblicazione: (2026)
Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
di: Jiang, Changhao, et al.
Pubblicazione: (2026)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
di: Zhu, Dingwei, et al.
Pubblicazione: (2026)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
di: Yang, Yuming, et al.
Pubblicazione: (2025)
di: Yang, Yuming, et al.
Pubblicazione: (2025)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
di: Xu, Nuo, et al.
Pubblicazione: (2024)
di: Xu, Nuo, et al.
Pubblicazione: (2024)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
di: Zhang, Ming, et al.
Pubblicazione: (2025)
di: Zhang, Ming, et al.
Pubblicazione: (2025)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
di: Huang, Shiting, et al.
Pubblicazione: (2025)
di: Huang, Shiting, et al.
Pubblicazione: (2025)
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
di: Li, Tianlong, et al.
Pubblicazione: (2023)
di: Li, Tianlong, et al.
Pubblicazione: (2023)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)
di: Liu, Boyang, et al.
Pubblicazione: (2025)
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
The Role of Entropy in Visual Grounding: Analysis and Optimization
di: Li, Shuo, et al.
Pubblicazione: (2025)
di: Li, Shuo, et al.
Pubblicazione: (2025)
MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Beyond Boundaries: Learning a Universal Entity Taxonomy across Datasets and Languages for Open Named Entity Recognition
di: Yang, Yuming, et al.
Pubblicazione: (2024)
di: Yang, Yuming, et al.
Pubblicazione: (2024)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
di: Dou, Shihan, et al.
Pubblicazione: (2023)
di: Dou, Shihan, et al.
Pubblicazione: (2023)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
di: Shen, Yujiong, et al.
Pubblicazione: (2026)
di: Shen, Yujiong, et al.
Pubblicazione: (2026)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
di: Zhang, Ming, et al.
Pubblicazione: (2025)
di: Zhang, Ming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
di: Ye, Junjie, et al.
Pubblicazione: (2024) -
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
di: Ye, Junjie, et al.
Pubblicazione: (2024) -
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
di: Zhang, Ming, et al.
Pubblicazione: (2024) -
FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval
di: Huang, Caishuang, et al.
Pubblicazione: (2026) -
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)