WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ning, Kangyun, Su, Yisong, Lv, Xueqiang, Zhang, Yuanzhe, Liu, Jian, Liu, Kang, Xu, Jinan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dual-Space Knowledge Distillation for Large Language Models
par: Zhang, Songming, et autres
Publié: (2024)
par: Zhang, Songming, et autres
Publié: (2024)
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
par: Wang, Dong
Publié: (2025)
par: Wang, Dong
Publié: (2025)
Multilingual Collaborative Defense for Large Language Models
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
par: Liu, Xukun, et autres
Publié: (2024)
par: Liu, Xukun, et autres
Publié: (2024)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
par: Huang, Kaiyu, et autres
Publié: (2024)
par: Huang, Kaiyu, et autres
Publié: (2024)
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
par: Tian, Runchu, et autres
Publié: (2025)
par: Tian, Runchu, et autres
Publié: (2025)
Progressively Label Enhancement for Large Language Model Alignment
par: Liu, Biao, et autres
Publié: (2024)
par: Liu, Biao, et autres
Publié: (2024)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Benchmarking Benchmark Leakage in Large Language Models
par: Xu, Ruijie, et autres
Publié: (2024)
par: Xu, Ruijie, et autres
Publié: (2024)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Evaluating Quantized Large Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
par: Bai, Ge, et autres
Publié: (2024)
par: Bai, Ge, et autres
Publié: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
par: Wu, Yao, et autres
Publié: (2026)
par: Wu, Yao, et autres
Publié: (2026)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2026)
par: Xu, Qiancheng, et autres
Publié: (2026)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2025)
par: Xu, Qiancheng, et autres
Publié: (2025)
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
par: Cheng, Zihao, et autres
Publié: (2025)
par: Cheng, Zihao, et autres
Publié: (2025)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
par: Yao, Xuan, et autres
Publié: (2025)
par: Yao, Xuan, et autres
Publié: (2025)
Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences
par: Ashkinaze, Joshua, et autres
Publié: (2025)
par: Ashkinaze, Joshua, et autres
Publié: (2025)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
par: liu, Hanmeng, et autres
Publié: (2023)
par: liu, Hanmeng, et autres
Publié: (2023)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
par: Shi, Zhengliang, et autres
Publié: (2025)
par: Shi, Zhengliang, et autres
Publié: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
par: Liu, Biao, et autres
Publié: (2025)
par: Liu, Biao, et autres
Publié: (2025)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
par: Zheng, Tianpeng, et autres
Publié: (2026)
par: Zheng, Tianpeng, et autres
Publié: (2026)
TD-EVAL: Revisiting Task-Oriented Dialogue Evaluation by Combining Turn-Level Precision with Dialogue-Level Comparisons
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
Does Knowledge Localization Hold True? Surprising Differences Between Entity and Relation Perspectives in Language Models
par: Wei, Yifan, et autres
Publié: (2024)
par: Wei, Yifan, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
par: Zhang, Xiaotian, et autres
Publié: (2023)
par: Zhang, Xiaotian, et autres
Publié: (2023)
ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources
par: Yang, Shuting, et autres
Publié: (2024)
par: Yang, Shuting, et autres
Publié: (2024)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
par: Zhang, Songming, et autres
Publié: (2026)
par: Zhang, Songming, et autres
Publié: (2026)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
An Empirical Analysis on Large Language Models in Debate Evaluation
par: Liu, Xinyi, et autres
Publié: (2024)
par: Liu, Xinyi, et autres
Publié: (2024)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
par: Sun, Zengkui, et autres
Publié: (2024)
par: Sun, Zengkui, et autres
Publié: (2024)
Evaluating and Enhancing Large Language Models Performance in Domain-specific Medicine: Osteoarthritis Management with DocOA
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
par: Jin, Renren, et autres
Publié: (2024)
par: Jin, Renren, et autres
Publié: (2024)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
par: Huang, Yiming, et autres
Publié: (2024)
par: Huang, Yiming, et autres
Publié: (2024)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023)
par: Fu, Lingyue, et autres
Publié: (2023)
Documents similaires
-
Dual-Space Knowledge Distillation for Large Language Models
par: Zhang, Songming, et autres
Publié: (2024) -
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
par: Wang, Dong
Publié: (2025) -
Multilingual Collaborative Defense for Large Language Models
par: Li, Hongliang, et autres
Publié: (2025) -
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
par: Liu, Xukun, et autres
Publié: (2024) -
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
par: Huang, Kaiyu, et autres
Publié: (2024)