Quality Matters: Evaluating Synthetic Data for Tool-Using LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Iskander, Shadi, Cohen, Nachshon, Karnin, Zohar, Shapira, Ori, Tolmach, Sofia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
Code Review Without Borders: Evaluating Synthetic vs. Real Data for Review Recommendation
di: Cohen, Yogev, et al.
Pubblicazione: (2025)
di: Cohen, Yogev, et al.
Pubblicazione: (2025)
ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints
di: Choi, Hyeonje, et al.
Pubblicazione: (2026)
di: Choi, Hyeonje, et al.
Pubblicazione: (2026)
CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision
di: Lu, Yifei, et al.
Pubblicazione: (2025)
di: Lu, Yifei, et al.
Pubblicazione: (2025)
ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs
di: Ding, Peng, et al.
Pubblicazione: (2025)
di: Ding, Peng, et al.
Pubblicazione: (2025)
Automatic Pull Request Description Generation Using LLMs: A T5 Model Approach
di: Sakib, Md Nazmus, et al.
Pubblicazione: (2024)
di: Sakib, Md Nazmus, et al.
Pubblicazione: (2024)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
Learning Code Preference via Synthetic Evolution
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
di: Wang, Yejie, et al.
Pubblicazione: (2024)
di: Wang, Yejie, et al.
Pubblicazione: (2024)
Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
di: Ficek, Aleksander, et al.
Pubblicazione: (2025)
GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents
di: Wu, Jie JW, et al.
Pubblicazione: (2025)
di: Wu, Jie JW, et al.
Pubblicazione: (2025)
LLMs as Compiler for Arabic Programming Language
di: Sibaee, Serry, et al.
Pubblicazione: (2024)
di: Sibaee, Serry, et al.
Pubblicazione: (2024)
StackEval: Benchmarking LLMs in Coding Assistance
di: Shah, Nidhish, et al.
Pubblicazione: (2024)
di: Shah, Nidhish, et al.
Pubblicazione: (2024)
CONCUR: Benchmarking LLMs for Concurrent Code Generation
di: Huang, Jue, et al.
Pubblicazione: (2026)
di: Huang, Jue, et al.
Pubblicazione: (2026)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
di: Ahmed, Toufique, et al.
Pubblicazione: (2024)
di: Ahmed, Toufique, et al.
Pubblicazione: (2024)
A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2025)
di: Gu, Jian, et al.
Pubblicazione: (2025)
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
di: Gong, Linyuan, et al.
Pubblicazione: (2024)
Evaluating Language Models for Efficient Code Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
RepoQA: Evaluating Long Context Code Understanding
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
Evaluation and Improvement of Fault Detection for Large Language Models
di: Hu, Qiang, et al.
Pubblicazione: (2024)
di: Hu, Qiang, et al.
Pubblicazione: (2024)
CodeJudge: Evaluating Code Generation with Large Language Models
di: Tong, Weixi, et al.
Pubblicazione: (2024)
di: Tong, Weixi, et al.
Pubblicazione: (2024)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
di: Riddell, Martin, et al.
Pubblicazione: (2024)
di: Riddell, Martin, et al.
Pubblicazione: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
di: Yang, Rem, et al.
Pubblicazione: (2025)
di: Yang, Rem, et al.
Pubblicazione: (2025)
CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation
di: Peng, Jinjun, et al.
Pubblicazione: (2025)
di: Peng, Jinjun, et al.
Pubblicazione: (2025)
Sentiment Analysis in Software Engineering: Evaluating Generative Pre-trained Transformers
di: Saifullah, KM Khalid, et al.
Pubblicazione: (2025)
di: Saifullah, KM Khalid, et al.
Pubblicazione: (2025)
Evaluating the Process Modeling Abilities of Large Language Models -- Preliminary Foundations and Results
di: Fettke, Peter, et al.
Pubblicazione: (2025)
di: Fettke, Peter, et al.
Pubblicazione: (2025)
Data Augmentation for Code Translation with Comparable Corpora and Multiple References
di: Xie, Yiqing, et al.
Pubblicazione: (2023)
di: Xie, Yiqing, et al.
Pubblicazione: (2023)
Efficient Detection of Intermittent Job Failures Using Few-Shot Learning
di: Aïdasso, Henri, et al.
Pubblicazione: (2025)
di: Aïdasso, Henri, et al.
Pubblicazione: (2025)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
di: Jain, Naman, et al.
Pubblicazione: (2024)
di: Jain, Naman, et al.
Pubblicazione: (2024)
Combinatorial Optimization for All: Using LLMs to Aid Non-Experts in Improving Optimization Algorithms
di: Sartori, Camilo Chacón, et al.
Pubblicazione: (2025)
di: Sartori, Camilo Chacón, et al.
Pubblicazione: (2025)
ToolFactory: Automating Tool Generation by Leveraging LLM to Understand REST API Documentations
di: Ni, Xinyi, et al.
Pubblicazione: (2025)
di: Ni, Xinyi, et al.
Pubblicazione: (2025)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
di: Jin, Bihui, et al.
Pubblicazione: (2025)
di: Jin, Bihui, et al.
Pubblicazione: (2025)
The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines
di: Martinez, Matias
Pubblicazione: (2024)
di: Martinez, Matias
Pubblicazione: (2024)
Tool Calling is Linearly Readable and Steerable in Language Models
di: Wu, Zekun, et al.
Pubblicazione: (2026)
di: Wu, Zekun, et al.
Pubblicazione: (2026)
What can Large Language Models Capture about Code Functional Equivalence?
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
di: Petrukha, Ivan, et al.
Pubblicazione: (2025)
di: Petrukha, Ivan, et al.
Pubblicazione: (2025)
Rethinking Repetition Problems of LLMs in Code Generation
di: Dong, Yihong, et al.
Pubblicazione: (2025)
di: Dong, Yihong, et al.
Pubblicazione: (2025)
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
di: Guo, Hanxi, et al.
Pubblicazione: (2025)
di: Guo, Hanxi, et al.
Pubblicazione: (2025)
Is Programming by Example solved by LLMs?
di: Li, Wen-Ding, et al.
Pubblicazione: (2024)
di: Li, Wen-Ding, et al.
Pubblicazione: (2024)
SQLong: Enhanced NL2SQL for Longer Contexts with LLMs
di: Nguyen, Dai Quoc, et al.
Pubblicazione: (2025)
di: Nguyen, Dai Quoc, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026) -
Code Review Without Borders: Evaluating Synthetic vs. Real Data for Review Recommendation
di: Cohen, Yogev, et al.
Pubblicazione: (2025) -
ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints
di: Choi, Hyeonje, et al.
Pubblicazione: (2026) -
CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision
di: Lu, Yifei, et al.
Pubblicazione: (2025) -
ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs
di: Ding, Peng, et al.
Pubblicazione: (2025)