SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and Calibration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Yuanhao, Zhu, Xiaodan, Chen, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Instance-Level Safety-Aware Fidelity of Synthetic Data and Its Calibration
par: Cheng, Chih-Hong, et autres
Publié: (2024)
par: Cheng, Chih-Hong, et autres
Publié: (2024)
Evaluating the Use of LLMs for Documentation to Code Traceability
par: Alor, Ebube, et autres
Publié: (2025)
par: Alor, Ebube, et autres
Publié: (2025)
What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code
par: Wen, Jiawen, et autres
Publié: (2024)
par: Wen, Jiawen, et autres
Publié: (2024)
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
par: Castellani, Tommaso, et autres
Publié: (2025)
par: Castellani, Tommaso, et autres
Publié: (2025)
MTAD: Tools and Benchmarks for Multivariate Time Series Anomaly Detection
par: Liu, Jinyang, et autres
Publié: (2024)
par: Liu, Jinyang, et autres
Publié: (2024)
The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents
par: Yu, Shasha, et autres
Publié: (2026)
par: Yu, Shasha, et autres
Publié: (2026)
Read, Extract, Classify: A Tool for Smarter Requirements Engineering
par: Bhattacharya, Paheli, et autres
Publié: (2026)
par: Bhattacharya, Paheli, et autres
Publié: (2026)
Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild
par: Zhao, Zhimin, et autres
Publié: (2026)
par: Zhao, Zhimin, et autres
Publié: (2026)
Retrieval-Augmented Instruction Tuning for Automated Process Engineering Calculations : A Tool-Chaining Problem-Solving Framework with Attributable Reflection
par: Sakhinana, Sagar Srinivas, et autres
Publié: (2024)
par: Sakhinana, Sagar Srinivas, et autres
Publié: (2024)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
par: Li, Yuangang, et autres
Publié: (2026)
par: Li, Yuangang, et autres
Publié: (2026)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
par: Wu, Yixi, et autres
Publié: (2024)
par: Wu, Yixi, et autres
Publié: (2024)
WONDERBREAD: A Benchmark for Evaluating Multimodal Foundation Models on Business Process Management Tasks
par: Wornow, Michael, et autres
Publié: (2024)
par: Wornow, Michael, et autres
Publié: (2024)
BitsAI-Fix: LLM-Driven Approach for Automated Lint Error Resolution in Practice
par: Li, Yuanpeng, et autres
Publié: (2025)
par: Li, Yuanpeng, et autres
Publié: (2025)
Is ChatGPT a Good Software Librarian? An Exploratory Study on the Use of ChatGPT for Software Library Recommendations
par: Latendresse, Jasmine, et autres
Publié: (2024)
par: Latendresse, Jasmine, et autres
Publié: (2024)
Deep Learning and Data Augmentation for Detecting Self-Admitted Technical Debt
par: Sutoyo, Edi, et autres
Publié: (2024)
par: Sutoyo, Edi, et autres
Publié: (2024)
Keeping Code-Aware LLMs Fresh: Full Refresh, In-Context Deltas, and Incremental Fine-Tuning
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
par: Sharma, Pradeep Kumar, et autres
Publié: (2025)
Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks
par: Gong, Linyuan, et autres
Publié: (2024)
par: Gong, Linyuan, et autres
Publié: (2024)
BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation
par: Xu, Jingwen, et autres
Publié: (2026)
par: Xu, Jingwen, et autres
Publié: (2026)
Monitizer: Automating Design and Evaluation of Neural Network Monitors
par: Azeem, Muqsit, et autres
Publié: (2024)
par: Azeem, Muqsit, et autres
Publié: (2024)
Free and Customizable Code Documentation with LLMs: A Fine-Tuning Approach
par: Chakrabarty, Sayak, et autres
Publié: (2024)
par: Chakrabarty, Sayak, et autres
Publié: (2024)
SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents
par: Zolfagharian, Amirhossein, et autres
Publié: (2023)
par: Zolfagharian, Amirhossein, et autres
Publié: (2023)
A Model-Driven Engineering Approach to AI-Powered Healthcare Platforms
par: Raheem, Mira, et autres
Publié: (2025)
par: Raheem, Mira, et autres
Publié: (2025)
CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model
par: Di, Peng, et autres
Publié: (2023)
par: Di, Peng, et autres
Publié: (2023)
LLM-based Content Classification Approach for GitHub Repositories by the README Files
par: Mehmood, Malik Uzair, et autres
Publié: (2025)
par: Mehmood, Malik Uzair, et autres
Publié: (2025)
Zero-Shot Attribution for Large Language Models: A Distribution Testing Approach
par: Canonne, Clément L., et autres
Publié: (2025)
par: Canonne, Clément L., et autres
Publié: (2025)
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
par: Zheng, Qinkai, et autres
Publié: (2023)
par: Zheng, Qinkai, et autres
Publié: (2023)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
par: Xu, Weiwei, et autres
Publié: (2024)
par: Xu, Weiwei, et autres
Publié: (2024)
An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code
par: Vulićević, Jelena Ilić
Publié: (2026)
par: Vulićević, Jelena Ilić
Publié: (2026)
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
par: Zhou, Zenghui, et autres
Publié: (2026)
par: Zhou, Zenghui, et autres
Publié: (2026)
SnipGen: A Mining Repository Framework for Evaluating LLMs for Code
par: Rodriguez-Cardenas, Daniel, et autres
Publié: (2025)
par: Rodriguez-Cardenas, Daniel, et autres
Publié: (2025)
Property-Driven Evaluation of GNN Expressiveness at Scale: Datasets, Framework, and Study
par: Che, Sicong, et autres
Publié: (2026)
par: Che, Sicong, et autres
Publié: (2026)
MASTEST: A LLM-Based Multi-Agent System For RESTful API Tests
par: Han, Xiaoke, et autres
Publié: (2025)
par: Han, Xiaoke, et autres
Publié: (2025)
MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation
par: Shbita, Basel, et autres
Publié: (2025)
par: Shbita, Basel, et autres
Publié: (2025)
EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering
par: Mao, Chenhui, et autres
Publié: (2026)
par: Mao, Chenhui, et autres
Publié: (2026)
CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision
par: Lu, Yifei, et autres
Publié: (2025)
par: Lu, Yifei, et autres
Publié: (2025)
What Information Contributes to Log-based Anomaly Detection? Insights from a Configurable Transformer-Based Approach
par: Wu, Xingfang, et autres
Publié: (2024)
par: Wu, Xingfang, et autres
Publié: (2024)
Can Requirements Engineering Support Explainable Artificial Intelligence? Towards a User-Centric Approach for Explainability Requirements
par: Umm-e-Habiba, et autres
Publié: (2022)
par: Umm-e-Habiba, et autres
Publié: (2022)
Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation
par: Rahman, Musfiqur, et autres
Publié: (2025)
par: Rahman, Musfiqur, et autres
Publié: (2025)
ToolFactory: Automating Tool Generation by Leveraging LLM to Understand REST API Documentations
par: Ni, Xinyi, et autres
Publié: (2025)
par: Ni, Xinyi, et autres
Publié: (2025)
ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs
par: Ding, Peng, et autres
Publié: (2025)
par: Ding, Peng, et autres
Publié: (2025)
Documents similaires
-
Instance-Level Safety-Aware Fidelity of Synthetic Data and Its Calibration
par: Cheng, Chih-Hong, et autres
Publié: (2024) -
Evaluating the Use of LLMs for Documentation to Code Traceability
par: Alor, Ebube, et autres
Publié: (2025) -
What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code
par: Wen, Jiawen, et autres
Publié: (2024) -
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
par: Castellani, Tommaso, et autres
Publié: (2025) -
MTAD: Tools and Benchmarks for Multivariate Time Series Anomaly Detection
par: Liu, Jinyang, et autres
Publié: (2024)