A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Yixi, He, Pengfei, Wang, Zehao, Wang, Shaowei, Tian, Yuan, Chen, Tse-Hsun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs
von: He, Pengfei, et al.
Veröffentlicht: (2025)
von: He, Pengfei, et al.
Veröffentlicht: (2025)
SLICET5: Static Program Slicing using Language Models with Copy Mechanism and Constrained Decoding
von: He, Pengfei, et al.
Veröffentlicht: (2025)
von: He, Pengfei, et al.
Veröffentlicht: (2025)
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
von: He, Pengfei, et al.
Veröffentlicht: (2024)
von: He, Pengfei, et al.
Veröffentlicht: (2024)
Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
von: He, Pengfei, et al.
Veröffentlicht: (2026)
von: He, Pengfei, et al.
Veröffentlicht: (2026)
ZS4C: Zero-Shot Synthesis of Compilable Code for Incomplete Code Snippets using LLMs
von: Kabir, Azmain, et al.
Veröffentlicht: (2024)
von: Kabir, Azmain, et al.
Veröffentlicht: (2024)
Identifying Performance-Sensitive Configurations in Software Systems through Code Analysis with LLM Agents
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
LLMParser: An Exploratory Study on Using Large Language Models for Log Parsing
von: Ma, Zeyang, et al.
Veröffentlicht: (2024)
von: Ma, Zeyang, et al.
Veröffentlicht: (2024)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
von: Lin, Feng, et al.
Veröffentlicht: (2025)
von: Lin, Feng, et al.
Veröffentlicht: (2025)
When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation
von: Ashik, Ahmed Nusayer, et al.
Veröffentlicht: (2026)
von: Ashik, Ahmed Nusayer, et al.
Veröffentlicht: (2026)
Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era
von: Khan, Taufiqul Islam, et al.
Veröffentlicht: (2026)
von: Khan, Taufiqul Islam, et al.
Veröffentlicht: (2026)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
von: Tse-Hsun, et al.
Veröffentlicht: (2026)
von: Tse-Hsun, et al.
Veröffentlicht: (2026)
LibreLog: Accurate and Efficient Unsupervised Log Parsing Using Open-Source Large Language Models
von: Ma, Zeyang, et al.
Veröffentlicht: (2024)
von: Ma, Zeyang, et al.
Veröffentlicht: (2024)
API-guided Dataset Synthesis to Finetune Large Code Models
von: Li, Zongjie, et al.
Veröffentlicht: (2024)
von: Li, Zongjie, et al.
Veröffentlicht: (2024)
Empowering AIOps: Leveraging Large Language Models for IT Operations Management
von: Vitui, Arthur, et al.
Veröffentlicht: (2025)
von: Vitui, Arthur, et al.
Veröffentlicht: (2025)
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
von: Lin, Feng, et al.
Veröffentlicht: (2024)
von: Lin, Feng, et al.
Veröffentlicht: (2024)
Studying the Impact of Early Test Termination Due to Assertion Failure on Code Coverage and Spectrum-based Fault Localization
von: Uddin, Md. Ashraf, et al.
Veröffentlicht: (2025)
von: Uddin, Md. Ashraf, et al.
Veröffentlicht: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
von: Wang, Xinchen, et al.
Veröffentlicht: (2025)
von: Wang, Xinchen, et al.
Veröffentlicht: (2025)
Towards Better Graph Neural Network-based Fault Localization Through Enhanced Code Representation
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
von: Shafin, Wasique Islam, et al.
Veröffentlicht: (2025)
von: Shafin, Wasique Islam, et al.
Veröffentlicht: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
von: Yin, Wenjing, et al.
Veröffentlicht: (2025)
von: Yin, Wenjing, et al.
Veröffentlicht: (2025)
OASBuilder: Generating OpenAPI Specifications from Online API Documentation with Large Language Models
von: Lazar, Koren, et al.
Veröffentlicht: (2025)
von: Lazar, Koren, et al.
Veröffentlicht: (2025)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
von: Macedo, Marcos, et al.
Veröffentlicht: (2024)
von: Macedo, Marcos, et al.
Veröffentlicht: (2024)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
von: Xiong, Zhanhang, et al.
Veröffentlicht: (2025)
von: Xiong, Zhanhang, et al.
Veröffentlicht: (2025)
A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
von: Rafi, Md Nakhla, et al.
Veröffentlicht: (2024)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
von: He, Mengliang, et al.
Veröffentlicht: (2025)
von: He, Mengliang, et al.
Veröffentlicht: (2025)
Task Abstention for Large Language Models in Code Generation
von: Zhou, Yanke, et al.
Veröffentlicht: (2026)
von: Zhou, Yanke, et al.
Veröffentlicht: (2026)
Effective Code Membership Inference for Code Completion Models via Adversarial Prompts
von: Jiang, Yuan, et al.
Veröffentlicht: (2025)
von: Jiang, Yuan, et al.
Veröffentlicht: (2025)
Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites
von: Li, Chenglin, et al.
Veröffentlicht: (2026)
von: Li, Chenglin, et al.
Veröffentlicht: (2026)
From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair
von: Li, Chenglin, et al.
Veröffentlicht: (2026)
von: Li, Chenglin, et al.
Veröffentlicht: (2026)
Large Language Models as Test Case Generators: Performance Evaluation and Enhancement
von: Li, Kefan, et al.
Veröffentlicht: (2024)
von: Li, Kefan, et al.
Veröffentlicht: (2024)
RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation
von: Liang, Linxi, et al.
Veröffentlicht: (2025)
von: Liang, Linxi, et al.
Veröffentlicht: (2025)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why?
von: Chen, QiHong, et al.
Veröffentlicht: (2024)
von: Chen, QiHong, et al.
Veröffentlicht: (2024)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
von: Xu, Yisen, et al.
Veröffentlicht: (2026)
von: Xu, Yisen, et al.
Veröffentlicht: (2026)
Enhancing High-Quality Code Generation in Large Language Models with Comparative Prefix-Tuning
von: Jiang, Yuan, et al.
Veröffentlicht: (2025)
von: Jiang, Yuan, et al.
Veröffentlicht: (2025)
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
von: Wang, Chaozheng, et al.
Veröffentlicht: (2024)
von: Wang, Chaozheng, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models for Code Review
von: Cihan, Umut, et al.
Veröffentlicht: (2025)
von: Cihan, Umut, et al.
Veröffentlicht: (2025)
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
von: Liu, Huanxi, et al.
Veröffentlicht: (2024)
von: Liu, Huanxi, et al.
Veröffentlicht: (2024)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
von: Mächtle, Felix, et al.
Veröffentlicht: (2026)
von: Mächtle, Felix, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs
von: He, Pengfei, et al.
Veröffentlicht: (2025) -
SLICET5: Static Program Slicing using Language Models with Copy Mechanism and Constrained Decoding
von: He, Pengfei, et al.
Veröffentlicht: (2025) -
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
von: He, Pengfei, et al.
Veröffentlicht: (2024) -
Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding
von: He, Pengfei, et al.
Veröffentlicht: (2026) -
ZS4C: Zero-Shot Synthesis of Compilable Code for Incomplete Code Snippets using LLMs
von: Kabir, Azmain, et al.
Veröffentlicht: (2024)