Evaluation and Improvement of Fault Detection for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Qiang, Wen, Jin, Cordy, Maxime, Huang, Yuheng, Ma, Wei, Xie, Xiaofei, Ma, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluation and Improvement of Test Selection for Large Language Models
par: Lili Quan, et autres
Publié: (2025)
par: Lili Quan, et autres
Publié: (2025)
LUNA: A Model-Based Universal Analysis Framework for Large Language Models
par: Song, Da, et autres
Publié: (2023)
par: Song, Da, et autres
Publié: (2023)
LeCov: Multi-level Testing Criteria for Large Language Models
par: Xie, Xuan, et autres
Publié: (2024)
par: Xie, Xuan, et autres
Publié: (2024)
Evaluating Language Models for Efficient Code Generation
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
FaultProfIT: Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems
par: Huang, Junjie, et autres
Publié: (2024)
par: Huang, Junjie, et autres
Publié: (2024)
Foundation Models for Autonomous Driving System: An Initial Roadmap
par: Wu, Xiongfei, et autres
Publié: (2025)
par: Wu, Xiongfei, et autres
Publié: (2025)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
par: Jain, Naman, et autres
Publié: (2024)
par: Jain, Naman, et autres
Publié: (2024)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
par: Sun, Ruoyu, et autres
Publié: (2025)
par: Sun, Ruoyu, et autres
Publié: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
par: Tong, Weixi, et autres
Publié: (2024)
par: Tong, Weixi, et autres
Publié: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
par: Yang, Rem, et autres
Publié: (2025)
par: Yang, Rem, et autres
Publié: (2025)
Evaluating the Process Modeling Abilities of Large Language Models -- Preliminary Foundations and Results
par: Fettke, Peter, et autres
Publié: (2025)
par: Fettke, Peter, et autres
Publié: (2025)
SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation
par: Jiang, Mingchao, et autres
Publié: (2025)
par: Jiang, Mingchao, et autres
Publié: (2025)
Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward
par: Xie, Xuan, et autres
Publié: (2024)
par: Xie, Xuan, et autres
Publié: (2024)
One Model, Many Skills: Parameter-Efficient Fine-Tuning for Multitask Code Analysis
par: Akli, Amal, et autres
Publié: (2026)
par: Akli, Amal, et autres
Publié: (2026)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
par: Jin, Bihui, et autres
Publié: (2025)
par: Jin, Bihui, et autres
Publié: (2025)
Large Language Models for Multilingual Code Intelligence: A Survey
par: Jiang, Chao, et autres
Publié: (2026)
par: Jiang, Chao, et autres
Publié: (2026)
The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines
par: Martinez, Matias
Publié: (2024)
par: Martinez, Matias
Publié: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
par: Guo, Siyuan, et autres
Publié: (2025)
par: Guo, Siyuan, et autres
Publié: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
par: Wang, Xinchen, et autres
Publié: (2025)
par: Wang, Xinchen, et autres
Publié: (2025)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
par: Li, Yufei, et autres
Publié: (2024)
par: Li, Yufei, et autres
Publié: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
par: Guo, Daya, et autres
Publié: (2024)
par: Guo, Daya, et autres
Publié: (2024)
Language Models for Code Completion: A Practical Evaluation
par: Izadi, Maliheh, et autres
Publié: (2024)
par: Izadi, Maliheh, et autres
Publié: (2024)
Assured Automatic Programming via Large Language Models
par: Mirchev, Martin, et autres
Publié: (2024)
par: Mirchev, Martin, et autres
Publié: (2024)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
par: Riddell, Martin, et autres
Publié: (2024)
par: Riddell, Martin, et autres
Publié: (2024)
OptLLM: Optimal Assignment of Queries to Large Language Models
par: Liu, Yueyue, et autres
Publié: (2024)
par: Liu, Yueyue, et autres
Publié: (2024)
SODBench: A Large Language Model Approach to Documenting Spreadsheet Operations
par: Indika, Amila, et autres
Publié: (2025)
par: Indika, Amila, et autres
Publié: (2025)
Exploring Large Language Models for Translating Romanian Computational Problems into English
par: Dumitran, Adrian Marius, et autres
Publié: (2025)
par: Dumitran, Adrian Marius, et autres
Publié: (2025)
Investigating the Efficacy of Large Language Models for Code Clone Detection
par: Khajezade, Mohamad, et autres
Publié: (2024)
par: Khajezade, Mohamad, et autres
Publié: (2024)
Large Language Model Supply Chain: Open Problems From the Security Perspective
par: Hu, Qiang, et autres
Publié: (2024)
par: Hu, Qiang, et autres
Publié: (2024)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
par: Yang, Chenyuan, et autres
Publié: (2023)
par: Yang, Chenyuan, et autres
Publié: (2023)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
par: Haider, Md. Asif, et autres
Publié: (2024)
par: Haider, Md. Asif, et autres
Publié: (2024)
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
par: Li, Jingyao, et autres
Publié: (2023)
par: Li, Jingyao, et autres
Publié: (2023)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
par: Weyssow, Martin, et autres
Publié: (2023)
par: Weyssow, Martin, et autres
Publié: (2023)
EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
par: Fang, Sen, et autres
Publié: (2025)
par: Fang, Sen, et autres
Publié: (2025)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
par: Abdelaal, Mohamed, et autres
Publié: (2025)
par: Abdelaal, Mohamed, et autres
Publié: (2025)
Towards Understanding What Code Language Models Learned
par: Ahmed, Toufique, et autres
Publié: (2023)
par: Ahmed, Toufique, et autres
Publié: (2023)
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
par: Ruiz, Fernando Vallecillos, et autres
Publié: (2024)
par: Ruiz, Fernando Vallecillos, et autres
Publié: (2024)
CodeUltraFeedback: An LLM-as-a-Judge Dataset for Aligning Large Language Models to Coding Preferences
par: Weyssow, Martin, et autres
Publié: (2024)
par: Weyssow, Martin, et autres
Publié: (2024)
Documents similaires
-
Evaluation and Improvement of Test Selection for Large Language Models
par: Lili Quan, et autres
Publié: (2025) -
LUNA: A Model-Based Universal Analysis Framework for Large Language Models
par: Song, Da, et autres
Publié: (2023) -
LeCov: Multi-level Testing Criteria for Large Language Models
par: Xie, Xuan, et autres
Publié: (2024) -
Evaluating Language Models for Efficient Code Generation
par: Liu, Jiawei, et autres
Publié: (2024) -
FaultProfIT: Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems
par: Huang, Junjie, et autres
Publié: (2024)