CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Cheng, Yang, Jinqiu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Exploratory Study on Fine-Tuning Large Language Models for Secure Code Generation
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
A Multi-Language Perspective on the Robustness of LLM Code Generation
por: Rabbi, Fazle, et al.
Publicado: (2025)
por: Rabbi, Fazle, et al.
Publicado: (2025)
Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
Specification-Driven Code Translation Powered by Large Language Models: How Far Are We?
por: Saha, Soumit Kanti, et al.
Publicado: (2024)
por: Saha, Soumit Kanti, et al.
Publicado: (2024)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
por: Lin, Feng, et al.
Publicado: (2025)
por: Lin, Feng, et al.
Publicado: (2025)
Detect Repair Verify for Securing LLM Generated Code: A Multi-Language Empirical Study
por: Cheng, Cheng
Publicado: (2026)
por: Cheng, Cheng
Publicado: (2026)
Tracking the Evolution of Static Code Warnings: the State-of-the-Art and a Better Approach
por: Li, Junjie, et al.
Publicado: (2022)
por: Li, Junjie, et al.
Publicado: (2022)
COBOL-Coder: Domain-Adapted Large Language Models for COBOL Code Generation and Translation
por: Dau, Anh T. V., et al.
Publicado: (2026)
por: Dau, Anh T. V., et al.
Publicado: (2026)
Bias Unveiled: Investigating Social Bias in LLM-Generated Code
por: Ling, Lin, et al.
Publicado: (2024)
por: Ling, Lin, et al.
Publicado: (2024)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
por: Wang, Jiexin, et al.
Publicado: (2024)
por: Wang, Jiexin, et al.
Publicado: (2024)
Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study
por: Cheng, Cheng
Publicado: (2026)
por: Cheng, Cheng
Publicado: (2026)
Robustness, Security, Privacy, Explainability, Efficiency, and Usability of Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation
por: Rabbi, Fazle, et al.
Publicado: (2026)
por: Rabbi, Fazle, et al.
Publicado: (2026)
A Survey on Evaluating Large Language Models in Code Generation Tasks
por: Chen, Liguo, et al.
Publicado: (2024)
por: Chen, Liguo, et al.
Publicado: (2024)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
por: Xu, Yisen, et al.
Publicado: (2026)
por: Xu, Yisen, et al.
Publicado: (2026)
Can Large Language Models Serve as Evaluators for Code Summarization?
por: Wu, Yang, et al.
Publicado: (2024)
por: Wu, Yang, et al.
Publicado: (2024)
Evaluating the Impact of Post-Training Quantization on Large Language Models for Code Generation
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
por: Giagnorio, Alessandro, et al.
Publicado: (2025)
Hotfixing Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
por: Xue, Zhantong, et al.
Publicado: (2025)
por: Xue, Zhantong, et al.
Publicado: (2025)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
por: Das, Gunjan, et al.
Publicado: (2025)
por: Das, Gunjan, et al.
Publicado: (2025)
On the Robustness Evaluation of 3D Obstacle Detection Against Specifications in Autonomous Driving
por: Pham, Tri Minh Triet, et al.
Publicado: (2024)
por: Pham, Tri Minh Triet, et al.
Publicado: (2024)
HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair
por: Rabbi, Fazle, et al.
Publicado: (2026)
por: Rabbi, Fazle, et al.
Publicado: (2026)
Ecosystem of Large Language Models for Code
por: Yang, Zhou, et al.
Publicado: (2024)
por: Yang, Zhou, et al.
Publicado: (2024)
On the Evaluation of Large Language Models in Unit Test Generation
por: Yang, Lin, et al.
Publicado: (2024)
por: Yang, Lin, et al.
Publicado: (2024)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
por: Liu, Changshu, et al.
Publicado: (2025)
por: Liu, Changshu, et al.
Publicado: (2025)
Large Language Models for Code Generation: The Practitioners Perspective
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
por: Rasheed, Zeeshan, et al.
Publicado: (2025)
Aligning Requirement for Large Language Model's Code Generation
por: Tian, Zhao, et al.
Publicado: (2025)
por: Tian, Zhao, et al.
Publicado: (2025)
Can Large Language Models Generate Geospatial Code?
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
Optimizing Large Language Model Hyperparameters for Code Generation
por: Arora, Chetan, et al.
Publicado: (2024)
por: Arora, Chetan, et al.
Publicado: (2024)
Self-planning Code Generation with Large Language Models
por: Jiang, Xue, et al.
Publicado: (2023)
por: Jiang, Xue, et al.
Publicado: (2023)
Greening Large Language Models of Code
por: Shi, Jieke, et al.
Publicado: (2023)
por: Shi, Jieke, et al.
Publicado: (2023)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
por: Xue, Pengyu, et al.
Publicado: (2024)
por: Xue, Pengyu, et al.
Publicado: (2024)
SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
por: Ma, Lezhi, et al.
Publicado: (2024)
por: Ma, Lezhi, et al.
Publicado: (2024)
Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI
por: Zhang, Ruixin, et al.
Publicado: (2026)
por: Zhang, Ruixin, et al.
Publicado: (2026)
An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation
por: Cheng, Zaiyu, et al.
Publicado: (2026)
por: Cheng, Zaiyu, et al.
Publicado: (2026)
The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-Based Code Generation
por: Fu, Yingjie, et al.
Publicado: (2024)
por: Fu, Yingjie, et al.
Publicado: (2024)
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
por: Saad, Mootez, et al.
Publicado: (2025)
por: Saad, Mootez, et al.
Publicado: (2025)
Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation
por: Sun, Zhihong, et al.
Publicado: (2025)
por: Sun, Zhihong, et al.
Publicado: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025)
por: Yang, Rem, et al.
Publicado: (2025)
On the Effectiveness of Large Language Models in Domain-Specific Code Generation
por: Gu, Xiaodong, et al.
Publicado: (2023)
por: Gu, Xiaodong, et al.
Publicado: (2023)
Ejemplares similares
-
An Exploratory Study on Fine-Tuning Large Language Models for Secure Code Generation
por: Li, Junjie, et al.
Publicado: (2024) -
A Multi-Language Perspective on the Robustness of LLM Code Generation
por: Rabbi, Fazle, et al.
Publicado: (2025) -
Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation
por: Li, Junjie, et al.
Publicado: (2025) -
Specification-Driven Code Translation Powered by Large Language Models: How Far Are We?
por: Saha, Soumit Kanti, et al.
Publicado: (2024) -
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
por: Lin, Feng, et al.
Publicado: (2025)