SpecEval: Evaluating Code Comprehension in Large Language Models via Program Specifications
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ma, Lezhi, Liu, Shangqing, Bu, Lei, Li, Shangru, Wang, Yida, Liu, Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SpecGen: Automated Generation of Formal Program Specifications via Large Language Models
von: Ma, Lezhi, et al.
Veröffentlicht: (2024)
von: Ma, Lezhi, et al.
Veröffentlicht: (2024)
SpecSyn: LLM-based Synthesis and Refinement of Formal Specifications for Real-world Program Verification
von: Ma, Lezhi, et al.
Veröffentlicht: (2026)
von: Ma, Lezhi, et al.
Veröffentlicht: (2026)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
von: Xue, Pengyu, et al.
Veröffentlicht: (2024)
Intention is All You Need: Refining Your Code from Your Intention
von: Guo, Qi, et al.
Veröffentlicht: (2025)
von: Guo, Qi, et al.
Veröffentlicht: (2025)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
von: Dai, Dekun, et al.
Veröffentlicht: (2025)
von: Dai, Dekun, et al.
Veröffentlicht: (2025)
ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code
von: Feng, Jia, et al.
Veröffentlicht: (2024)
von: Feng, Jia, et al.
Veröffentlicht: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
von: Kammakomati, Mehant, et al.
Veröffentlicht: (2024)
von: Kammakomati, Mehant, et al.
Veröffentlicht: (2024)
SpecTra: Enhancing the Code Translation Ability of Language Models by Generating Multi-Modal Specifications
von: Nitin, Vikram, et al.
Veröffentlicht: (2024)
von: Nitin, Vikram, et al.
Veröffentlicht: (2024)
DiffSpec: Differential Testing with LLMs using Natural Language Specifications and Code Artifacts
von: Rao, Nikitha, et al.
Veröffentlicht: (2024)
von: Rao, Nikitha, et al.
Veröffentlicht: (2024)
Strengthening Programming Comprehension in Large Language Models through Code Generation
von: Ren, Xiaoning, et al.
Veröffentlicht: (2025)
von: Ren, Xiaoning, et al.
Veröffentlicht: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
von: Zhang, Tanghaoran, et al.
Veröffentlicht: (2026)
von: Zhang, Tanghaoran, et al.
Veröffentlicht: (2026)
FT2Ra: A Fine-Tuning-Inspired Approach to Retrieval-Augmented Code Completion
von: Guo, Qi, et al.
Veröffentlicht: (2024)
von: Guo, Qi, et al.
Veröffentlicht: (2024)
SolEval: Benchmarking Large Language Models for Repository-level Solidity Code Generation
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2025)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
von: Zhao, Yuwei, et al.
Veröffentlicht: (2024)
von: Zhao, Yuwei, et al.
Veröffentlicht: (2024)
TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation
von: Xue, Pengyu, et al.
Veröffentlicht: (2025)
von: Xue, Pengyu, et al.
Veröffentlicht: (2025)
SpecEval: Evaluating Model Adherence to Behavior Specifications
von: Ahmed, Ahmed, et al.
Veröffentlicht: (2025)
von: Ahmed, Ahmed, et al.
Veröffentlicht: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
von: Liu, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Liu, Kaiyuan, et al.
Veröffentlicht: (2025)
EPSO: A Caching-Based Efficient Superoptimizer for BPF Bytecode
von: Zhu, Qian, et al.
Veröffentlicht: (2025)
von: Zhu, Qian, et al.
Veröffentlicht: (2025)
Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
von: Yin, Wenjing, et al.
Veröffentlicht: (2025)
von: Yin, Wenjing, et al.
Veröffentlicht: (2025)
CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
von: Chen, Zaoyu, et al.
Veröffentlicht: (2026)
von: Chen, Zaoyu, et al.
Veröffentlicht: (2026)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
von: Xiong, Zhanhang, et al.
Veröffentlicht: (2025)
von: Xiong, Zhanhang, et al.
Veröffentlicht: (2025)
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
von: Wang, Jiexin, et al.
Veröffentlicht: (2024)
von: Wang, Jiexin, et al.
Veröffentlicht: (2024)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
von: Das, Gunjan, et al.
Veröffentlicht: (2025)
von: Das, Gunjan, et al.
Veröffentlicht: (2025)
On the Effectiveness of Large Language Models in Domain-Specific Code Generation
von: Gu, Xiaodong, et al.
Veröffentlicht: (2023)
von: Gu, Xiaodong, et al.
Veröffentlicht: (2023)
Specification-Driven Code Translation Powered by Large Language Models: How Far Are We?
von: Saha, Soumit Kanti, et al.
Veröffentlicht: (2024)
von: Saha, Soumit Kanti, et al.
Veröffentlicht: (2024)
$T^3$: Multi-level Tree-based Automatic Program Repair with Large Language Models
von: Liu, Quanming, et al.
Veröffentlicht: (2025)
von: Liu, Quanming, et al.
Veröffentlicht: (2025)
Can Large Language Models Serve as Evaluators for Code Summarization?
von: Wu, Yang, et al.
Veröffentlicht: (2024)
von: Wu, Yang, et al.
Veröffentlicht: (2024)
Advancing Code Coverage: Incorporating Program Analysis with Large Language Models
von: Yang, Chen, et al.
Veröffentlicht: (2024)
von: Yang, Chen, et al.
Veröffentlicht: (2024)
SpecPylot: Python Specification Generation using Large Language Models
von: Ayon, Ragib Shahariar, et al.
Veröffentlicht: (2026)
von: Ayon, Ragib Shahariar, et al.
Veröffentlicht: (2026)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
von: Wang, Weizhe, et al.
Veröffentlicht: (2025)
von: Wang, Weizhe, et al.
Veröffentlicht: (2025)
Impact-driven Context Filtering For Cross-file Code Completion
von: Li, Yanzhou, et al.
Veröffentlicht: (2025)
von: Li, Yanzhou, et al.
Veröffentlicht: (2025)
SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings
von: Liu, Changshu, et al.
Veröffentlicht: (2025)
von: Liu, Changshu, et al.
Veröffentlicht: (2025)
Unveiling Code Pre-Trained Models: Investigating Syntax and Semantics Capacities
von: Ma, Wei, et al.
Veröffentlicht: (2022)
von: Ma, Wei, et al.
Veröffentlicht: (2022)
Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
von: Hamedi, Parisa, et al.
Veröffentlicht: (2025)
von: Hamedi, Parisa, et al.
Veröffentlicht: (2025)
Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation
von: Sun, Zhihong, et al.
Veröffentlicht: (2025)
von: Sun, Zhihong, et al.
Veröffentlicht: (2025)
ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation
von: Jiang, Xue, et al.
Veröffentlicht: (2024)
von: Jiang, Xue, et al.
Veröffentlicht: (2024)
CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models
von: Brahman, Danny, et al.
Veröffentlicht: (2026)
von: Brahman, Danny, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SpecGen: Automated Generation of Formal Program Specifications via Large Language Models
von: Ma, Lezhi, et al.
Veröffentlicht: (2024) -
SpecSyn: LLM-based Synthesis and Refinement of Formal Specifications for Real-world Program Verification
von: Ma, Lezhi, et al.
Veröffentlicht: (2026) -
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
von: Wang, Jian, et al.
Veröffentlicht: (2025) -
ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation
von: Xue, Pengyu, et al.
Veröffentlicht: (2024) -
Intention is All You Need: Refining Your Code from Your Intention
von: Guo, Qi, et al.
Veröffentlicht: (2025)