DevEval: Evaluating Code Generation in Practical Software Projects
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jia, Li, Ge, Zhao, Yunfei, Li, Yongmin, Jin, Zhi, Zhu, Hao, Liu, Huanyu, Liu, Kaibo, Wang, Lecheng, Fang, Zheng, Wang, Lanshen, Ding, Jiazheng, Zhang, Xuanming, Dong, Yihong, Zhu, Yuqi, Gu, Bin, Yang, Mengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Showing LLM-Generated Code Selectively Based on Confidence of LLMs
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024)
par: Dong, Yihong, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
Generating Equivalent Representations of Code By A Self-Reflection Approach
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
CodeScore: Evaluating Code Generation by Learning Code Execution
par: Dong, Yihong, et autres
Publié: (2023)
par: Dong, Yihong, et autres
Publié: (2023)
EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
par: Liu, Huanyu, et autres
Publié: (2025)
par: Liu, Huanyu, et autres
Publié: (2025)
VulInstruct: Teaching LLMs Root-Cause Reasoning for Vulnerability Detection via Security Specifications
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Theoretical Proof that Auto-regressive Language Models Collapse when Real-world Data is a Finite Set
par: Wang, Lecheng, et autres
Publié: (2024)
par: Wang, Lecheng, et autres
Publié: (2024)
Uncertainty-Guided Chain-of-Thought for Code Generation with LLMs
par: Zhu, Yuqi, et autres
Publié: (2025)
par: Zhu, Yuqi, et autres
Publié: (2025)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
par: Liu, Huanyu, et autres
Publié: (2025)
par: Liu, Huanyu, et autres
Publié: (2025)
ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation
par: Jiang, Xue, et autres
Publié: (2024)
par: Jiang, Xue, et autres
Publié: (2024)
Self-planning Code Generation with Large Language Models
par: Jiang, Xue, et autres
Publié: (2023)
par: Jiang, Xue, et autres
Publié: (2023)
HITS: High-coverage LLM-based Unit Test Generation via Method Slicing
par: Wang, Zejun, et autres
Publié: (2024)
par: Wang, Zejun, et autres
Publié: (2024)
aiXcoder-7B: A Lightweight and Effective Large Language Model for Code Processing
par: Jiang, Siyuan, et autres
Publié: (2024)
par: Jiang, Siyuan, et autres
Publié: (2024)
aiXcoder-7B-v2: Training LLMs to Fully Utilize the Long Context in Repository-level Code Completion
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle
par: Tang, Yuheng, et autres
Publié: (2026)
par: Tang, Yuheng, et autres
Publié: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
Python Symbolic Execution with LLM-powered Code Generation
par: Wang, Wenhan, et autres
Publié: (2024)
par: Wang, Wenhan, et autres
Publié: (2024)
ChatDev: Communicative Agents for Software Development
par: Qian, Chen, et autres
Publié: (2023)
par: Qian, Chen, et autres
Publié: (2023)
Rethinking Repetition Problems of LLMs in Code Generation
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Reasoning is Periodicity? Improving Large Language Models Through Effective Periodicity Modeling
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Self-collaboration Code Generation via ChatGPT
par: Dong, Yihong, et autres
Publié: (2023)
par: Dong, Yihong, et autres
Publié: (2023)
Computational Thinking Reasoning in Large Language Models
par: Zhang, Kechi, et autres
Publié: (2025)
par: Zhang, Kechi, et autres
Publié: (2025)
Line-level Semantic Structure Learning for Code Vulnerability Detection
par: Wang, Ziliang, et autres
Publié: (2024)
par: Wang, Ziliang, et autres
Publié: (2024)
AdapTrack: Constrained Decoding without Distorting LLM's Output Intent
par: Li, Yongmin, et autres
Publié: (2025)
par: Li, Yongmin, et autres
Publié: (2025)
GraphCodeAgent: Dual Graph-Guided LLM Agent for Retrieval-Augmented Repo-Level Code Generation
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
MdEval: Massively Multilingual Code Debugging
par: Liu, Shukai, et autres
Publié: (2024)
par: Liu, Shukai, et autres
Publié: (2024)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
par: Tao, Yongding, et autres
Publié: (2025)
par: Tao, Yongding, et autres
Publié: (2025)
BioHiCL: Hierarchical Multi-Label Contrastive Learning for Biomedical Retrieval with MeSH Labels
par: Lan, Mengfei, et autres
Publié: (2026)
par: Lan, Mengfei, et autres
Publié: (2026)
Embedded DevOps: A Survey on the Application of DevOps Practices in Embedded Software and Firmware Development
par: Katapara, Parthiv, et autres
Publié: (2025)
par: Katapara, Parthiv, et autres
Publié: (2025)
McEval: Massively Multilingual Code Evaluation
par: Chai, Linzheng, et autres
Publié: (2024)
par: Chai, Linzheng, et autres
Publié: (2024)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
par: Lu, Pengrui, et autres
Publié: (2026)
par: Lu, Pengrui, et autres
Publié: (2026)
Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points
par: Zhang, Kechi, et autres
Publié: (2025)
par: Zhang, Kechi, et autres
Publié: (2025)
ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation
par: Liu, Kaiyuan, et autres
Publié: (2025)
par: Liu, Kaiyuan, et autres
Publié: (2025)
IntentCoding: Amplifying User Intent in Code Generation
par: Fang, Zheng, et autres
Publié: (2026)
par: Fang, Zheng, et autres
Publié: (2026)
Do Transformers Have the Ability for Periodicity Generalization?
par: Liu, Huanyu, et autres
Publié: (2026)
par: Liu, Huanyu, et autres
Publié: (2026)
CodeDPO: Aligning Code Models with Self Generated and Verified Source Code
par: Zhang, Kechi, et autres
Publié: (2024)
par: Zhang, Kechi, et autres
Publié: (2024)
Tetrachlorobisphenol A Induces Programmed Cell Death and Senescence in Vascular Endothelial Cells
par: Huanyu Qiao, et autres
Publié: (2026)
par: Huanyu Qiao, et autres
Publié: (2026)
Documents similaires
-
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024) -
Showing LLM-Generated Code Selectively Based on Confidence of LLMs
par: Li, Jia, et autres
Publié: (2024) -
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024) -
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
par: Dong, Yihong, et autres
Publié: (2024) -
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
par: Li, Jia, et autres
Publié: (2024)