Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Daghighfarsoodeh, Alireza, Wang, Chung-Yu, Taherkhani, Hamed, Sepidband, Melika, Abdollahi, Mohammad, Hemmati, Hadi, Pham, Hung Viet |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models
by: Sepidband, Melika, et al.
Published: (2026)
by: Sepidband, Melika, et al.
Published: (2026)
Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach
by: Sepidband, Melika, et al.
Published: (2025)
by: Sepidband, Melika, et al.
Published: (2025)
On the Role of Fault Localization Context for LLM-Based Program Repair
by: Sepidband, Melika, et al.
Published: (2026)
by: Sepidband, Melika, et al.
Published: (2026)
Automated Prompt Engineering for Cost-Effective Code Generation Using Evolutionary Algorithm
by: Taherkhani, Hamed, et al.
Published: (2024)
by: Taherkhani, Hamed, et al.
Published: (2024)
Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions
by: Taherkhani, Hamed, et al.
Published: (2026)
by: Taherkhani, Hamed, et al.
Published: (2026)
Can ChatGPT Support Developers? An Empirical Evaluation of Large Language Models for Code Generation
by: Jin, Kailun, et al.
Published: (2024)
by: Jin, Kailun, et al.
Published: (2024)
Selection of Prompt Engineering Techniques for Code Generation through Predicting Code Complexity
by: Wang, Chung-Yu, et al.
Published: (2024)
by: Wang, Chung-Yu, et al.
Published: (2024)
Task-oriented Prompt Enhancement via Script Generation
by: Wang, Chung-Yu, et al.
Published: (2024)
by: Wang, Chung-Yu, et al.
Published: (2024)
Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy
by: Taherkhani, Hamed, et al.
Published: (2024)
by: Taherkhani, Hamed, et al.
Published: (2024)
Domain Adaptation for Code Model-based Unit Test Case Generation
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation
by: Abdollahi, Mohammad, et al.
Published: (2025)
by: Abdollahi, Mohammad, et al.
Published: (2025)
Deep Learning for Code Intelligence: Survey, Benchmark and Toolkit
by: Wan, Yao, et al.
Published: (2023)
by: Wan, Yao, et al.
Published: (2023)
FlakyFix: Using Large Language Models for Predicting Flaky Test Fix Categories and Test Code Repair
by: Fatima, Sakina, et al.
Published: (2023)
by: Fatima, Sakina, et al.
Published: (2023)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
by: Kim, Myeongsoo, et al.
Published: (2025)
by: Kim, Myeongsoo, et al.
Published: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
by: He, Yibo, et al.
Published: (2025)
by: He, Yibo, et al.
Published: (2025)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
by: Jiang, Hongchao, et al.
Published: (2025)
by: Jiang, Hongchao, et al.
Published: (2025)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
Retrieval-Augmented Test Generation: How Far Are We?
by: Shin, Jiho, et al.
Published: (2024)
by: Shin, Jiho, et al.
Published: (2024)
1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World
by: Xu, Qiao, et al.
Published: (2026)
by: Xu, Qiao, et al.
Published: (2026)
DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation
by: Xiao, Jingyu, et al.
Published: (2025)
by: Xiao, Jingyu, et al.
Published: (2025)
CodeAlignBench: Assessing Code Generation Models on Developer-Preferred Code Adjustments
by: Mehralian, Forough, et al.
Published: (2025)
by: Mehralian, Forough, et al.
Published: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
by: Padwal, Vedant
Published: (2026)
by: Padwal, Vedant
Published: (2026)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
by: Zhou, Qixing, et al.
Published: (2026)
by: Zhou, Qixing, et al.
Published: (2026)
GenCode: A Generic Data Augmentation Framework for Boosting Deep Learning-Based Code Understanding
by: Dong, Zeming, et al.
Published: (2024)
by: Dong, Zeming, et al.
Published: (2024)
Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs
by: Xie, Chen, et al.
Published: (2025)
by: Xie, Chen, et al.
Published: (2025)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
by: Zhuo, Terry Yue, et al.
Published: (2024)
by: Zhuo, Terry Yue, et al.
Published: (2024)
DeepCode: Open Agentic Coding
by: Li, Zongwei, et al.
Published: (2025)
by: Li, Zongwei, et al.
Published: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
by: Zhang, Zhe, et al.
Published: (2025)
by: Zhang, Zhe, et al.
Published: (2025)
Unraveling Code Clone Dynamics in Deep Learning Frameworks
by: Assi, Maram, et al.
Published: (2024)
by: Assi, Maram, et al.
Published: (2024)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
by: Zhang, Wentao, et al.
Published: (2026)
by: Zhang, Wentao, et al.
Published: (2026)
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
by: Wang, Yubang, et al.
Published: (2026)
by: Wang, Yubang, et al.
Published: (2026)
A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why?
by: Chen, QiHong, et al.
Published: (2024)
by: Chen, QiHong, et al.
Published: (2024)
UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian
by: Syromiatnikov, Mykyta, et al.
Published: (2025)
by: Syromiatnikov, Mykyta, et al.
Published: (2025)
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
by: Roy, Monoshi Kumar, et al.
Published: (2025)
by: Roy, Monoshi Kumar, et al.
Published: (2025)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
by: Aleithan, Reem, et al.
Published: (2024)
by: Aleithan, Reem, et al.
Published: (2024)
DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models
by: Kumarappan, Adarsh, et al.
Published: (2026)
by: Kumarappan, Adarsh, et al.
Published: (2026)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
SWE-QA: A Dataset and Benchmark for Complex Code Understanding
by: Elkoussy, Laïla, et al.
Published: (2026)
by: Elkoussy, Laïla, et al.
Published: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
by: Ni, Ziyi, et al.
Published: (2025)
by: Ni, Ziyi, et al.
Published: (2025)
Similar Items
-
RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models
by: Sepidband, Melika, et al.
Published: (2026) -
Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach
by: Sepidband, Melika, et al.
Published: (2025) -
On the Role of Fault Localization Context for LLM-Based Program Repair
by: Sepidband, Melika, et al.
Published: (2026) -
Automated Prompt Engineering for Cost-Effective Code Generation Using Evolutionary Algorithm
by: Taherkhani, Hamed, et al.
Published: (2024) -
Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions
by: Taherkhani, Hamed, et al.
Published: (2026)