DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Wenhao, Duan, Jinhao, Wei, Chunchen, Zhang, Li, Zhang, Yue, Xu, Kaidi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation
par: Fan, Haozhi, et autres
Publié: (2026)
par: Fan, Haozhi, et autres
Publié: (2026)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
par: Huang, Yiming, et autres
Publié: (2024)
par: Huang, Yiming, et autres
Publié: (2024)
IndustryCode: A Benchmark for Industry Code Generation
par: Zeng, Puyu, et autres
Publié: (2026)
par: Zeng, Puyu, et autres
Publié: (2026)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023)
par: Fu, Lingyue, et autres
Publié: (2023)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
par: Zhuo, Terry Yue, et autres
Publié: (2024)
par: Zhuo, Terry Yue, et autres
Publié: (2024)
A Code Comprehension Benchmark for Large Language Models for Code
par: Havare, Jayant, et autres
Publié: (2025)
par: Havare, Jayant, et autres
Publié: (2025)
Coding Triangle: How Does Large Language Model Understand Code?
par: Zhang, Taolin, et autres
Publié: (2025)
par: Zhang, Taolin, et autres
Publié: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
par: Wang, Peiding, et autres
Publié: (2025)
par: Wang, Peiding, et autres
Publié: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
par: Wang, Xinchen, et autres
Publié: (2025)
par: Wang, Xinchen, et autres
Publié: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
ICE-Score: Instructing Large Language Models to Evaluate Code
par: Zhuo, Terry Yue
Publié: (2023)
par: Zhuo, Terry Yue
Publié: (2023)
Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMs
par: Zhang, Zhuoxuan, et autres
Publié: (2025)
par: Zhang, Zhuoxuan, et autres
Publié: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
par: Yu, Huimu, et autres
Publié: (2024)
par: Yu, Huimu, et autres
Publié: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models
par: Cao, Jialun, et autres
Publié: (2024)
par: Cao, Jialun, et autres
Publié: (2024)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
par: Shi, Wenqi, et autres
Publié: (2024)
par: Shi, Wenqi, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guarantees
par: Wang, Zhiyuan, et autres
Publié: (2024)
par: Wang, Zhiyuan, et autres
Publié: (2024)
ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models
par: Han, Hojae, et autres
Publié: (2024)
par: Han, Hojae, et autres
Publié: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
par: Kammakomati, Mehant, et autres
Publié: (2024)
par: Kammakomati, Mehant, et autres
Publié: (2024)
Dafny as Verification-Aware Intermediate Language for Code Generation
par: Li, Yue Chen, et autres
Publié: (2025)
par: Li, Yue Chen, et autres
Publié: (2025)
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases
par: Liu, Xiangyan, et autres
Publié: (2024)
par: Liu, Xiangyan, et autres
Publié: (2024)
Benchmarking LLM Code Generation for Audio Programming with Visual Dataflow Languages
par: Zhang, William, et autres
Publié: (2024)
par: Zhang, William, et autres
Publié: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models
par: Tang, Xiangru, et autres
Publié: (2023)
par: Tang, Xiangru, et autres
Publié: (2023)
Task as Context Prompting for Accurate Medical Symptom Coding Using Large Language Models
par: He, Chengyang, et autres
Publié: (2025)
par: He, Chengyang, et autres
Publié: (2025)
RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation
par: Zhou, Changzhi, et autres
Publié: (2025)
par: Zhou, Changzhi, et autres
Publié: (2025)
Evaluating Quantized Large Language Models for Code Generation on Low-Resource Language Benchmarks
par: Nyamsuren, Enkhbold
Publié: (2024)
par: Nyamsuren, Enkhbold
Publié: (2024)
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
par: Chon, Heejae, et autres
Publié: (2024)
par: Chon, Heejae, et autres
Publié: (2024)
EpiCoder: Encompassing Diversity and Complexity in Code Generation
par: Wang, Yaoxiang, et autres
Publié: (2025)
par: Wang, Yaoxiang, et autres
Publié: (2025)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
Multi-Programming Language Ensemble for Code Generation in Large Language Model
par: Xue, Tengfei, et autres
Publié: (2024)
par: Xue, Tengfei, et autres
Publié: (2024)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
par: Yadav, Ankit, et autres
Publié: (2024)
par: Yadav, Ankit, et autres
Publié: (2024)
A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks
par: Dandamudi, Rohit, et autres
Publié: (2024)
par: Dandamudi, Rohit, et autres
Publié: (2024)
OctoPack: Instruction Tuning Code Large Language Models
par: Muennighoff, Niklas, et autres
Publié: (2023)
par: Muennighoff, Niklas, et autres
Publié: (2023)
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
par: Luo, Ziyang, et autres
Publié: (2023)
par: Luo, Ziyang, et autres
Publié: (2023)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
par: Wang, Hanbin, et autres
Publié: (2025)
par: Wang, Hanbin, et autres
Publié: (2025)
Documents similaires
-
IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation
par: Fan, Haozhi, et autres
Publié: (2026) -
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
par: Huang, Yiming, et autres
Publié: (2024) -
IndustryCode: A Benchmark for Industry Code Generation
par: Zeng, Puyu, et autres
Publié: (2026) -
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023) -
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
par: Zhuo, Terry Yue, et autres
Publié: (2024)