Guardado en:
| Autores principales: | Li, Yufei, Chen, Simin, Guo, Yanghong, Yang, Wei, Dong, Yue, Liu, Cong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.05939 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
PPM: Automated Generation of Diverse Programming Problems for Benchmarking Code Generation Models
por: Chen, Simin, et al.
Publicado: (2024)
por: Chen, Simin, et al.
Publicado: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025)
por: Chou, Jason, et al.
Publicado: (2025)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
por: Du, Mingzhe, et al.
Publicado: (2024)
por: Du, Mingzhe, et al.
Publicado: (2024)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
por: Feng, Xiaoning, et al.
Publicado: (2022)
por: Feng, Xiaoning, et al.
Publicado: (2022)
EffiCoder: Enhancing Code Generation in Large Language Models through Efficiency-Aware Fine-tuning
por: Huang, Dong, et al.
Publicado: (2024)
por: Huang, Dong, et al.
Publicado: (2024)
Bridging Code Graphs and Large Language Models for Better Code Understanding
por: Chen, Zeqi, et al.
Publicado: (2025)
por: Chen, Zeqi, et al.
Publicado: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
A Code Comprehension Benchmark for Large Language Models for Code
por: Havare, Jayant, et al.
Publicado: (2025)
por: Havare, Jayant, et al.
Publicado: (2025)
LLMigrate: Transforming "Lazy" Large Language Models into Efficient Source Code Migrators
por: Liu, Yuchen, et al.
Publicado: (2025)
por: Liu, Yuchen, et al.
Publicado: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
ICE-Score: Instructing Large Language Models to Evaluate Code
por: Zhuo, Terry Yue
Publicado: (2023)
por: Zhuo, Terry Yue
Publicado: (2023)
Is Your Benchmark (Still) Useful? Dynamic Benchmarking for Code Language Models
por: Guan, Batu, et al.
Publicado: (2025)
por: Guan, Batu, et al.
Publicado: (2025)
CODEMENV: Benchmarking Large Language Models on Code Migration
por: Cheng, Keyuan, et al.
Publicado: (2025)
por: Cheng, Keyuan, et al.
Publicado: (2025)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
por: Deng, Ken, et al.
Publicado: (2024)
por: Deng, Ken, et al.
Publicado: (2024)
Large Language Models are Qualified Benchmark Builders: Rebuilding Pre-Training Datasets for Advancing Code Intelligence Tasks
por: Yang, Kang, et al.
Publicado: (2025)
por: Yang, Kang, et al.
Publicado: (2025)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
por: Lin, Hong Yi, et al.
Publicado: (2025)
por: Lin, Hong Yi, et al.
Publicado: (2025)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
por: Li, Kaixin, et al.
Publicado: (2023)
por: Li, Kaixin, et al.
Publicado: (2023)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback
por: Wallraven, Stephan, et al.
Publicado: (2026)
por: Wallraven, Stephan, et al.
Publicado: (2026)
Strengthening Programming Comprehension in Large Language Models through Code Generation
por: Ren, Xiaoning, et al.
Publicado: (2025)
por: Ren, Xiaoning, et al.
Publicado: (2025)
Calibration of Large Language Models on Code Summarization
por: Virk, Yuvraj, et al.
Publicado: (2024)
por: Virk, Yuvraj, et al.
Publicado: (2024)
Leveraging Print Debugging to Improve Code Generation in Large Language Models
por: Hu, Xueyu, et al.
Publicado: (2024)
por: Hu, Xueyu, et al.
Publicado: (2024)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
por: Huang, Yue, et al.
Publicado: (2023)
por: Huang, Yue, et al.
Publicado: (2023)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2024)
por: Zheng, Jiasheng, et al.
Publicado: (2024)
Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models
por: Zhuo, Terry Yue, et al.
Publicado: (2024)
por: Zhuo, Terry Yue, et al.
Publicado: (2024)
CodeMirage: Hallucinations in Code Generated by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024)
por: Agarwal, Vibhor, et al.
Publicado: (2024)
Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
por: Huang, Yuheng, et al.
Publicado: (2023)
por: Huang, Yuheng, et al.
Publicado: (2023)
Self-Explained Keywords Empower Large Language Models for Code Generation
por: Fan, Lishui, et al.
Publicado: (2024)
por: Fan, Lishui, et al.
Publicado: (2024)
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence
por: Guo, Daya, et al.
Publicado: (2024)
por: Guo, Daya, et al.
Publicado: (2024)
A Preliminary Study of Multilingual Code Language Models for Code Generation Task Using Translated Benchmarks
por: Dandamudi, Rohit, et al.
Publicado: (2024)
por: Dandamudi, Rohit, et al.
Publicado: (2024)
CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph Databases
por: Liu, Xiangyan, et al.
Publicado: (2024)
por: Liu, Xiangyan, et al.
Publicado: (2024)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
por: Zhao, Yuwei, et al.
Publicado: (2024)
por: Zhao, Yuwei, et al.
Publicado: (2024)
CodeS: Natural Language to Code Repository via Multi-Layer Sketch
por: Zan, Daoguang, et al.
Publicado: (2024)
por: Zan, Daoguang, et al.
Publicado: (2024)
Dafny as Verification-Aware Intermediate Language for Code Generation
por: Li, Yue Chen, et al.
Publicado: (2025)
por: Li, Yue Chen, et al.
Publicado: (2025)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
por: Liu, Jingyao, et al.
Publicado: (2025)
por: Liu, Jingyao, et al.
Publicado: (2025)
COBOL-Coder: Domain-Adapted Large Language Models for COBOL Code Generation and Translation
por: Dau, Anh T. V., et al.
Publicado: (2026)
por: Dau, Anh T. V., et al.
Publicado: (2026)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
por: Wu, Jiarong, et al.
Publicado: (2025)
por: Wu, Jiarong, et al.
Publicado: (2025)
Code Readability in the Age of Large Language Models: An Industrial Case Study from Atlassian
por: Takerngsaksiri, Wannita, et al.
Publicado: (2025)
por: Takerngsaksiri, Wannita, et al.
Publicado: (2025)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
por: Huang, Dong, et al.
Publicado: (2024)
por: Huang, Dong, et al.
Publicado: (2024)
Ejemplares similares
-
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025) -
PPM: Automated Generation of Diverse Programming Problems for Benchmarking Code Generation Models
por: Chen, Simin, et al.
Publicado: (2024) -
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
por: Chou, Jason, et al.
Publicado: (2025) -
Mercury: A Code Efficiency Benchmark for Code Large Language Models
por: Du, Mingzhe, et al.
Publicado: (2024) -
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
por: Feng, Xiaoning, et al.
Publicado: (2022)