CONCUR: Benchmarking LLMs for Concurrent Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Jue, Mahmud, Tarek, Pasareanu, Corina, Yang, Guowei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing LLM Code Generation with Ensembles: A Similarity-Based Selection Approach
par: Mahmud, Tarek, et autres
Publié: (2025)
par: Mahmud, Tarek, et autres
Publié: (2025)
StackEval: Benchmarking LLMs in Coding Assistance
par: Shah, Nidhish, et autres
Publié: (2024)
par: Shah, Nidhish, et autres
Publié: (2024)
Prophecy: Inferring Formal Properties from Neuron Activations
par: Gopinath, Divya, et autres
Publié: (2025)
par: Gopinath, Divya, et autres
Publié: (2025)
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
par: Guo, Hanxi, et autres
Publié: (2025)
par: Guo, Hanxi, et autres
Publié: (2025)
A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation
par: Gu, Jian, et autres
Publié: (2025)
par: Gu, Jian, et autres
Publié: (2025)
CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation
par: Peng, Jinjun, et autres
Publié: (2025)
par: Peng, Jinjun, et autres
Publié: (2025)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
par: Xia, Yunhui, et autres
Publié: (2025)
par: Xia, Yunhui, et autres
Publié: (2025)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
par: Li, Yufei, et autres
Publié: (2024)
par: Li, Yufei, et autres
Publié: (2024)
IntentCoding: Amplifying User Intent in Code Generation
par: Fang, Zheng, et autres
Publié: (2026)
par: Fang, Zheng, et autres
Publié: (2026)
SelfCodeAlign: Self-Alignment for Code Generation
par: Wei, Yuxiang, et autres
Publié: (2024)
par: Wei, Yuxiang, et autres
Publié: (2024)
Rethinking Repetition Problems of LLMs in Code Generation
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
par: Yang, Rem, et autres
Publié: (2025)
par: Yang, Rem, et autres
Publié: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
par: Tong, Weixi, et autres
Publié: (2024)
par: Tong, Weixi, et autres
Publié: (2024)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
par: Yang, Dayu, et autres
Publié: (2025)
par: Yang, Dayu, et autres
Publié: (2025)
Evaluating Language Models for Efficient Code Generation
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
Wisdom and Delusion of LLM Ensembles for Code Generation and Repair
par: Vallecillos-Ruiz, Fernando, et autres
Publié: (2025)
par: Vallecillos-Ruiz, Fernando, et autres
Publié: (2025)
GiFT: Gibbs Fine-Tuning for Code Generation
par: Li, Haochen, et autres
Publié: (2025)
par: Li, Haochen, et autres
Publié: (2025)
MetaLint: Easy-to-Hard Generalization for Code Linting
par: Naik, Atharva, et autres
Publié: (2025)
par: Naik, Atharva, et autres
Publié: (2025)
Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
par: Xia, Chunqiu Steven, et autres
Publié: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
Test Code Generation for Telecom Software Systems using Two-Stage Generative Model
par: Nabeel, Mohamad, et autres
Publié: (2024)
par: Nabeel, Mohamad, et autres
Publié: (2024)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
par: Xie, Yiqing, et autres
Publié: (2026)
par: Xie, Yiqing, et autres
Publié: (2026)
AST-T5: Structure-Aware Pretraining for Code Generation and Understanding
par: Gong, Linyuan, et autres
Publié: (2024)
par: Gong, Linyuan, et autres
Publié: (2024)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
par: Riddell, Martin, et autres
Publié: (2024)
par: Riddell, Martin, et autres
Publié: (2024)
Code Generation with AlphaCodium: From Prompt Engineering to Flow Engineering
par: Ridnik, Tal, et autres
Publié: (2024)
par: Ridnik, Tal, et autres
Publié: (2024)
SceneGenAgent: Precise Industrial Scene Generation with Coding Agent
par: Xia, Xiao, et autres
Publié: (2024)
par: Xia, Xiao, et autres
Publié: (2024)
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation
par: Petrukha, Ivan, et autres
Publié: (2025)
par: Petrukha, Ivan, et autres
Publié: (2025)
Towards Understanding What Code Language Models Learned
par: Ahmed, Toufique, et autres
Publié: (2023)
par: Ahmed, Toufique, et autres
Publié: (2023)
Inferring Properties of Graph Neural Networks
par: Nguyen, Dat, et autres
Publié: (2024)
par: Nguyen, Dat, et autres
Publié: (2024)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
par: Haider, Md. Asif, et autres
Publié: (2024)
par: Haider, Md. Asif, et autres
Publié: (2024)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
par: Gu, Jian, et autres
Publié: (2023)
par: Gu, Jian, et autres
Publié: (2023)
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models
par: Weyssow, Martin, et autres
Publié: (2023)
par: Weyssow, Martin, et autres
Publié: (2023)
CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing
par: He, Xinyi, et autres
Publié: (2024)
par: He, Xinyi, et autres
Publié: (2024)
Automatic Pull Request Description Generation Using LLMs: A T5 Model Approach
par: Sakib, Md Nazmus, et autres
Publié: (2024)
par: Sakib, Md Nazmus, et autres
Publié: (2024)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
par: Ahmed, Toufique, et autres
Publié: (2024)
par: Ahmed, Toufique, et autres
Publié: (2024)
mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code
par: Skurla, Adam, et autres
Publié: (2026)
par: Skurla, Adam, et autres
Publié: (2026)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
par: Abdelaal, Mohamed, et autres
Publié: (2025)
par: Abdelaal, Mohamed, et autres
Publié: (2025)
RepoQA: Evaluating Long Context Code Understanding
par: Liu, Jiawei, et autres
Publié: (2024)
par: Liu, Jiawei, et autres
Publié: (2024)
Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs
par: Dai, Hankun, et autres
Publié: (2025)
par: Dai, Hankun, et autres
Publié: (2025)
VERINA: Benchmarking Verifiable Code Generation
par: Ye, Zhe, et autres
Publié: (2025)
par: Ye, Zhe, et autres
Publié: (2025)
Documents similaires
-
Enhancing LLM Code Generation with Ensembles: A Similarity-Based Selection Approach
par: Mahmud, Tarek, et autres
Publié: (2025) -
StackEval: Benchmarking LLMs in Coding Assistance
par: Shah, Nidhish, et autres
Publié: (2024) -
Prophecy: Inferring Formal Properties from Neuron Activations
par: Gopinath, Divya, et autres
Publié: (2025) -
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
par: Guo, Hanxi, et autres
Publié: (2025) -
A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation
par: Gu, Jian, et autres
Publié: (2025)