Evaluating Large Language Models for Code Review
Fuente:
arXiv
Saved in:
| Main Authors: | Cihan, Umut, İçöz, Arda, Haratian, Vahid, Tüzün, Eray |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review
by: Kamalı, Hüseyin Özgür, et al.
Published: (2026)
by: Kamalı, Hüseyin Özgür, et al.
Published: (2026)
Automated Code Review In Practice
by: Cihan, Umut, et al.
Published: (2024)
by: Cihan, Umut, et al.
Published: (2024)
Automated Code Review Using Large Language Models with Symbolic Reasoning
by: Icoz, Busra, et al.
Published: (2025)
by: Icoz, Busra, et al.
Published: (2025)
RefExpo: Unveiling Software Project Structures through Advanced Dependency Graph Extraction
by: Haratian, Vahid, et al.
Published: (2024)
by: Haratian, Vahid, et al.
Published: (2024)
PR-Aware Automated Unit Test Generation: Challenges and Opportunities
by: Haratian, Vahid, et al.
Published: (2026)
by: Haratian, Vahid, et al.
Published: (2026)
Understanding the Limits of Automated Evaluation for Code Review Bots in Practice
by: Karakaya, Veli, et al.
Published: (2026)
by: Karakaya, Veli, et al.
Published: (2026)
Factors Influencing the Quality of AI-Generated Code: A Synthesis of Empirical Evidence
by: Geruslu, Vehid, et al.
Published: (2026)
by: Geruslu, Vehid, et al.
Published: (2026)
Agents in the Sandbox: End-to-End Crash Bug Reproduction for Minecraft
by: Yapağcı, Eray, et al.
Published: (2025)
by: Yapağcı, Eray, et al.
Published: (2025)
Automated Classification of Human Code Review Comments with Large Language Models
by: Çağlar, Semih, et al.
Published: (2026)
by: Çağlar, Semih, et al.
Published: (2026)
ImproBR: Bug Report Improver Using LLMs
by: Akyol, Emre Furkan, et al.
Published: (2026)
by: Akyol, Emre Furkan, et al.
Published: (2026)
Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports
by: Gon, Mahmut Furkan, et al.
Published: (2026)
by: Gon, Mahmut Furkan, et al.
Published: (2026)
Past, Present, and Future of Bug Tracking in the Generative AI Era
by: Torun, Utku Boran, et al.
Published: (2025)
by: Torun, Utku Boran, et al.
Published: (2025)
Towards Automated Detection of Inline Code Comment Smells
by: Oztas, Ipek, et al.
Published: (2025)
by: Oztas, Ipek, et al.
Published: (2025)
Evaluating the Impact of Data Cleaning on the Quality of Generated Pull Request Descriptions
by: Tire, Kutay, et al.
Published: (2025)
by: Tire, Kutay, et al.
Published: (2025)
Combining Large Language Models with Static Analyzers for Code Review Generation
by: Jaoua, Imen, et al.
Published: (2025)
by: Jaoua, Imen, et al.
Published: (2025)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
by: Macedo, Marcos, et al.
Published: (2024)
by: Macedo, Marcos, et al.
Published: (2024)
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
by: He, Mengliang, et al.
Published: (2025)
by: He, Mengliang, et al.
Published: (2025)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
by: Xiong, Zhanhang, et al.
Published: (2025)
by: Xiong, Zhanhang, et al.
Published: (2025)
CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models
by: Padwal, Vedant
Published: (2026)
by: Padwal, Vedant
Published: (2026)
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
by: Meaden, James, et al.
Published: (2025)
by: Meaden, James, et al.
Published: (2025)
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
by: Xu, Jingxuan, et al.
Published: (2025)
by: Xu, Jingxuan, et al.
Published: (2025)
Evaluating Large Language Models in Code Generation: INFINITE Methodology for Defining the Inference Index
by: Christakis, Nicholas, et al.
Published: (2025)
by: Christakis, Nicholas, et al.
Published: (2025)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
by: Zhang, Tanghaoran, et al.
Published: (2026)
by: Zhang, Tanghaoran, et al.
Published: (2026)
Automating Patch Set Generation from Code Review Comments Using Large Language Models
by: Rahman, Tajmilur, et al.
Published: (2024)
by: Rahman, Tajmilur, et al.
Published: (2024)
Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
by: Hamedi, Parisa, et al.
Published: (2025)
by: Hamedi, Parisa, et al.
Published: (2025)
WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
by: Lei, Xinping, et al.
Published: (2026)
by: Lei, Xinping, et al.
Published: (2026)
RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
by: Lin, Feng, et al.
Published: (2025)
by: Lin, Feng, et al.
Published: (2025)
Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML
by: Mundhra, Yash, et al.
Published: (2025)
by: Mundhra, Yash, et al.
Published: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
by: Yin, Wenjing, et al.
Published: (2025)
by: Yin, Wenjing, et al.
Published: (2025)
Task Abstention for Large Language Models in Code Generation
by: Zhou, Yanke, et al.
Published: (2026)
by: Zhou, Yanke, et al.
Published: (2026)
A Tertiary Review of Large Language Model-Based Code Generating Tasks: Trends, Challenges, and Future Directions
by: Chochlov, Muslim, et al.
Published: (2026)
by: Chochlov, Muslim, et al.
Published: (2026)
Augmenting Large Language Models with Static Code Analysis for Automated Code Quality Improvements
by: Abtahi, Seyed Moein, et al.
Published: (2025)
by: Abtahi, Seyed Moein, et al.
Published: (2025)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
by: Hou, Shuyang, et al.
Published: (2024)
by: Hou, Shuyang, et al.
Published: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
by: Kammakomati, Mehant, et al.
Published: (2024)
by: Kammakomati, Mehant, et al.
Published: (2024)
Large Language Model Guided Self-Debugging Code Generation
by: Adnan, Muntasir, et al.
Published: (2025)
by: Adnan, Muntasir, et al.
Published: (2025)
Personality-Guided Code Generation Using Large Language Models
by: Guo, Yaoqi, et al.
Published: (2024)
by: Guo, Yaoqi, et al.
Published: (2024)
Bugs in Large Language Models Generated Code: An Empirical Study
by: Tambon, Florian, et al.
Published: (2024)
by: Tambon, Florian, et al.
Published: (2024)
Assessing the Code Clone Detection Capability of Large Language Models
by: Zhang, Zixian, et al.
Published: (2024)
by: Zhang, Zixian, et al.
Published: (2024)
ICE-Score: Instructing Large Language Models to Evaluate Code
by: Zhuo, Terry Yue
Published: (2023)
by: Zhuo, Terry Yue
Published: (2023)
SERSEM: Selective Entropy-Weighted Scoring for Membership Inference in Code Language Models
by: Dikici, Kıvanç Kuzey, et al.
Published: (2026)
by: Dikici, Kıvanç Kuzey, et al.
Published: (2026)
Similar Items
-
Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review
by: Kamalı, Hüseyin Özgür, et al.
Published: (2026) -
Automated Code Review In Practice
by: Cihan, Umut, et al.
Published: (2024) -
Automated Code Review Using Large Language Models with Symbolic Reasoning
by: Icoz, Busra, et al.
Published: (2025) -
RefExpo: Unveiling Software Project Structures through Advanced Dependency Graph Extraction
by: Haratian, Vahid, et al.
Published: (2024) -
PR-Aware Automated Unit Test Generation: Challenges and Opportunities
by: Haratian, Vahid, et al.
Published: (2026)