Evaluating the Effectiveness of LLMs in Fixing Maintainability Issues in Real-World Projects
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nunes, Henrique, Figueiredo, Eduardo, Rocha, Larissa, Nadi, Sarah, Ferreira, Fischer, Esteves, Geanderson |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On LLMs' Internal Representation of Code Correctness
par: Ribeiro, Francisco, et autres
Publié: (2025)
par: Ribeiro, Francisco, et autres
Publié: (2025)
Transforming Software Development: Evaluating the Efficiency and Challenges of GitHub Copilot in Real-World Projects
par: Pandey, Ruchika, et autres
Publié: (2024)
par: Pandey, Ruchika, et autres
Publié: (2024)
A Note on Code Quality Score: LLMs for Maintainable Large Codebases
par: Wong, Sherman, et autres
Publié: (2025)
par: Wong, Sherman, et autres
Publié: (2025)
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs
par: Pham, Minh V. T., et autres
Publié: (2025)
par: Pham, Minh V. T., et autres
Publié: (2025)
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
par: Al-Kaswan, Ali, et autres
Publié: (2026)
par: Al-Kaswan, Ali, et autres
Publié: (2026)
Can Agents Fix Agent Issues?
par: Rahardja, Alfin Wijaya, et autres
Publié: (2025)
par: Rahardja, Alfin Wijaya, et autres
Publié: (2025)
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2024)
par: Chen, Zhi, et autres
Publié: (2024)
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents
par: Mündler, Niels, et autres
Publié: (2024)
par: Mündler, Niels, et autres
Publié: (2024)
Diverse LLMs vs. Vulnerabilities: Who Detects and Fixes Them Better?
par: Zibaeirad, Arastoo, et autres
Publié: (2025)
par: Zibaeirad, Arastoo, et autres
Publié: (2025)
RepoMasterEval: Evaluating Code Completion via Real-World Repositories
par: Wu, Qinyun, et autres
Publié: (2024)
par: Wu, Qinyun, et autres
Publié: (2024)
CIRCLE: A Framework for Evaluating AI from a Real-World Lens
par: Schwartz, Reva, et autres
Publié: (2026)
par: Schwartz, Reva, et autres
Publié: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML
par: Mundhra, Yash, et autres
Publié: (2025)
par: Mundhra, Yash, et autres
Publié: (2025)
Better Python Programming for all: With the focus on Maintainability
par: Shivashankar, Karthik, et autres
Publié: (2024)
par: Shivashankar, Karthik, et autres
Publié: (2024)
On the Effectiveness of LLMs for Manual Test Verifications
par: Peixoto, Myron David Lucena Campos, et autres
Publié: (2024)
par: Peixoto, Myron David Lucena Campos, et autres
Publié: (2024)
Evaluating the Use of LLMs for Automated DOM-Level Resolution of Web Performance Issues
par: Peters, Gideon, et autres
Publié: (2026)
par: Peters, Gideon, et autres
Publié: (2026)
LLM-Based Approach for Enhancing Maintainability of Automotive Architectures
par: Petrovic, Nenad, et autres
Publié: (2025)
par: Petrovic, Nenad, et autres
Publié: (2025)
Maintainability Challenges in ML: A Systematic Literature Review
par: Shivashankar, Karthik, et autres
Publié: (2024)
par: Shivashankar, Karthik, et autres
Publié: (2024)
Agentic Harness for Real-World Compilers
par: Zheng, Yingwei, et autres
Publié: (2026)
par: Zheng, Yingwei, et autres
Publié: (2026)
Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits
par: Zhu, Haichao, et autres
Publié: (2026)
par: Zhu, Haichao, et autres
Publié: (2026)
Echoes of AI: Investigating the Downstream Effects of AI Assistants on Software Maintainability
par: Borg, Markus, et autres
Publié: (2025)
par: Borg, Markus, et autres
Publié: (2025)
Evaluating LLMs for Visualization Tasks
par: Khan, Saadiq Rauf, et autres
Publié: (2025)
par: Khan, Saadiq Rauf, et autres
Publié: (2025)
How Effective Are Neural Networks for Fixing Security Vulnerabilities
par: Wu, Yi, et autres
Publié: (2023)
par: Wu, Yi, et autres
Publié: (2023)
Evaluating SAP Joule for Code Generation
par: Heisler, Joshua, et autres
Publié: (2025)
par: Heisler, Joshua, et autres
Publié: (2025)
FVSpec: Real-World Property-Based Tests as Lean Challenges
par: Dougherty, Quinn, et autres
Publié: (2026)
par: Dougherty, Quinn, et autres
Publié: (2026)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
par: Chen, Mouxiang, et autres
Publié: (2026)
par: Chen, Mouxiang, et autres
Publié: (2026)
Detecting and Fixing API Misuses of Data Science Libraries Using Large Language Models
par: Galappaththi, Akalanka, et autres
Publié: (2025)
par: Galappaththi, Akalanka, et autres
Publié: (2025)
Evaluating LLMs for One-Shot Patching of Real and Artificial Vulnerabilities
par: Garg, Aayush, et autres
Publié: (2025)
par: Garg, Aayush, et autres
Publié: (2025)
SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
par: Chen, Jialong, et autres
Publié: (2026)
par: Chen, Jialong, et autres
Publié: (2026)
Demystifying Issues, Causes and Solutions in LLM Open-Source Projects
par: Cai, Yangxiao, et autres
Publié: (2024)
par: Cai, Yangxiao, et autres
Publié: (2024)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
par: Liang, Jiarong, et autres
Publié: (2026)
par: Liang, Jiarong, et autres
Publié: (2026)
An Empirical Study of Proactive Coding Assistants in Real-World Software Development
par: Li, Lehui, et autres
Publié: (2026)
par: Li, Lehui, et autres
Publié: (2026)
Debug2Fix: Can Interactive Debugging Help Coding Agents Fix More Bugs?
par: Garg, Spandan, et autres
Publié: (2026)
par: Garg, Spandan, et autres
Publié: (2026)
Evaluating the Energy-Efficiency of the Code Generated by LLMs
par: Islam, Md Arman, et autres
Publié: (2025)
par: Islam, Md Arman, et autres
Publié: (2025)
Evaluating the Generalizability of LLMs in Automated Program Repair
par: Li, Fengjie, et autres
Publié: (2025)
par: Li, Fengjie, et autres
Publié: (2025)
Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs
par: Xie, Chen, et autres
Publié: (2025)
par: Xie, Chen, et autres
Publié: (2025)
A Benchmark for Localizing Code and Non-Code Issues in Software Projects
par: Zhang, Zejun, et autres
Publié: (2025)
par: Zhang, Zejun, et autres
Publié: (2025)
Toward Effective AI Governance: A Review of Principles
par: Ribeiro, Danilo, et autres
Publié: (2025)
par: Ribeiro, Danilo, et autres
Publié: (2025)
Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs
par: Ferdous, K M, et autres
Publié: (2026)
par: Ferdous, K M, et autres
Publié: (2026)
CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
par: Roy, Monoshi Kumar, et autres
Publié: (2025)
par: Roy, Monoshi Kumar, et autres
Publié: (2025)
Documents similaires
-
On LLMs' Internal Representation of Code Correctness
par: Ribeiro, Francisco, et autres
Publié: (2025) -
Transforming Software Development: Evaluating the Efficiency and Challenges of GitHub Copilot in Real-World Projects
par: Pandey, Ruchika, et autres
Publié: (2024) -
A Note on Code Quality Score: LLMs for Maintainable Large Codebases
par: Wong, Sherman, et autres
Publié: (2025) -
SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs
par: Pham, Minh V. T., et autres
Publié: (2025) -
Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs
par: Al-Kaswan, Ali, et autres
Publié: (2026)