Repository Structure-Aware Training Makes SLMs Better Issue Resolver

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ma, Zexiong, An, Shengnan, Lin, Zeqi, Zou, Yanzhen, Xie, Bing
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866910764439175168
author Ma, Zexiong
An, Shengnan
Lin, Zeqi
Zou, Yanzhen
Xie, Bing
author_facet Ma, Zexiong
An, Shengnan
Lin, Zeqi
Zou, Yanzhen
Xie, Bing
contents Language models have been applied to various software development tasks, but the performance varies according to the scale of the models. Large Language Models (LLMs) outperform Small Language Models (SLMs) in complex tasks like repository-level issue resolving, but raise concerns about privacy and cost. In contrast, SLMs are more accessible but under-perform in complex tasks. In this paper, we introduce ReSAT (Repository Structure-Aware Training), construct training data based on a large number of issues and corresponding pull requests from open-source communities to enhance the model's understanding of repository structure and issue resolving ability. We construct two types of training data: (1) localization training data, a multi-level progressive localization data to improve code understanding and localization capability; (2) code edit training data, which improves context-based code editing capability. The evaluation results on SWE-Bench-verified and RepoQA demonstrate that ReSAT effectively enhances SLMs' issue-resolving and repository-level long-context understanding capabilities.
format Preprint
id arxiv_https___arxiv_org_abs_2412_19031
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Repository Structure-Aware Training Makes SLMs Better Issue Resolver
Ma, Zexiong
An, Shengnan
Lin, Zeqi
Zou, Yanzhen
Xie, Bing
Software Engineering
Artificial Intelligence
Language models have been applied to various software development tasks, but the performance varies according to the scale of the models. Large Language Models (LLMs) outperform Small Language Models (SLMs) in complex tasks like repository-level issue resolving, but raise concerns about privacy and cost. In contrast, SLMs are more accessible but under-perform in complex tasks. In this paper, we introduce ReSAT (Repository Structure-Aware Training), construct training data based on a large number of issues and corresponding pull requests from open-source communities to enhance the model's understanding of repository structure and issue resolving ability. We construct two types of training data: (1) localization training data, a multi-level progressive localization data to improve code understanding and localization capability; (2) code edit training data, which improves context-based code editing capability. The evaluation results on SWE-Bench-verified and RepoQA demonstrate that ReSAT effectively enhances SLMs' issue-resolving and repository-level long-context understanding capabilities.
title Repository Structure-Aware Training Makes SLMs Better Issue Resolver
topic Software Engineering
Artificial Intelligence
url https://arxiv.org/abs/2412.19031