SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Han, Tingxu, Zhang, Yi, Song, Wei, Fang, Chunrong, Chen, Zhenyu, Sun, Youcheng, Hu, Lijie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SWE-World: Building Software Engineering Agents in Docker-Free Environments
von: Sun, Shuang, et al.
Veröffentlicht: (2026)
von: Sun, Shuang, et al.
Veröffentlicht: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
von: Liang, Jiarong, et al.
Veröffentlicht: (2026)
von: Liang, Jiarong, et al.
Veröffentlicht: (2026)
RUM: Rule+LLM-Based Comprehensive Assessment on Testing Skills
von: Wang, Yue, et al.
Veröffentlicht: (2025)
von: Wang, Yue, et al.
Veröffentlicht: (2025)
Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding
von: Han, Tingxu, et al.
Veröffentlicht: (2026)
von: Han, Tingxu, et al.
Veröffentlicht: (2026)
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering
von: Gong, Jingzhi, et al.
Veröffentlicht: (2026)
von: Gong, Jingzhi, et al.
Veröffentlicht: (2026)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
von: Mhatre, Sanket, et al.
Veröffentlicht: (2025)
von: Mhatre, Sanket, et al.
Veröffentlicht: (2025)
CL4SE: Benchmarking Context Learning on Software Engineering
von: Hu, Haichuan, et al.
Veröffentlicht: (2026)
von: Hu, Haichuan, et al.
Veröffentlicht: (2026)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
von: Song, Huatong, et al.
Veröffentlicht: (2026)
von: Song, Huatong, et al.
Veröffentlicht: (2026)
SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
von: Deng, Xiang, et al.
Veröffentlicht: (2025)
von: Deng, Xiang, et al.
Veröffentlicht: (2025)
A Survey on Large Language Models for Software Engineering
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
Training Software Engineering Agents and Verifiers with SWE-Gym
von: Pan, Jiayi, et al.
Veröffentlicht: (2024)
von: Pan, Jiayi, et al.
Veröffentlicht: (2024)
Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents
von: Yang, Zonghan, et al.
Veröffentlicht: (2025)
von: Yang, Zonghan, et al.
Veröffentlicht: (2025)
SGAgent: Suggestion-Guided LLM-Based Multi-Agent Framework for Repository-Level Software Repair
von: Zhang, Quanjun, et al.
Veröffentlicht: (2026)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2026)
ACTesting: Automated Cross-modal Testing Method of Text-to-Image Software
von: Gu, Siqi, et al.
Veröffentlicht: (2023)
von: Gu, Siqi, et al.
Veröffentlicht: (2023)
A Critical Review of Large Language Model on Software Engineering: An Example from ChatGPT and Automated Program Repair
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2023)
TOM-SWE: User Mental Modeling For Software Engineering Agents
von: Zhou, Xuhui, et al.
Veröffentlicht: (2025)
von: Zhou, Xuhui, et al.
Veröffentlicht: (2025)
More Skills, Worse Agents? Skill Shadowing Degrades Performance When Expanding Skill Libraries
von: Song, Hongwen, et al.
Veröffentlicht: (2026)
von: Song, Hongwen, et al.
Veröffentlicht: (2026)
SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding
von: Tan, Boyin, et al.
Veröffentlicht: (2026)
von: Tan, Boyin, et al.
Veröffentlicht: (2026)
Establishing Software Engineering Design Competence with Soft Skills
von: Capretz, Luiz Fernando
Veröffentlicht: (2024)
von: Capretz, Luiz Fernando
Veröffentlicht: (2024)
SWE-Bench+: Enhanced Coding Benchmark for LLMs
von: Aleithan, Reem, et al.
Veröffentlicht: (2024)
von: Aleithan, Reem, et al.
Veröffentlicht: (2024)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
von: Ludwig, Nikolai, et al.
Veröffentlicht: (2026)
von: Ludwig, Nikolai, et al.
Veröffentlicht: (2026)
SWE-smith: Scaling Data for Software Engineering Agents
von: Yang, John, et al.
Veröffentlicht: (2025)
von: Yang, John, et al.
Veröffentlicht: (2025)
SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?
von: Miserendino, Samuel, et al.
Veröffentlicht: (2025)
von: Miserendino, Samuel, et al.
Veröffentlicht: (2025)
ReqInOne: A Large Language Model-Based Agent for Software Requirements Specification Generation
von: Zhu, Taohong, et al.
Veröffentlicht: (2025)
von: Zhu, Taohong, et al.
Veröffentlicht: (2025)
Does SWE-Bench-Verified Test Agent Ability or Model Memory?
von: Prathifkumar, Thanosan, et al.
Veröffentlicht: (2025)
von: Prathifkumar, Thanosan, et al.
Veröffentlicht: (2025)
SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies
von: Saxena, Siddhant, et al.
Veröffentlicht: (2026)
von: Saxena, Siddhant, et al.
Veröffentlicht: (2026)
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
von: Mateega, Spencer, et al.
Veröffentlicht: (2026)
von: Mateega, Spencer, et al.
Veröffentlicht: (2026)
TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models
von: Zhang, Quanjun, et al.
Veröffentlicht: (2024)
von: Zhang, Quanjun, et al.
Veröffentlicht: (2024)
Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution
von: Shang, Ye, et al.
Veröffentlicht: (2026)
von: Shang, Ye, et al.
Veröffentlicht: (2026)
Security of Language Models for Code: A Systematic Literature Review
von: Chen, Yuchen, et al.
Veröffentlicht: (2024)
von: Chen, Yuchen, et al.
Veröffentlicht: (2024)
SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
von: Badertdinov, Ibragim, et al.
Veröffentlicht: (2025)
von: Badertdinov, Ibragim, et al.
Veröffentlicht: (2025)
SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems
von: Pu, Hongji, et al.
Veröffentlicht: (2026)
von: Pu, Hongji, et al.
Veröffentlicht: (2026)
Understanding the Skills Gap between Higher Education Institutions and the Software Engineering Industry
von: Phan, Huy, et al.
Veröffentlicht: (2026)
von: Phan, Huy, et al.
Veröffentlicht: (2026)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
von: Ding, Yifeng, et al.
Veröffentlicht: (2026)
von: Ding, Yifeng, et al.
Veröffentlicht: (2026)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
von: Yuan, Danlong, et al.
Veröffentlicht: (2026)
von: Yuan, Danlong, et al.
Veröffentlicht: (2026)
SkillReducer: Optimizing LLM Agent Skills for Token Efficiency
von: Gao, Yudong, et al.
Veröffentlicht: (2026)
von: Gao, Yudong, et al.
Veröffentlicht: (2026)
Embracing Experiential Learning: Hackathons as an Educational Strategy for Shaping Soft Skills in Software Engineering
von: Araújo, Allysson Allex, et al.
Veröffentlicht: (2025)
von: Araújo, Allysson Allex, et al.
Veröffentlicht: (2025)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
von: Li, Jia, et al.
Veröffentlicht: (2026)
von: Li, Jia, et al.
Veröffentlicht: (2026)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
von: Chen, Mouxiang, et al.
Veröffentlicht: (2026)
von: Chen, Mouxiang, et al.
Veröffentlicht: (2026)
ATTest: Agent-Driven Tensor Testing for Deep Learning Library Modules
von: Zhan, Zhengyu, et al.
Veröffentlicht: (2026)
von: Zhan, Zhengyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SWE-World: Building Software Engineering Agents in Docker-Free Environments
von: Sun, Shuang, et al.
Veröffentlicht: (2026) -
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
von: Liang, Jiarong, et al.
Veröffentlicht: (2026) -
RUM: Rule+LLM-Based Comprehensive Assessment on Testing Skills
von: Wang, Yue, et al.
Veröffentlicht: (2025) -
Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding
von: Han, Tingxu, et al.
Veröffentlicht: (2026) -
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering
von: Gong, Jingzhi, et al.
Veröffentlicht: (2026)