Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Shastry, KN Ajay, Senrayan, Ganesh, Satapara, Shrey, Panda, Pranoy, Devaguptapu, Chaitanya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024)
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024)
EvoClaw: Evaluating AI Agents on Continuous Software Evolution
di: Deng, Gangda, et al.
Pubblicazione: (2026)
di: Deng, Gangda, et al.
Pubblicazione: (2026)
Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization
di: Peng, Huiyun, et al.
Pubblicazione: (2026)
di: Peng, Huiyun, et al.
Pubblicazione: (2026)
Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering
di: Ravuri, Chaitanya, et al.
Pubblicazione: (2025)
di: Ravuri, Chaitanya, et al.
Pubblicazione: (2025)
Theory of Code Space: Do Code Agents Understand Software Architecture?
di: Sapunov, Grigory
Pubblicazione: (2026)
di: Sapunov, Grigory
Pubblicazione: (2026)
OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source Software
di: Meng, Lingkai, et al.
Pubblicazione: (2025)
di: Meng, Lingkai, et al.
Pubblicazione: (2025)
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
di: Chen, Zhi, et al.
Pubblicazione: (2025)
di: Chen, Zhi, et al.
Pubblicazione: (2025)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action
di: Pujar, Saurabh, et al.
Pubblicazione: (2025)
di: Pujar, Saurabh, et al.
Pubblicazione: (2025)
Evaluating LLM-Based Test Generation Under Software Evolution
di: Haroon, Sabaat, et al.
Pubblicazione: (2026)
di: Haroon, Sabaat, et al.
Pubblicazione: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
di: Chen, Zhi, et al.
Pubblicazione: (2024)
di: Chen, Zhi, et al.
Pubblicazione: (2024)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution
di: Liu, Aofan, et al.
Pubblicazione: (2025)
di: Liu, Aofan, et al.
Pubblicazione: (2025)
Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents
di: Kovács, Ádám
Pubblicazione: (2026)
di: Kovács, Ádám
Pubblicazione: (2026)
Architecture Without Architects: How AI Coding Agents Shape Software Architecture
di: Konrad, Phongsakon Mark, et al.
Pubblicazione: (2026)
di: Konrad, Phongsakon Mark, et al.
Pubblicazione: (2026)
The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents
di: Kim, Yelin
Pubblicazione: (2026)
di: Kim, Yelin
Pubblicazione: (2026)
OrcaLoca: An LLM Agent Framework for Software Issue Localization
di: Yu, Zhongming, et al.
Pubblicazione: (2025)
di: Yu, Zhongming, et al.
Pubblicazione: (2025)
MERA Code: A Unified Framework for Evaluating Code Generation Across Tasks
di: Chervyakov, Artem, et al.
Pubblicazione: (2025)
di: Chervyakov, Artem, et al.
Pubblicazione: (2025)
AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
Identifying Performance-Sensitive Configurations in Software Systems through Code Analysis with LLM Agents
di: Wang, Zehao, et al.
Pubblicazione: (2024)
di: Wang, Zehao, et al.
Pubblicazione: (2024)
ALMAS: an Autonomous LLM-based Multi-Agent Software Engineering Framework
di: Tawosi, Vali, et al.
Pubblicazione: (2025)
di: Tawosi, Vali, et al.
Pubblicazione: (2025)
AgentMesh: A Cooperative Multi-Agent Generative AI Framework for Software Development Automation
di: Khanzadeh, Sourena
Pubblicazione: (2025)
di: Khanzadeh, Sourena
Pubblicazione: (2025)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
di: Li, Yuangang, et al.
Pubblicazione: (2026)
di: Li, Yuangang, et al.
Pubblicazione: (2026)
Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems
di: Akshathala, Sreemaee, et al.
Pubblicazione: (2025)
di: Akshathala, Sreemaee, et al.
Pubblicazione: (2025)
Loosely-Structured Software: Engineering Context, Structure, and Evolution Entropy in Runtime-Rewired Multi-Agent Systems
di: Zhang, Weihao, et al.
Pubblicazione: (2026)
di: Zhang, Weihao, et al.
Pubblicazione: (2026)
DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents
di: Hong, Sirui, et al.
Pubblicazione: (2026)
di: Hong, Sirui, et al.
Pubblicazione: (2026)
EvalSVA: Multi-Agent Evaluators for Next-Gen Software Vulnerability Assessment
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
di: Wen, Xin-Cheng, et al.
Pubblicazione: (2024)
Revisiting the Role of Natural Language Code Comments in Code Translation
di: Gupta, Monika, et al.
Pubblicazione: (2026)
di: Gupta, Monika, et al.
Pubblicazione: (2026)
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
di: Lin, Feng, et al.
Pubblicazione: (2024)
di: Lin, Feng, et al.
Pubblicazione: (2024)
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
di: Wang, Kaixin, et al.
Pubblicazione: (2025)
di: Wang, Kaixin, et al.
Pubblicazione: (2025)
Unified Software Engineering Agent as AI Software Engineer
di: Applis, Leonhard, et al.
Pubblicazione: (2025)
di: Applis, Leonhard, et al.
Pubblicazione: (2025)
Designing LLM-based Multi-Agent Systems for Software Engineering Tasks: Quality Attributes, Design Patterns and Rationale
di: Cai, Yangxiao, et al.
Pubblicazione: (2025)
di: Cai, Yangxiao, et al.
Pubblicazione: (2025)
RefAgent: A Multi-agent LLM-based Framework for Automatic Software Refactoring
di: Oueslati, Khouloud, et al.
Pubblicazione: (2025)
di: Oueslati, Khouloud, et al.
Pubblicazione: (2025)
Self-Evolving Software Agents
di: Robol, Marco, et al.
Pubblicazione: (2026)
di: Robol, Marco, et al.
Pubblicazione: (2026)
A Benchmark for Localizing Code and Non-Code Issues in Software Projects
di: Zhang, Zejun, et al.
Pubblicazione: (2025)
di: Zhang, Zejun, et al.
Pubblicazione: (2025)
Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling
di: Ni, Ziyi, et al.
Pubblicazione: (2024)
di: Ni, Ziyi, et al.
Pubblicazione: (2024)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
di: Shetty, Manish, et al.
Pubblicazione: (2025)
di: Shetty, Manish, et al.
Pubblicazione: (2025)
AgentStepper: Interactive Debugging of Software Development Agents
di: Hutter, Robert, et al.
Pubblicazione: (2026)
di: Hutter, Robert, et al.
Pubblicazione: (2026)
Lost in Transcription: How Speech-to-Text Errors Derail Code Understanding
di: Havare, Jayant, et al.
Pubblicazione: (2026)
di: Havare, Jayant, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024) -
EvoClaw: Evaluating AI Agents on Continuous Software Evolution
di: Deng, Gangda, et al.
Pubblicazione: (2026) -
Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization
di: Peng, Huiyun, et al.
Pubblicazione: (2026) -
Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering
di: Ravuri, Chaitanya, et al.
Pubblicazione: (2025) -
Theory of Code Space: Do Code Agents Understand Software Architecture?
di: Sapunov, Grigory
Pubblicazione: (2026)