The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents
Fuente:
arXiv
Salvato in:
| Autore principale: | Kim, Yelin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
di: Ren, Qingnan, et al.
Pubblicazione: (2026)
di: Ren, Qingnan, et al.
Pubblicazione: (2026)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
di: Yan, Lu, et al.
Pubblicazione: (2026)
di: Yan, Lu, et al.
Pubblicazione: (2026)
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024)
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024)
Unified Software Engineering Agent as AI Software Engineer
di: Applis, Leonhard, et al.
Pubblicazione: (2025)
di: Applis, Leonhard, et al.
Pubblicazione: (2025)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
di: Zhao, Bingchen, et al.
Pubblicazione: (2026)
di: Zhao, Bingchen, et al.
Pubblicazione: (2026)
CodeClash: Benchmarking Goal-Oriented Software Engineering
di: Yang, John, et al.
Pubblicazione: (2025)
di: Yang, John, et al.
Pubblicazione: (2025)
In-Context Code-Text Learning for Bimodal Software Engineering
di: Tang, Xunzhu, et al.
Pubblicazione: (2024)
di: Tang, Xunzhu, et al.
Pubblicazione: (2024)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
di: Xu, Xinbo, et al.
Pubblicazione: (2026)
di: Xu, Xinbo, et al.
Pubblicazione: (2026)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
Identifying Performance-Sensitive Configurations in Software Systems through Code Analysis with LLM Agents
di: Wang, Zehao, et al.
Pubblicazione: (2024)
di: Wang, Zehao, et al.
Pubblicazione: (2024)
Theory of Code Space: Do Code Agents Understand Software Architecture?
di: Sapunov, Grigory
Pubblicazione: (2026)
di: Sapunov, Grigory
Pubblicazione: (2026)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
di: Orlanski, Gabriel, et al.
Pubblicazione: (2026)
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
di: Lin, Feng, et al.
Pubblicazione: (2024)
di: Lin, Feng, et al.
Pubblicazione: (2024)
SWE-smith: Scaling Data for Software Engineering Agents
di: Yang, John, et al.
Pubblicazione: (2025)
di: Yang, John, et al.
Pubblicazione: (2025)
Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents
di: Chen, Zhi, et al.
Pubblicazione: (2026)
di: Chen, Zhi, et al.
Pubblicazione: (2026)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling
di: Trae Research Team, et al.
Pubblicazione: (2025)
di: Trae Research Team, et al.
Pubblicazione: (2025)
Structurally Aligned Subtask-Level Memory for Software Engineering Agents
di: Shen, Kangning, et al.
Pubblicazione: (2026)
di: Shen, Kangning, et al.
Pubblicazione: (2026)
TOM-SWE: User Mental Modeling For Software Engineering Agents
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
di: Zhou, Xuhui, et al.
Pubblicazione: (2025)
AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action
di: Pujar, Saurabh, et al.
Pubblicazione: (2025)
di: Pujar, Saurabh, et al.
Pubblicazione: (2025)
daVinci-Dev: Agent-native Mid-training for Software Engineering
di: Zeng, Ji, et al.
Pubblicazione: (2026)
di: Zeng, Ji, et al.
Pubblicazione: (2026)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
di: Liang, Jiarong, et al.
Pubblicazione: (2026)
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering
di: Gong, Jingzhi, et al.
Pubblicazione: (2026)
di: Gong, Jingzhi, et al.
Pubblicazione: (2026)
From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents
di: Ma, Murong, et al.
Pubblicazione: (2026)
di: Ma, Murong, et al.
Pubblicazione: (2026)
MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering
di: Guo, Chuanzhe, et al.
Pubblicazione: (2026)
di: Guo, Chuanzhe, et al.
Pubblicazione: (2026)
Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents
di: Zhao, Chenyu, et al.
Pubblicazione: (2026)
di: Zhao, Chenyu, et al.
Pubblicazione: (2026)
Large Language Model-Based Agents for Software Engineering: A Survey
di: Liu, Junwei, et al.
Pubblicazione: (2024)
di: Liu, Junwei, et al.
Pubblicazione: (2024)
ALMAS: an Autonomous LLM-based Multi-Agent Software Engineering Framework
di: Tawosi, Vali, et al.
Pubblicazione: (2025)
di: Tawosi, Vali, et al.
Pubblicazione: (2025)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
di: Hu, Ruida, et al.
Pubblicazione: (2024)
di: Hu, Ruida, et al.
Pubblicazione: (2024)
Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization
di: Peng, Huiyun, et al.
Pubblicazione: (2026)
di: Peng, Huiyun, et al.
Pubblicazione: (2026)
Architecture Without Architects: How AI Coding Agents Shape Software Architecture
di: Konrad, Phongsakon Mark, et al.
Pubblicazione: (2026)
di: Konrad, Phongsakon Mark, et al.
Pubblicazione: (2026)
Accountable Agents in Software Engineering: An Analysis of Terms of Service and a Research Roadmap
di: Treude, Christoph
Pubblicazione: (2026)
di: Treude, Christoph
Pubblicazione: (2026)
Agyn: A Multi-Agent System for Team-Based Autonomous Software Engineering
di: Benkovich, Nikita, et al.
Pubblicazione: (2026)
di: Benkovich, Nikita, et al.
Pubblicazione: (2026)
AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents
di: Zhong, Hailin, et al.
Pubblicazione: (2026)
di: Zhong, Hailin, et al.
Pubblicazione: (2026)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
di: Tse-Hsun, et al.
Pubblicazione: (2026)
di: Tse-Hsun, et al.
Pubblicazione: (2026)
Understanding Software Engineering Agents: A Study of Thought-Action-Result Trajectories
di: Bouzenia, Islem, et al.
Pubblicazione: (2025)
di: Bouzenia, Islem, et al.
Pubblicazione: (2025)
Software Engineering Agents for Embodied Controller Generation : A Study in Minigrid Environments
di: Boulet, Timothé, et al.
Pubblicazione: (2025)
di: Boulet, Timothé, et al.
Pubblicazione: (2025)
Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution
di: Shastry, KN Ajay, et al.
Pubblicazione: (2026)
di: Shastry, KN Ajay, et al.
Pubblicazione: (2026)
Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
di: Zhou, Zhenhao, et al.
Pubblicazione: (2025)
di: Zhou, Zhenhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
di: Ren, Qingnan, et al.
Pubblicazione: (2026) -
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
di: Yan, Lu, et al.
Pubblicazione: (2026) -
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
di: Phan, Huy Nhat, et al.
Pubblicazione: (2024) -
Unified Software Engineering Agent as AI Software Engineer
di: Applis, Leonhard, et al.
Pubblicazione: (2025) -
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
di: Qiu, Jielin, et al.
Pubblicazione: (2025)