CodeClash: Benchmarking Goal-Oriented Software Engineering
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, John, Lieret, Kilian, Yang, Joyce, Jimenez, Carlos E., Oblokulov, Muhtasham, Siddiqui, Aryan, Press, Ofir, Schmidt, Ludwig, Yang, Diyi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SWE-smith: Scaling Data for Software Engineering Agents
by: Yang, John, et al.
Published: (2025)
by: Yang, John, et al.
Published: (2025)
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
by: Yang, John, et al.
Published: (2024)
by: Yang, John, et al.
Published: (2024)
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
by: Yang, John, et al.
Published: (2024)
by: Yang, John, et al.
Published: (2024)
ProgramBench: Can Language Models Rebuild Programs From Scratch?
by: Yang, John, et al.
Published: (2026)
by: Yang, John, et al.
Published: (2026)
Chain of Draft for Software Engineering: Challenges in Applying Concise Reasoning to Code Tasks
by: Yang, Shaoyi
Published: (2025)
by: Yang, Shaoyi
Published: (2025)
Teaching Requirements Engineering for AI: A Goal-Oriented Approach in Software Engineering Courses
by: Batista, Beatriz, et al.
Published: (2024)
by: Batista, Beatriz, et al.
Published: (2024)
The EmpathiSEr: Development and Validation of Software Engineering Oriented Empathy Scales
by: Gunatilake, Hashini, et al.
Published: (2025)
by: Gunatilake, Hashini, et al.
Published: (2025)
Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review
by: Yang-Smith, Corey, et al.
Published: (2026)
by: Yang-Smith, Corey, et al.
Published: (2026)
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
by: Jimenez, Carlos E., et al.
Published: (2023)
by: Jimenez, Carlos E., et al.
Published: (2023)
A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks
by: Yin, Zhuowen, et al.
Published: (2025)
by: Yin, Zhuowen, et al.
Published: (2025)
Bridging the Quantum Divide: Aligning Academic and Industry Goals in Software Engineering
by: Zappin, Jake, et al.
Published: (2025)
by: Zappin, Jake, et al.
Published: (2025)
Maintaining the Heterogeneity in the Organization of Software Engineering Research
by: Yue, Yang, et al.
Published: (2026)
by: Yue, Yang, et al.
Published: (2026)
A Benchmark for Localizing Code and Non-Code Issues in Software Projects
by: Zhang, Zejun, et al.
Published: (2025)
by: Zhang, Zejun, et al.
Published: (2025)
SWE-chat: Coding Agent Interactions From Real Users in the Wild
by: Baumann, Joachim, et al.
Published: (2026)
by: Baumann, Joachim, et al.
Published: (2026)
A Survey on Large Language Models for Software Engineering
by: Zhang, Quanjun, et al.
Published: (2023)
by: Zhang, Quanjun, et al.
Published: (2023)
In-Context Code-Text Learning for Bimodal Software Engineering
by: Tang, Xunzhu, et al.
Published: (2024)
by: Tang, Xunzhu, et al.
Published: (2024)
Promptware Engineering: Software Engineering for Prompt-Enabled Systems
by: Chen, Zhenpeng, et al.
Published: (2025)
by: Chen, Zhenpeng, et al.
Published: (2025)
Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
by: Fu, Kelin, et al.
Published: (2025)
by: Fu, Kelin, et al.
Published: (2025)
Peer Code Review in Research Software Development: The Research Software Engineer Perspective
by: Malik, Md Ariful Islam, et al.
Published: (2025)
by: Malik, Md Ariful Islam, et al.
Published: (2025)
Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
by: Xiong, Qian, et al.
Published: (2025)
by: Xiong, Qian, et al.
Published: (2025)
SELU: A Software Engineering Language Understanding Benchmark
by: Peña, Fabian C., et al.
Published: (2025)
by: Peña, Fabian C., et al.
Published: (2025)
Challenges and Paths Towards AI for Software Engineering
by: Gu, Alex, et al.
Published: (2025)
by: Gu, Alex, et al.
Published: (2025)
Lost in Code Generation: Reimagining the Role of Software Models in AI-driven Software Engineering
by: Cito, Jürgen, et al.
Published: (2025)
by: Cito, Jürgen, et al.
Published: (2025)
Object-Oriented Architecture: A Software Engineering-Inspired Shape Grammar for Durands Plates
by: Agarwal, Rohan
Published: (2024)
by: Agarwal, Rohan
Published: (2024)
Industrial Code Quality Benchmarks: Toward Gamification of Software Maintainability
by: Borg, Markus, et al.
Published: (2024)
by: Borg, Markus, et al.
Published: (2024)
A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management
by: Liu, Yang, et al.
Published: (2026)
by: Liu, Yang, et al.
Published: (2026)
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
by: Li, Jia, et al.
Published: (2026)
by: Li, Jia, et al.
Published: (2026)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
by: Hu, Ruida, et al.
Published: (2024)
by: Hu, Ruida, et al.
Published: (2024)
Efficient and Green Large Language Models for Software Engineering: Literature Review, Vision, and the Road Ahead
by: Shi, Jieke, et al.
Published: (2024)
by: Shi, Jieke, et al.
Published: (2024)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
by: Sonwane, Atharv, et al.
Published: (2026)
by: Sonwane, Atharv, et al.
Published: (2026)
A Survey of Reinforcement Learning for Software Engineering
by: Wang, Dong, et al.
Published: (2025)
by: Wang, Dong, et al.
Published: (2025)
Belonging Beyond Code: Queer Software Engineering and Humanities Student Experiences
by: Vorderwülbeke, Emily, et al.
Published: (2025)
by: Vorderwülbeke, Emily, et al.
Published: (2025)
The Impact of AI Coding Assistants on Software Engineering: A Longitudinal Study
by: Vella, Annie, et al.
Published: (2026)
by: Vella, Annie, et al.
Published: (2026)
Do Comments and Expertise Still Matter? An Experiment on Programmers' Adoption of AI-Generated JavaScript Code
by: Li, Changwen, et al.
Published: (2025)
by: Li, Changwen, et al.
Published: (2025)
Agile Culture Clash: Unveiling Challenges in Cultivating an Agile Mindset in Organizations
by: Neumann, Michael, et al.
Published: (2024)
by: Neumann, Michael, et al.
Published: (2024)
When Code Becomes Abundant: Redefining Software Engineering Around Orchestration and Verification
by: Kohl, Karina, et al.
Published: (2026)
by: Kohl, Karina, et al.
Published: (2026)
From Requirements to Code: Understanding Developer Practices in LLM-Assisted Software Engineering
by: Ullrich, Jonathan, et al.
Published: (2025)
by: Ullrich, Jonathan, et al.
Published: (2025)
REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering
by: Shi, Junjie, et al.
Published: (2026)
by: Shi, Junjie, et al.
Published: (2026)
SWE-Sharp-Bench: A Reproducible Benchmark for C# Software Engineering Tasks
by: Mhatre, Sanket, et al.
Published: (2025)
by: Mhatre, Sanket, et al.
Published: (2025)
Similar Items
-
SWE-smith: Scaling Data for Software Engineering Agents
by: Yang, John, et al.
Published: (2025) -
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering
by: Yang, John, et al.
Published: (2024) -
SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?
by: Yang, John, et al.
Published: (2024) -
ProgramBench: Can Language Models Rebuild Programs From Scratch?
by: Yang, John, et al.
Published: (2026) -
Chain of Draft for Software Engineering: Challenges in Applying Concise Reasoning to Code Tasks
by: Yang, Shaoyi
Published: (2025)