Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
Fuente:
arXiv
Saved in:
| Main Authors: | Fu, Kelin, Liu, Tianyu, Shang, Zeyu, Ma, Yingwei, Yang, Jian, Liu, Jiaheng, Bian, Kaigui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SWE-World: Building Software Engineering Agents in Docker-Free Environments
by: Sun, Shuang, et al.
Published: (2026)
by: Sun, Shuang, et al.
Published: (2026)
KnowMap: Efficient Knowledge-Driven Task Adaptation for LLMs
by: Fu, Kelin, et al.
Published: (2025)
by: Fu, Kelin, et al.
Published: (2025)
PeriGuru: A Peripheral Robotic Mobile App Operation Assistant based on GUI Image Understanding and Prompting with LLM
by: Fu, Kelin, et al.
Published: (2024)
by: Fu, Kelin, et al.
Published: (2024)
DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder
by: Zhang, Jiaran, et al.
Published: (2026)
by: Zhang, Jiaran, et al.
Published: (2026)
Docker Does Not Guarantee Reproducibility
by: Malka, Julien, et al.
Published: (2026)
by: Malka, Julien, et al.
Published: (2026)
Patterns of Multi-Container Composition for Service Orchestration with Docker Compose
by: Eng, Kalvin, et al.
Published: (2023)
by: Eng, Kalvin, et al.
Published: (2023)
CL4SE: Benchmarking Context Learning on Software Engineering
by: Hu, Haichuan, et al.
Published: (2026)
by: Hu, Haichuan, et al.
Published: (2026)
A German Gold-Standard Dataset for Sentiment Analysis in Software Engineering
by: Obaidi, Martin, et al.
Published: (2025)
by: Obaidi, Martin, et al.
Published: (2025)
Understanding the Building Blocks of Accountability in Software Engineering
by: Alami, Adam, et al.
Published: (2024)
by: Alami, Adam, et al.
Published: (2024)
Scaling Coding Agents via Atomic Skills
by: Ma, Yingwei, et al.
Published: (2026)
by: Ma, Yingwei, et al.
Published: (2026)
An Effective Docker Image Slimming Approach Based on Source Code Data Dependency Analysis
by: Han, Jiaxuan, et al.
Published: (2025)
by: Han, Jiaxuan, et al.
Published: (2025)
Design and Implementation of Flutter based Multi-platform Docker Controller App
by: Saxena, Adarsh, et al.
Published: (2025)
by: Saxena, Adarsh, et al.
Published: (2025)
Ten Simple Rules for Catalyzing Collaborations and Building Bridges between Research Software Engineers and Software Engineering Researchers
by: Eisty, Nasir U., et al.
Published: (2025)
by: Eisty, Nasir U., et al.
Published: (2025)
Empirical Study of the Docker Smells Impact on the Image Size
by: Durieux, Thomas
Published: (2023)
by: Durieux, Thomas
Published: (2023)
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
by: Ma, Yingwei, et al.
Published: (2025)
by: Ma, Yingwei, et al.
Published: (2025)
Promptware Engineering: Software Engineering for Prompt-Enabled Systems
by: Chen, Zhenpeng, et al.
Published: (2025)
by: Chen, Zhenpeng, et al.
Published: (2025)
SELU: A Software Engineering Language Understanding Benchmark
by: Peña, Fabian C., et al.
Published: (2025)
by: Peña, Fabian C., et al.
Published: (2025)
Contenerización en Docker
by: Ortiz Medina, Brandon
Published: (2026)
by: Ortiz Medina, Brandon
Published: (2026)
ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation
by: Xianpeng, et al.
Published: (2026)
by: Xianpeng, et al.
Published: (2026)
Basilisk and Docker for Reproducible GN&C Simulation: A Workflow Reference
by: Gupta, Anubhav
Published: (2026)
by: Gupta, Anubhav
Published: (2026)
Do Advanced Language Models Eliminate the Need for Prompt Engineering in Software Engineering?
by: Wang, Guoqing, et al.
Published: (2024)
by: Wang, Guoqing, et al.
Published: (2024)
Lessons from a Pioneering Software Engineering Environment: Design Principles of Software through Pictures
by: I., Anthony, et al.
Published: (2024)
by: I., Anthony, et al.
Published: (2024)
The Essence of Software Engineering
Published: (2018)
Published: (2018)
Multilingual Multimodal Software Developer for Code Generation
by: Chai, Linzheng, et al.
Published: (2025)
by: Chai, Linzheng, et al.
Published: (2025)
EvalSVA: Multi-Agent Evaluators for Next-Gen Software Vulnerability Assessment
by: Wen, Xin-Cheng, et al.
Published: (2024)
by: Wen, Xin-Cheng, et al.
Published: (2024)
Story Arena: A Multi-Agent Environment for Envisioning the Future of Software Engineering
by: Weisz, Justin D., et al.
Published: (2025)
by: Weisz, Justin D., et al.
Published: (2025)
MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering
by: Guo, Chuanzhe, et al.
Published: (2026)
by: Guo, Chuanzhe, et al.
Published: (2026)
A Tool for Automatically Cataloguing and Selecting Pre-Trained Models and Datasets for Software Engineering
by: González, Alexandra, et al.
Published: (2026)
by: González, Alexandra, et al.
Published: (2026)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
by: Du, Junjia, et al.
Published: (2025)
by: Du, Junjia, et al.
Published: (2025)
Software Engineering Educational Experience in Building an Intelligent Tutoring System
by: Fan, Zhiyu, et al.
Published: (2023)
by: Fan, Zhiyu, et al.
Published: (2023)
DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents
by: Hong, Sirui, et al.
Published: (2026)
by: Hong, Sirui, et al.
Published: (2026)
Toward Automated Test Generation for Dockerfiles Based on Analysis of Docker Image Layers
by: Goto, Yuki, et al.
Published: (2025)
by: Goto, Yuki, et al.
Published: (2025)
Research Artifacts in Software Engineering Publications: Status and Trends
by: Liu, Mugeng, et al.
Published: (2024)
by: Liu, Mugeng, et al.
Published: (2024)
CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
by: Luo, Hanjun, et al.
Published: (2025)
by: Luo, Hanjun, et al.
Published: (2025)
M2rc-Eval: Massively Multilingual Repository-level Code Completion Evaluation
by: Liu, Jiaheng, et al.
Published: (2024)
by: Liu, Jiaheng, et al.
Published: (2024)
SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation
by: Ye, Zhifan, et al.
Published: (2025)
by: Ye, Zhifan, et al.
Published: (2025)
Building Software Engineering Capacity through a University Open Source Program Office
by: Holdener, Ekaterina, et al.
Published: (2024)
by: Holdener, Ekaterina, et al.
Published: (2024)
ALMAS: an Autonomous LLM-based Multi-Agent Software Engineering Framework
by: Tawosi, Vali, et al.
Published: (2025)
by: Tawosi, Vali, et al.
Published: (2025)
Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement
by: Ma, Yingwei, et al.
Published: (2024)
by: Ma, Yingwei, et al.
Published: (2024)
Automatic Building Code Review: A Case Study
by: Wan, Hanlong, et al.
Published: (2025)
by: Wan, Hanlong, et al.
Published: (2025)
Similar Items
-
SWE-World: Building Software Engineering Agents in Docker-Free Environments
by: Sun, Shuang, et al.
Published: (2026) -
KnowMap: Efficient Knowledge-Driven Task Adaptation for LLMs
by: Fu, Kelin, et al.
Published: (2025) -
PeriGuru: A Peripheral Robotic Mobile App Operation Assistant based on GUI Image Understanding and Prompting with LLM
by: Fu, Kelin, et al.
Published: (2024) -
DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder
by: Zhang, Jiaran, et al.
Published: (2026) -
Docker Does Not Guarantee Reproducibility
by: Malka, Julien, et al.
Published: (2026)