CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Muna, Rabeya Khatun, Rafi, Md Nakhla, Tse-Hsun, Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion
par: Rafi, Md Nakhla, et autres
Publié: (2024)
par: Rafi, Md Nakhla, et autres
Publié: (2024)
Back to the Future! Studying Data Cleanness in Defects4J and its Impact on Fault Localization
par: Rafi, Md Nakhla, et autres
Publié: (2023)
par: Rafi, Md Nakhla, et autres
Publié: (2023)
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
par: Shafin, Wasique Islam, et autres
Publié: (2025)
par: Shafin, Wasique Islam, et autres
Publié: (2025)
From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
Towards Better Graph Neural Network-based Fault Localization Through Enhanced Code Representation
par: Rafi, Md Nakhla, et autres
Publié: (2024)
par: Rafi, Md Nakhla, et autres
Publié: (2024)
SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests
par: Rafi, Md Nakhla, et autres
Publié: (2024)
par: Rafi, Md Nakhla, et autres
Publié: (2024)
Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization
par: Rafi, Md Nakhla, et autres
Publié: (2024)
par: Rafi, Md Nakhla, et autres
Publié: (2024)
Crash Report Enhancement with Large Language Models: An Empirical Study
par: Fahim, S M Farah Al, et autres
Publié: (2025)
par: Fahim, S M Farah Al, et autres
Publié: (2025)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
par: Xu, Yisen, et autres
Publié: (2026)
par: Xu, Yisen, et autres
Publié: (2026)
CIgrate: Automating CI Service Migration with Large Language Models
par: Hossain, Md Nazmul, et autres
Publié: (2025)
par: Hossain, Md Nazmul, et autres
Publié: (2025)
Patch Validation in Automated Vulnerability Repair
par: Yu, Zheng, et autres
Publié: (2026)
par: Yu, Zheng, et autres
Publié: (2026)
A Vision for Context-Aware CI Adoption Decisions
par: Alaini, Osamah H., et autres
Publié: (2026)
par: Alaini, Osamah H., et autres
Publié: (2026)
Exploring the Impact of Integrating UI Testing in CI/CD Workflows on GitHub
par: Gan, Xiaoxiao, et autres
Publié: (2025)
par: Gan, Xiaoxiao, et autres
Publié: (2025)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
par: Tse-Hsun, et autres
Publié: (2026)
par: Tse-Hsun, et autres
Publié: (2026)
CI at Scale: Lean, Green, and Fast
par: Juloori, Dhruva, et autres
Publié: (2025)
par: Juloori, Dhruva, et autres
Publié: (2025)
Intent-Aware Authorization for Zero Trust CI/CD
par: Avirneni, Surya Teja
Publié: (2025)
par: Avirneni, Surya Teja
Publié: (2025)
PPTAM$η$: Energy Aware CI/CD Pipeline for Container Based Applications
par: Aneggi, Alessandro, et autres
Publié: (2026)
par: Aneggi, Alessandro, et autres
Publié: (2026)
Heimdallr: Characterizing and Detecting LLM-Induced Security Risks in GitHub CI Workflows
par: Ruan, Bonan, et autres
Publié: (2026)
par: Ruan, Bonan, et autres
Publié: (2026)
PatchRecall: Patch-Driven Retrieval for Automated Program Repair
par: Dihan, Mahir Labib, et autres
Publié: (2026)
par: Dihan, Mahir Labib, et autres
Publié: (2026)
LogSage: An LLM-Based Framework for CI/CD Failure Detection and Remediation with Industrial Validation
par: Xu, Weiyuan, et autres
Publié: (2025)
par: Xu, Weiyuan, et autres
Publié: (2025)
Verificarlo CI: continuous integration for numerical optimization and debugging
par: Delval, Aurélien, et autres
Publié: (2024)
par: Delval, Aurélien, et autres
Publié: (2024)
Towards an Optimized Benchmarking Platform for CI/CD Pipelines
par: Japke, Nils, et autres
Publié: (2025)
par: Japke, Nils, et autres
Publié: (2025)
Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement
par: Kong, Jiaolong, et autres
Publié: (2025)
par: Kong, Jiaolong, et autres
Publié: (2025)
Cache-Related Smells in GitLab CI/CD: Comprehensive Catalog, Automated Detection, and Empirical Evidence
par: Urdih, Francesco, et autres
Publié: (2026)
par: Urdih, Francesco, et autres
Publié: (2026)
What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair
par: Martinez, Matias, et autres
Publié: (2026)
par: Martinez, Matias, et autres
Publié: (2026)
Empowering AIOps: Leveraging Large Language Models for IT Operations Management
par: Vitui, Arthur, et autres
Publié: (2025)
par: Vitui, Arthur, et autres
Publié: (2025)
On Rank Aggregating Test Prioritizations
par: Mondal, Shouvick, et autres
Publié: (2024)
par: Mondal, Shouvick, et autres
Publié: (2024)
On Queueing Theory for Large-Scale CI/CD Pipelines Optimization
par: Bournassenko, Grégory
Publié: (2025)
par: Bournassenko, Grégory
Publié: (2025)
A General Solution for the Implementation of CI/CD in Embedded Linux Development
par: Agahi, Behnam, et autres
Publié: (2025)
par: Agahi, Behnam, et autres
Publié: (2025)
A Case Study of LLM for Automated Vulnerability Repair: Assessing Impact of Reasoning and Patch Validation Feedback
par: Kulsum, Ummay, et autres
Publié: (2024)
par: Kulsum, Ummay, et autres
Publié: (2024)
A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era
par: Khan, Taufiqul Islam, et autres
Publié: (2026)
par: Khan, Taufiqul Islam, et autres
Publié: (2026)
When AI Agents Touch CI/CD Configurations: Frequency and Success
par: Ghaleb, Taher A.
Publié: (2026)
par: Ghaleb, Taher A.
Publié: (2026)
Portable and Secure CI/CD for COBOL: Lessons from an Industrial Migration
par: Askholm, Andreas, et autres
Publié: (2026)
par: Askholm, Andreas, et autres
Publié: (2026)
Empirical Analysis on CI/CD Pipeline Evolution in Machine Learning Projects
par: Rzig, Dhia Elhaq, et autres
Publié: (2024)
par: Rzig, Dhia Elhaq, et autres
Publié: (2024)
Chronicles of CI/CD: A Deep Dive into its Usage Over Time
par: da Gião, Hugo, et autres
Publié: (2024)
par: da Gião, Hugo, et autres
Publié: (2024)
Using Large Language Models to Support Automation of Failure Management in CI/CD Pipelines: A Case Study in SAP HANA
par: Bui, Duong, et autres
Publié: (2026)
par: Bui, Duong, et autres
Publié: (2026)
LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis
par: Qin, Bowen
Publié: (2026)
par: Qin, Bowen
Publié: (2026)
Reliability of AI Bots Footprints in GitHub Actions CI/CD Workflows
par: Shah, Syed Muhammad Ashhar, et autres
Publié: (2026)
par: Shah, Syed Muhammad Ashhar, et autres
Publié: (2026)
LogSieve: Task-Aware CI Log Reduction for Sustainable LLM-Based Analysis
par: Barnes, Marcus Emmanuel, et autres
Publié: (2026)
par: Barnes, Marcus Emmanuel, et autres
Publié: (2026)
RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing
par: Li, Xuefeng, et autres
Publié: (2026)
par: Li, Xuefeng, et autres
Publié: (2026)
Documents similaires
-
A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion
par: Rafi, Md Nakhla, et autres
Publié: (2024) -
Back to the Future! Studying Data Cleanness in Defects4J and its Impact on Fault Localization
par: Rafi, Md Nakhla, et autres
Publié: (2023) -
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
par: Shafin, Wasique Islam, et autres
Publié: (2025) -
From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair
par: Li, Chenglin, et autres
Publié: (2026) -
Towards Better Graph Neural Network-based Fault Localization Through Enhanced Code Representation
par: Rafi, Md Nakhla, et autres
Publié: (2024)