Towards Reliable Evaluation of Neural Program Repair with Natural Robustness Testing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le-Cong, Thanh, Nguyen, Dat, Le, Bach, Murray, Toby |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory-Efficient Large Language Models for Program Repair with Semantic-Guided Patch Generation
par: Le-Cong, Thanh, et autres
Publié: (2024)
par: Le-Cong, Thanh, et autres
Publié: (2024)
Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification Inference
par: Le-Cong, Thanh, et autres
Publié: (2025)
par: Le-Cong, Thanh, et autres
Publié: (2025)
From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs
par: Ho, Anh, et autres
Publié: (2025)
par: Ho, Anh, et autres
Publié: (2025)
Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming
par: Lang, Nguyet-Anh H., et autres
Publié: (2026)
par: Lang, Nguyet-Anh H., et autres
Publié: (2026)
PatchGuru: Patch Oracle Inference from Natural Language Artifacts with Large Language Models
par: Le-Cong, Thanh, et autres
Publié: (2026)
par: Le-Cong, Thanh, et autres
Publié: (2026)
Comparison of Static Application Security Testing Tools and Large Language Models for Repo-level Vulnerability Detection
par: Zhou, Xin, et autres
Publié: (2024)
par: Zhou, Xin, et autres
Publié: (2024)
Evaluating Agent-based Program Repair at Google
par: Rondon, Pat, et autres
Publié: (2025)
par: Rondon, Pat, et autres
Publié: (2025)
Evaluating the Generalizability of LLMs in Automated Program Repair
par: Li, Fengjie, et autres
Publié: (2025)
par: Li, Fengjie, et autres
Publié: (2025)
Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair
par: Cheng, Runxiang, et autres
Publié: (2026)
par: Cheng, Runxiang, et autres
Publié: (2026)
A Metamorphic Testing Approach to Diagnosing Memorization in LLM-Based Program Repair
par: De Koning, Milan, et autres
Publié: (2026)
par: De Koning, Milan, et autres
Publié: (2026)
Self-Bootstrapping Automated Program Repair: Using LLMs to Generate and Evaluate Synthetic Training Data for Bug Repair
par: de-Fitero-Dominguez, David, et autres
Publié: (2025)
par: de-Fitero-Dominguez, David, et autres
Publié: (2025)
Inferring Properties of Graph Neural Networks
par: Nguyen, Dat, et autres
Publié: (2024)
par: Nguyen, Dat, et autres
Publié: (2024)
Repair-R1: Better Test Before Repair
par: Hu, Haichuan, et autres
Publié: (2025)
par: Hu, Haichuan, et autres
Publié: (2025)
Towards Reliable LLM-Driven Fuzz Testing: Vision and Road Ahead
par: Cheng, Yiran, et autres
Publié: (2025)
par: Cheng, Yiran, et autres
Publié: (2025)
Repeton: Structured Bug Repair with ReAct-Guided Patch-and-Test Cycles
par: Vinh, Nguyen Phu, et autres
Publié: (2025)
par: Vinh, Nguyen Phu, et autres
Publié: (2025)
RepairAgent: An Autonomous, LLM-Based Agent for Program Repair
par: Bouzenia, Islem, et autres
Publié: (2024)
par: Bouzenia, Islem, et autres
Publié: (2024)
Benchmark Dataset Generation and Evaluation for Excel Formula Repair with LLMs
par: Singha, Ananya, et autres
Publié: (2025)
par: Singha, Ananya, et autres
Publié: (2025)
A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback
par: Tabassum, Anika, et autres
Publié: (2026)
par: Tabassum, Anika, et autres
Publié: (2026)
TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
par: Gao, Shuzheng, et autres
Publié: (2025)
par: Gao, Shuzheng, et autres
Publié: (2025)
RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair
par: Pan, Zhongqiang, et autres
Publié: (2026)
par: Pan, Zhongqiang, et autres
Publié: (2026)
RisConFix: LLM-based Automated Repair of Risk-Prone Drone Configurations
par: Han, Liping, et autres
Publié: (2025)
par: Han, Liping, et autres
Publié: (2025)
Enhancing Automated Program Repair with Solution Design
par: Zhao, Jiuang, et autres
Publié: (2024)
par: Zhao, Jiuang, et autres
Publié: (2024)
Collaborative Agents for Automated Program Repair in Ruby
par: Akbarpour, Nikta, et autres
Publié: (2025)
par: Akbarpour, Nikta, et autres
Publié: (2025)
Holistic Evaluation of State-of-the-Art LLMs for Code Generation
par: Zhang, Le, et autres
Publié: (2025)
par: Zhang, Le, et autres
Publié: (2025)
LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost
par: Huang, Donghao, et autres
Publié: (2025)
par: Huang, Donghao, et autres
Publié: (2025)
A Systematic Survey on Debugging Techniques for Machine Learning Systems
par: Nguyen, Thanh-Dat, et autres
Publié: (2025)
par: Nguyen, Thanh-Dat, et autres
Publié: (2025)
Towards Precise Observations of Neural Model Robustness in Classification
par: Mu, Wenchuan, et autres
Publié: (2024)
par: Mu, Wenchuan, et autres
Publié: (2024)
Multi-Task Program Error Repair and Explanatory Diagnosis
par: Xu, Zhenyu, et autres
Publié: (2024)
par: Xu, Zhenyu, et autres
Publié: (2024)
HAFixAgent: History-Aware Program Repair Agent
par: Shi, Yu, et autres
Publié: (2025)
par: Shi, Yu, et autres
Publié: (2025)
MergeRepair: An Exploratory Study on Merging Task-Specific Adapters in Code LLMs for Automated Program Repair
par: Dehghan, Meghdad, et autres
Publié: (2024)
par: Dehghan, Meghdad, et autres
Publié: (2024)
LLMs for Engineering: Teaching Models to Design High Powered Rockets
par: Simonds, Toby
Publié: (2025)
par: Simonds, Toby
Publié: (2025)
On the Role of Fault Localization Context for LLM-Based Program Repair
par: Sepidband, Melika, et autres
Publié: (2026)
par: Sepidband, Melika, et autres
Publié: (2026)
From Benchmark Data To Applicable Program Repair: An Experience Report
par: Chandramohan, Mahinthan, et autres
Publié: (2025)
par: Chandramohan, Mahinthan, et autres
Publié: (2025)
Agentic Bug Reproduction for Effective Automated Program Repair at Google
par: Cheng, Runxiang, et autres
Publié: (2025)
par: Cheng, Runxiang, et autres
Publié: (2025)
Cybernaut: Towards Reliable Web Automation
par: Tomar, Ankur, et autres
Publié: (2025)
par: Tomar, Ankur, et autres
Publié: (2025)
When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions
par: Larbi, Maya, et autres
Publié: (2025)
par: Larbi, Maya, et autres
Publié: (2025)
Exploring the Potential of Conversational Test Suite Based Program Repair on SWE-bench
par: Cheshkov, Anton, et autres
Publié: (2024)
par: Cheshkov, Anton, et autres
Publié: (2024)
Toward Realistic Evaluations of Just-In-Time Vulnerability Prediction
par: Nguyen, Duong, et autres
Publié: (2025)
par: Nguyen, Duong, et autres
Publié: (2025)
GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing
par: Chen, Xiaoyi, et autres
Publié: (2026)
par: Chen, Xiaoyi, et autres
Publié: (2026)
Adversarial Attacks on Code Models with Discriminative Graph Patterns
par: Nguyen, Thanh-Dat, et autres
Publié: (2023)
par: Nguyen, Thanh-Dat, et autres
Publié: (2023)
Documents similaires
-
Memory-Efficient Large Language Models for Program Repair with Semantic-Guided Patch Generation
par: Le-Cong, Thanh, et autres
Publié: (2024) -
Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification Inference
par: Le-Cong, Thanh, et autres
Publié: (2025) -
From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs
par: Ho, Anh, et autres
Publié: (2025) -
Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming
par: Lang, Nguyet-Anh H., et autres
Publié: (2026) -
PatchGuru: Patch Oracle Inference from Natural Language Artifacts with Large Language Models
par: Le-Cong, Thanh, et autres
Publié: (2026)