Testing with AI Agents: An Empirical Study of Test Generation Frequency, Quality, and Coverage
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoshimoto, Suzuka, Fujita, Shun, Horikawa, Kosei, Feitosa, Daniel, Kashiwa, Yutaro, Iida, Hajimu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do AI Agents Really Improve Code Readability?
par: Horikawa, Kyogo, et autres
Publié: (2026)
par: Horikawa, Kyogo, et autres
Publié: (2026)
Agentic Refactoring: An Empirical Study of AI Coding Agents
par: Horikawa, Kosei, et autres
Publié: (2025)
par: Horikawa, Kosei, et autres
Publié: (2025)
Understanding Self-Admitted Technical Debt in Test Code: An Empirical Study
par: Nakamura, Ibuki, et autres
Publié: (2025)
par: Nakamura, Ibuki, et autres
Publié: (2025)
Does Programming Language Matter? An Empirical Study of Fuzzing Bug Detection
par: Shirai, Tatsuya, et autres
Publié: (2026)
par: Shirai, Tatsuya, et autres
Publié: (2026)
What to Cut? Predicting Unnecessary Methods in Agentic Code Generation
par: Watanabe, Kan, et autres
Publié: (2026)
par: Watanabe, Kan, et autres
Publié: (2026)
To What Extent Does Agent-generated Code Require Maintenance? An Empirical Study
par: Sawada, Shota, et autres
Publié: (2026)
par: Sawada, Shota, et autres
Publié: (2026)
An Empirical Study of Security-Policy Related Issues in Open Source Projects
par: Kanaji, Rintaro, et autres
Publié: (2025)
par: Kanaji, Rintaro, et autres
Publié: (2025)
On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub
par: Watanabe, Miku, et autres
Publié: (2025)
par: Watanabe, Miku, et autres
Publié: (2025)
Large-Scale Empirical Analysis of Continuous Fuzzing: Insights from 1 Million Fuzzing Sessions
par: Shirai, Tatsuya, et autres
Publié: (2025)
par: Shirai, Tatsuya, et autres
Publié: (2025)
On the Use of Agentic Coding Manifests: An Empirical Study of Claude Code
par: Chatlatanagulchai, Worawalan, et autres
Publié: (2025)
par: Chatlatanagulchai, Worawalan, et autres
Publié: (2025)
Agent READMEs: An Empirical Study of Context Files for Agentic Coding
par: Chatlatanagulchai, Worawalan, et autres
Publié: (2025)
par: Chatlatanagulchai, Worawalan, et autres
Publié: (2025)
Detecting and Characterizing Low and No Functionality Packages in the NPM Ecosystem
par: Tevarut, Napasorn, et autres
Publié: (2025)
par: Tevarut, Napasorn, et autres
Publié: (2025)
Are Coding Agents Generating Over-Mocked Tests? An Empirical Study
par: Hora, Andre, et autres
Publié: (2026)
par: Hora, Andre, et autres
Publié: (2026)
Generalizing Test Cases for Comprehensive Test Scenario Coverage
par: Qi, Binhang, et autres
Publié: (2026)
par: Qi, Binhang, et autres
Publié: (2026)
A Study of Scientific Computational Notebook Quality
par: Kashiwa, Shun, et autres
Publié: (2026)
par: Kashiwa, Shun, et autres
Publié: (2026)
Generalized Coverage Criteria for Combinatorial Sequence Testing
par: Elyasaf, Achiya, et autres
Publié: (2022)
par: Elyasaf, Achiya, et autres
Publié: (2022)
Exploring Sustainability in Scientific Software through Code Quality & Test Coverage Metrics
par: Rahman, Sheikh Md. Mushfiqur, et autres
Publié: (2026)
par: Rahman, Sheikh Md. Mushfiqur, et autres
Publié: (2026)
An Empirical Study of Testing Practices in Open Source AI Agent Frameworks and Agentic Applications
par: Hasan, Mohammed Mehedi, et autres
Publié: (2025)
par: Hasan, Mohammed Mehedi, et autres
Publié: (2025)
Assessing REST API Test Generation Strategies with Log Coverage
par: Reinikainen, Nana, et autres
Publié: (2026)
par: Reinikainen, Nana, et autres
Publié: (2026)
Testing the Untestable? An Empirical Study on the Testing Process of LLM-Powered Software Systems
par: Magalhaes, Cleyton, et autres
Publié: (2025)
par: Magalhaes, Cleyton, et autres
Publié: (2025)
Scaling Test-Driven Code Generation from Functions to Classes: An Empirical Study
par: Liang, Yunhao, et autres
Publié: (2026)
par: Liang, Yunhao, et autres
Publié: (2026)
Large Language Models for Automated Web-Form-Test Generation: An Empirical Study
par: Li, Tao, et autres
Publié: (2024)
par: Li, Tao, et autres
Publié: (2024)
AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality
par: Ghammam, Anwar, et autres
Publié: (2026)
par: Ghammam, Anwar, et autres
Publié: (2026)
Testing Agentic Workflows with Structural Coverage Criteria
par: Kahani, Nafiseh, et autres
Publié: (2026)
par: Kahani, Nafiseh, et autres
Publié: (2026)
LLM-Based Test-Driven Interactive Code Generation: User Study and Empirical Evaluation
par: Fakhoury, Sarah, et autres
Publié: (2024)
par: Fakhoury, Sarah, et autres
Publié: (2024)
An Empirical Study of Generative AI Adoption in Software Engineering
par: Giray, Görkem, et autres
Publié: (2025)
par: Giray, Görkem, et autres
Publié: (2025)
Test Design and Review Argumentation in AI-Assisted Test Generation
par: Enoiu, Eduard Paul, et autres
Publié: (2026)
par: Enoiu, Eduard Paul, et autres
Publié: (2026)
Understanding Bug-Reproducing Tests: A First Empirical Study
par: Hora, Andre, et autres
Publié: (2026)
par: Hora, Andre, et autres
Publié: (2026)
Understanding API Usage and Testing: An Empirical Study of C Libraries
par: Zaki, Ahmed, et autres
Publié: (2025)
par: Zaki, Ahmed, et autres
Publié: (2025)
Can We Classify Flaky Tests Using Only Test Code? An LLM-Based Empirical Study
par: Berndt, Alexander, et autres
Publié: (2026)
par: Berndt, Alexander, et autres
Publié: (2026)
Quality Assurance for LLM-RAG Systems: Empirical Insights from Tourism Application Testing
par: Ahmed, Bestoun S., et autres
Publié: (2025)
par: Ahmed, Bestoun S., et autres
Publié: (2025)
Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure
par: Yang, Zheyuan, et autres
Publié: (2025)
par: Yang, Zheyuan, et autres
Publié: (2025)
An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models
par: Kumari, Pragati, et autres
Publié: (2026)
par: Kumari, Pragati, et autres
Publié: (2026)
Coverage Goal Selector for Combining Multiple Criteria in Search-Based Unit Test Generation
par: Zhou, Zhichao, et autres
Publié: (2023)
par: Zhou, Zhichao, et autres
Publié: (2023)
Revisiting "Revisiting Neuron Coverage for DNN Testing: A Layer-Wise and Distribution-Aware Criterion": A Critical Review and Implications on DNN Coverage Testing
par: Kim, Jinhan, et autres
Publié: (2026)
par: Kim, Jinhan, et autres
Publié: (2026)
Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation
par: Chang, Pengyu, et autres
Publié: (2026)
par: Chang, Pengyu, et autres
Publié: (2026)
ABTest: Behavior-Driven Testing for AI Coding Agents
par: Dai, Wuyang, et autres
Publié: (2026)
par: Dai, Wuyang, et autres
Publié: (2026)
Evaluating LLMs Effectiveness in Detecting and Correcting Test Smells: An Empirical Study
par: Santana Jr, E. G., et autres
Publié: (2025)
par: Santana Jr, E. G., et autres
Publié: (2025)
Reinforcement Learning-Based REST API Testing with Multi-Coverage
par: Nguyen, Tien-Quang, et autres
Publié: (2024)
par: Nguyen, Tien-Quang, et autres
Publié: (2024)
Requirements Coverage-Guided Minimization for Natural Language Test Cases
par: Pan, Rongqi, et autres
Publié: (2025)
par: Pan, Rongqi, et autres
Publié: (2025)
Documents similaires
-
Do AI Agents Really Improve Code Readability?
par: Horikawa, Kyogo, et autres
Publié: (2026) -
Agentic Refactoring: An Empirical Study of AI Coding Agents
par: Horikawa, Kosei, et autres
Publié: (2025) -
Understanding Self-Admitted Technical Debt in Test Code: An Empirical Study
par: Nakamura, Ibuki, et autres
Publié: (2025) -
Does Programming Language Matter? An Empirical Study of Fuzzing Bug Detection
par: Shirai, Tatsuya, et autres
Publié: (2026) -
What to Cut? Predicting Unnecessary Methods in Agentic Code Generation
par: Watanabe, Kan, et autres
Publié: (2026)