Assessing Data Augmentation-Induced Bias in Training and Testing of Machine Learning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | More, Riddhi, Bradbury, Jeremy S. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Analysis of LLM Fine-Tuning and Few-Shot Learning for Flaky Test Detection and Classification
por: More, Riddhi, et al.
Publicado: (2025)
por: More, Riddhi, et al.
Publicado: (2025)
Addressing Data Leakage in HumanEval Using Combinatorial Test Design
por: Bradbury, Jeremy S., et al.
Publicado: (2024)
por: Bradbury, Jeremy S., et al.
Publicado: (2024)
A Systematic Approach for Assessing Large Language Models' Test Case Generation Capability
por: Chang, Hung-Fu, et al.
Publicado: (2025)
por: Chang, Hung-Fu, et al.
Publicado: (2025)
From Untestable to Testable: Metamorphic Testing in the Age of LLMs
por: Terragni, Valerio
Publicado: (2026)
por: Terragni, Valerio
Publicado: (2026)
AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling
por: Huang, Yuheng, et al.
Publicado: (2024)
por: Huang, Yuheng, et al.
Publicado: (2024)
When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context
por: Weng, Haojun, et al.
Publicado: (2026)
por: Weng, Haojun, et al.
Publicado: (2026)
AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair
por: Hu, Yuelin, et al.
Publicado: (2026)
por: Hu, Yuelin, et al.
Publicado: (2026)
Towards a Probabilistic Framework for Analyzing and Improving LLM-Enabled Software
por: Baldonado, Juan Manuel, et al.
Publicado: (2025)
por: Baldonado, Juan Manuel, et al.
Publicado: (2025)
RMCBench: Benchmarking Large Language Models' Resistance to Malicious Code
por: Chen, Jiachi, et al.
Publicado: (2024)
por: Chen, Jiachi, et al.
Publicado: (2024)
CoTran: An LLM-based Code Translator using Reinforcement Learning with Feedback from Compiler and Symbolic Execution
por: Jana, Prithwish, et al.
Publicado: (2023)
por: Jana, Prithwish, et al.
Publicado: (2023)
Bug In the Code Stack: Can LLMs Find Bugs in Large Python Code Stacks
por: Lee, Hokyung, et al.
Publicado: (2024)
por: Lee, Hokyung, et al.
Publicado: (2024)
LLMORPH: Automated Metamorphic Testing of Large Language Models
por: Cho, Steven, et al.
Publicado: (2026)
por: Cho, Steven, et al.
Publicado: (2026)
Automated structural testing of LLM-based agents: methods, framework, and case studies
por: Kohl, Jens, et al.
Publicado: (2026)
por: Kohl, Jens, et al.
Publicado: (2026)
RelRepair: Enhancing Automated Program Repair by Retrieving Relevant Code
por: Liu, Shunyu, et al.
Publicado: (2025)
por: Liu, Shunyu, et al.
Publicado: (2025)
AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs
por: Ahmed, Sheikh Nazib, et al.
Publicado: (2026)
por: Ahmed, Sheikh Nazib, et al.
Publicado: (2026)
GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair
por: Liu, Zhuoyao, et al.
Publicado: (2026)
por: Liu, Zhuoyao, et al.
Publicado: (2026)
Learning Software Bug Reports: A Systematic Literature Review
por: Long, Guoming, et al.
Publicado: (2025)
por: Long, Guoming, et al.
Publicado: (2025)
COMET: Coverage-guided Model Generation For Deep Learning Library Testing
por: Li, Meiziniu, et al.
Publicado: (2022)
por: Li, Meiziniu, et al.
Publicado: (2022)
Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark
por: Mughal, Ali Hassaan, et al.
Publicado: (2026)
por: Mughal, Ali Hassaan, et al.
Publicado: (2026)
Enhancing Differential Testing With LLMs For Testing Deep Learning Libraries
por: Li, Meiziniu, et al.
Publicado: (2024)
por: Li, Meiziniu, et al.
Publicado: (2024)
Making a Pipeline Production-Ready: Challenges and Lessons Learned in the Healthcare Domain
por: Lawand, Daniel Angelo Esteves, et al.
Publicado: (2025)
por: Lawand, Daniel Angelo Esteves, et al.
Publicado: (2025)
CIFE: Code Instruction-Following Evaluation
por: Gunnu, Sravani, et al.
Publicado: (2025)
por: Gunnu, Sravani, et al.
Publicado: (2025)
SPIRA: Building an Intelligent System for Respiratory Insufficiency Detection
por: Ferreira, Renato Cordeiro, et al.
Publicado: (2025)
por: Ferreira, Renato Cordeiro, et al.
Publicado: (2025)
LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB
por: Bekmyradov, Vekil, et al.
Publicado: (2026)
por: Bekmyradov, Vekil, et al.
Publicado: (2026)
AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
por: Guo, Dongxin, et al.
Publicado: (2026)
por: Guo, Dongxin, et al.
Publicado: (2026)
ASSERTIFY: Utilizing Large Language Models to Generate Assertions for Production Code
por: Torkamani, Mohammad Jalili, et al.
Publicado: (2024)
por: Torkamani, Mohammad Jalili, et al.
Publicado: (2024)
Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG
por: Yu, Boxi, et al.
Publicado: (2026)
por: Yu, Boxi, et al.
Publicado: (2026)
Beyond Greenfield: The D3 Framework for AI-Driven Productivity in Brownfield Engineering
por: Sharma, Krishna Kumaar
Publicado: (2025)
por: Sharma, Krishna Kumaar
Publicado: (2025)
Continuous Discovery of Vulnerabilities in LLM Serving Systems with Fuzzing
por: Zhao, Yunze, et al.
Publicado: (2026)
por: Zhao, Yunze, et al.
Publicado: (2026)
PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
por: Kawamura, Kazuki, et al.
Publicado: (2026)
por: Kawamura, Kazuki, et al.
Publicado: (2026)
VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs
por: Daneshvar, Seyed Shayan, et al.
Publicado: (2024)
por: Daneshvar, Seyed Shayan, et al.
Publicado: (2024)
Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures
por: Oskooei, Amirkia Rafiei, et al.
Publicado: (2025)
por: Oskooei, Amirkia Rafiei, et al.
Publicado: (2025)
Mining Subscenario Refactoring Opportunities in Behaviour-Driven Software Test Suites: ML Classifiers and LLM-Judge Baselines
por: Mughal, Ali Hassaan, et al.
Publicado: (2026)
por: Mughal, Ali Hassaan, et al.
Publicado: (2026)
Leveraging Large Language Models for Use Case Model Generation from Software Requirements
por: Eisenreich, Tobias, et al.
Publicado: (2025)
por: Eisenreich, Tobias, et al.
Publicado: (2025)
Towards Explainable Test Case Prioritisation with Learning-to-Rank Models
por: Ramírez, Aurora, et al.
Publicado: (2024)
por: Ramírez, Aurora, et al.
Publicado: (2024)
Demystifying the Silence of Correctness Bugs in PyTorch Compiler
por: Li, Meiziniu, et al.
Publicado: (2026)
por: Li, Meiziniu, et al.
Publicado: (2026)
Rango: Adaptive Retrieval-Augmented Proving for Automated Software Verification
por: Thompson, Kyle, et al.
Publicado: (2024)
por: Thompson, Kyle, et al.
Publicado: (2024)
RepoLaunch: Automating Build&Test Pipeline of Code Repositories on ANY Language and ANY Platform
por: Li, Kenan, et al.
Publicado: (2026)
por: Li, Kenan, et al.
Publicado: (2026)
Model-Driven Legacy System Modernization at Scale
por: Böhm, Tobias, et al.
Publicado: (2026)
por: Böhm, Tobias, et al.
Publicado: (2026)
The Impact of Large Language Models on Open-source Innovation: Evidence from GitHub Copilot
por: Yeverechyahu, Doron, et al.
Publicado: (2024)
por: Yeverechyahu, Doron, et al.
Publicado: (2024)
Ejemplares similares
-
An Analysis of LLM Fine-Tuning and Few-Shot Learning for Flaky Test Detection and Classification
por: More, Riddhi, et al.
Publicado: (2025) -
Addressing Data Leakage in HumanEval Using Combinatorial Test Design
por: Bradbury, Jeremy S., et al.
Publicado: (2024) -
A Systematic Approach for Assessing Large Language Models' Test Case Generation Capability
por: Chang, Hung-Fu, et al.
Publicado: (2025) -
From Untestable to Testable: Metamorphic Testing in the Age of LLMs
por: Terragni, Valerio
Publicado: (2026) -
AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling
por: Huang, Yuheng, et al.
Publicado: (2024)