STELLAR: A Search-Based Testing Framework for Large Language Model Applications
Fuente:
arXiv
Saved in:
| Main Authors: | Sorokin, Lev, Vasilev, Ivan, Friedl, Ken E., Stocco, Andrea |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
by: Giebisch, Rafael, et al.
Published: (2025)
by: Giebisch, Rafael, et al.
Published: (2025)
Simulator Ensembles for Trustworthy Autonomous Driving Testing
by: Sorokin, Lev, et al.
Published: (2025)
by: Sorokin, Lev, et al.
Published: (2025)
Guiding the Search Towards Failure-Inducing Test Inputs Using Support Vector Machines
by: Sorokin, Lev, et al.
Published: (2024)
by: Sorokin, Lev, et al.
Published: (2024)
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
by: Sorokin, Lev, et al.
Published: (2024)
by: Sorokin, Lev, et al.
Published: (2024)
PerturbationDrive: A Framework for Perturbation-Based Testing of ADAS
by: Leonhard, Hannes, et al.
Published: (2026)
by: Leonhard, Hannes, et al.
Published: (2026)
Towards Automated Page Object Generation for Web Testing using Large Language Models
by: Karagöz, Betül, et al.
Published: (2026)
by: Karagöz, Betül, et al.
Published: (2026)
Feature-Aware Test Generation for Deep Learning Models
by: Chen, Xingcheng, et al.
Published: (2026)
by: Chen, Xingcheng, et al.
Published: (2026)
Web Element Relocalization in Evolving Web Applications: A Comparative Analysis and Extension Study
by: Kluge, Anton, et al.
Published: (2025)
by: Kluge, Anton, et al.
Published: (2025)
Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study
by: Dozono, Kohei, et al.
Published: (2024)
by: Dozono, Kohei, et al.
Published: (2024)
Assessing Quality Metrics for Neural Reality Gap Input Mitigation in Autonomous Driving Testing
by: Lambertenghi, Stefano Carlo, et al.
Published: (2024)
by: Lambertenghi, Stefano Carlo, et al.
Published: (2024)
A Multi-Year Grey Literature Review on AI-assisted Test Automation
by: Ricca, Filippo, et al.
Published: (2024)
by: Ricca, Filippo, et al.
Published: (2024)
OpenCat: Improving Interoperability of ADS Testing
by: Ali, Qurban, et al.
Published: (2025)
by: Ali, Qurban, et al.
Published: (2025)
Searching by Code: a New SearchBySnippet Dataset and SnippeR Retrieval Model for Searching by Code Snippets
by: Sedykh, Ivan, et al.
Published: (2023)
by: Sedykh, Ivan, et al.
Published: (2023)
HyperNet-Adaptation for Diffusion-Based Test Case Generation
by: Weißl, Oliver, et al.
Published: (2026)
by: Weißl, Oliver, et al.
Published: (2026)
Coverage-Guided Road Selection and Prioritization for Efficient Testing in Autonomous Driving Systems
by: Ali, Qurban, et al.
Published: (2026)
by: Ali, Qurban, et al.
Published: (2026)
Latent Space Class Dispersion: Effective Test Data Quality Assessment for DNNs
by: Vekariya, Vivek, et al.
Published: (2025)
by: Vekariya, Vivek, et al.
Published: (2025)
Latent Regularization in Generative Test Input Generation
by: Merabishvili, Giorgi, et al.
Published: (2026)
by: Merabishvili, Giorgi, et al.
Published: (2026)
Testing Framework Migration with Large Language Models
by: Alves, Altino, et al.
Published: (2026)
by: Alves, Altino, et al.
Published: (2026)
Neural Embeddings for Web Testing
by: Kanaththage, Kasun, et al.
Published: (2023)
by: Kanaththage, Kasun, et al.
Published: (2023)
A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems
by: Zhao, Yongqi, et al.
Published: (2025)
by: Zhao, Yongqi, et al.
Published: (2025)
Misbehavior Forecasting for Focused Autonomous Driving Systems Testing
by: Naziri, M M Abid, et al.
Published: (2025)
by: Naziri, M M Abid, et al.
Published: (2025)
Evaluating Large Language Models in Detecting Test Smells
by: Lucas, Keila, et al.
Published: (2024)
by: Lucas, Keila, et al.
Published: (2024)
Quality Assessment of Python Tests Generated by Large Language Models
by: Alves, Victor, et al.
Published: (2025)
by: Alves, Victor, et al.
Published: (2025)
Benchmarking Generative AI Models for Deep Learning Test Input Generation
by: Maryam, et al.
Published: (2024)
by: Maryam, et al.
Published: (2024)
Benchmarking Image Perturbations for Testing Automated Driving Assistance Systems
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
Can Large Language Models Write Good Property-Based Tests?
by: Vikram, Vasudev, et al.
Published: (2023)
by: Vikram, Vasudev, et al.
Published: (2023)
DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation
by: Yang, Mingke, et al.
Published: (2024)
by: Yang, Mingke, et al.
Published: (2024)
A Multi-Modality Evaluation of the Reality Gap in Autonomous Driving Systems
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
by: Lambertenghi, Stefano Carlo, et al.
Published: (2025)
Interleaving Large Language Models for Compiler Testing
by: Ni, Yunbo, et al.
Published: (2025)
by: Ni, Yunbo, et al.
Published: (2025)
Streamlining Acceptance Test Generation for Mobile Applications Through Large Language Models: An Industrial Case Study
by: Fonseca, Pedro Luís, et al.
Published: (2025)
by: Fonseca, Pedro Luís, et al.
Published: (2025)
On the Evaluation of Large Language Models in Unit Test Generation
by: Yang, Lin, et al.
Published: (2024)
by: Yang, Lin, et al.
Published: (2024)
Automated Harmfulness Testing for Code Large Language Models
by: Tan, Honghao, et al.
Published: (2025)
by: Tan, Honghao, et al.
Published: (2025)
LLMorpheus: Mutation Testing using Large Language Models
by: Tip, Frank, et al.
Published: (2024)
by: Tip, Frank, et al.
Published: (2024)
Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework
by: Qureshi, Irtaza Sajid, et al.
Published: (2025)
by: Qureshi, Irtaza Sajid, et al.
Published: (2025)
Targeted Deep Learning System Boundary Testing
by: Weißl, Oliver, et al.
Published: (2024)
by: Weißl, Oliver, et al.
Published: (2024)
Large Language Models for Unit Testing: A Systematic Literature Review
by: Zhang, Quanjun, et al.
Published: (2025)
by: Zhang, Quanjun, et al.
Published: (2025)
Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework
by: Parziale, Alessandra, et al.
Published: (2025)
by: Parziale, Alessandra, et al.
Published: (2025)
A Large-scale Empirical Study on Fine-tuning Large Language Models for Unit Testing
by: Shang, Ye, et al.
Published: (2024)
by: Shang, Ye, et al.
Published: (2024)
Large Language Models for Software Testing Education: an Experience Report
by: Yang, Peng, et al.
Published: (2026)
by: Yang, Peng, et al.
Published: (2026)
SafeTune: Search-based Harmfulness Minimisation for Large Language Models
by: d'Aloisio, Giordano, et al.
Published: (2026)
by: d'Aloisio, Giordano, et al.
Published: (2026)
Similar Items
-
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
by: Giebisch, Rafael, et al.
Published: (2025) -
Simulator Ensembles for Trustworthy Autonomous Driving Testing
by: Sorokin, Lev, et al.
Published: (2025) -
Guiding the Search Towards Failure-Inducing Test Inputs Using Support Vector Machines
by: Sorokin, Lev, et al.
Published: (2024) -
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
by: Sorokin, Lev, et al.
Published: (2024) -
PerturbationDrive: A Framework for Perturbation-Based Testing of ADAS
by: Leonhard, Hannes, et al.
Published: (2026)