ASTRAL: Automated Safety Testing of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ugarte, Miriam, Valle, Pablo, Parejo, José Antonio, Segura, Sergio, Arrieta, Aitor |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation
by: Arrieta, Aitor, et al.
Published: (2025)
by: Arrieta, Aitor, et al.
Published: (2025)
o3-mini vs DeepSeek-R1: Which One is Safer?
by: Arrieta, Aitor, et al.
Published: (2025)
by: Arrieta, Aitor, et al.
Published: (2025)
Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives
by: Romero-Arjona, Miguel, et al.
Published: (2025)
by: Romero-Arjona, Miguel, et al.
Published: (2025)
Metamorphic Testing of Vision-Language Action-Enabled Robots
by: Valle, Pablo, et al.
Published: (2026)
by: Valle, Pablo, et al.
Published: (2026)
Meta-Fair: AI-Assisted Fairness Testing of Large Language Models
by: Romero-Arjona, Miguel, et al.
Published: (2025)
by: Romero-Arjona, Miguel, et al.
Published: (2025)
Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation
by: Valle, Pablo, et al.
Published: (2026)
by: Valle, Pablo, et al.
Published: (2026)
Search-based Automated Program Repair of CPS Controllers Modeled in Simulink-Stateflow
by: Arrieta, Aitor, et al.
Published: (2024)
by: Arrieta, Aitor, et al.
Published: (2024)
VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
by: Saurabh, Prasun, et al.
Published: (2026)
by: Saurabh, Prasun, et al.
Published: (2026)
Enhanced Automated Code Vulnerability Repair using Large Language Models
by: de-Fitero-Dominguez, David, et al.
Published: (2024)
by: de-Fitero-Dominguez, David, et al.
Published: (2024)
An Empirical Evaluation of White-box and Black-box Test Case Prioritization Techniques in CPSs Modeled in Simulink
by: Arrieta, Aitor
Published: (2025)
by: Arrieta, Aitor
Published: (2025)
Large Language Models for IT Automation Tasks: Are We There Yet?
by: Hassan, Md Mahadi, et al.
Published: (2025)
by: Hassan, Md Mahadi, et al.
Published: (2025)
Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots
by: Valle, Pablo, et al.
Published: (2025)
by: Valle, Pablo, et al.
Published: (2025)
AutoTestForge: A Multidimensional Automated Testing Framework for Natural Language Processing Models
by: Xing, Hengrui, et al.
Published: (2025)
by: Xing, Hengrui, et al.
Published: (2025)
Using Large Language Models for Student-Code Guided Test Case Generation in Computer Science Education
by: Kumar, Nischal Ashok, et al.
Published: (2024)
by: Kumar, Nischal Ashok, et al.
Published: (2024)
A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios
by: Wu, Jiahui, et al.
Published: (2025)
by: Wu, Jiahui, et al.
Published: (2025)
Towards a Middleware for Large Language Models
by: Guran, Narcisa, et al.
Published: (2024)
by: Guran, Narcisa, et al.
Published: (2024)
Calibration of Large Language Models on Code Summarization
by: Virk, Yuvraj, et al.
Published: (2024)
by: Virk, Yuvraj, et al.
Published: (2024)
Testing the Effect of Code Documentation on Large Language Model Code Understanding
by: Macke, William, et al.
Published: (2024)
by: Macke, William, et al.
Published: (2024)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
by: Wang, Wenxuan
Published: (2024)
by: Wang, Wenxuan
Published: (2024)
Reality Bites: Assessing the Realism of Driving Scenarios with Large Language Models
by: Wu, Jiahui, et al.
Published: (2024)
by: Wu, Jiahui, et al.
Published: (2024)
Automated Analysis of Pricings in SaaS-based Information Systems
by: García-Fernández, Alejandro, et al.
Published: (2025)
by: García-Fernández, Alejandro, et al.
Published: (2025)
A Survey of AIOps in the Era of Large Language Models
by: Zhang, Lingzhe, et al.
Published: (2025)
by: Zhang, Lingzhe, et al.
Published: (2025)
Vision Language Model-based Testing of Industrial Autonomous Mobile Robots
by: Wu, Jiahui, et al.
Published: (2025)
by: Wu, Jiahui, et al.
Published: (2025)
Prompting and Fine-tuning Large Language Models for Automated Code Review Comment Generation
by: Haider, Md. Asif, et al.
Published: (2024)
by: Haider, Md. Asif, et al.
Published: (2024)
A Comparative Study on Large Language Models for Log Parsing
by: Astekin, Merve, et al.
Published: (2024)
by: Astekin, Merve, et al.
Published: (2024)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
by: Kim, Hyunjun, et al.
Published: (2025)
by: Kim, Hyunjun, et al.
Published: (2025)
Bridging Code Graphs and Large Language Models for Better Code Understanding
by: Chen, Zeqi, et al.
Published: (2025)
by: Chen, Zeqi, et al.
Published: (2025)
Adapting Large Language Models to Log Analysis with Interpretable Domain Knowledge
by: Ji, Yuhe, et al.
Published: (2024)
by: Ji, Yuhe, et al.
Published: (2024)
Leveraging Print Debugging to Improve Code Generation in Large Language Models
by: Hu, Xueyu, et al.
Published: (2024)
by: Hu, Xueyu, et al.
Published: (2024)
PACE: Improving Prompt with Actor-Critic Editing for Large Language Model
by: Dong, Yihong, et al.
Published: (2023)
by: Dong, Yihong, et al.
Published: (2023)
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
A Survey of using Large Language Models for Generating Infrastructure as Code
by: Srivatsa, Kalahasti Ganesh, et al.
Published: (2024)
by: Srivatsa, Kalahasti Ganesh, et al.
Published: (2024)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
by: Li, Kaixin, et al.
Published: (2023)
by: Li, Kaixin, et al.
Published: (2023)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
by: Du, Mingzhe, et al.
Published: (2024)
by: Du, Mingzhe, et al.
Published: (2024)
Zero-shot Bilingual App Reviews Mining with Large Language Models
by: Wei, Jialiang, et al.
Published: (2023)
by: Wei, Jialiang, et al.
Published: (2023)
Efficient Fairness Testing in Large Language Models: Prioritizing Metamorphic Relations for Bias Detection
by: Giramata, Suavis, et al.
Published: (2025)
by: Giramata, Suavis, et al.
Published: (2025)
On Sequence-to-Sequence Models for Automated Log Parsing
by: Sorrenti, Adam, et al.
Published: (2026)
by: Sorrenti, Adam, et al.
Published: (2026)
UICoder: Finetuning Large Language Models to Generate User Interface Code through Automated Feedback
by: Wu, Jason, et al.
Published: (2024)
by: Wu, Jason, et al.
Published: (2024)
Seeker: Towards Exception Safety Code Generation with Intermediate Language Agents Framework
by: Zhang, Xuanming, et al.
Published: (2024)
by: Zhang, Xuanming, et al.
Published: (2024)
Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation
by: Ruiz, Fernando Vallecillos, et al.
Published: (2024)
by: Ruiz, Fernando Vallecillos, et al.
Published: (2024)
Similar Items
-
Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation
by: Arrieta, Aitor, et al.
Published: (2025) -
o3-mini vs DeepSeek-R1: Which One is Safer?
by: Arrieta, Aitor, et al.
Published: (2025) -
Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives
by: Romero-Arjona, Miguel, et al.
Published: (2025) -
Metamorphic Testing of Vision-Language Action-Enabled Robots
by: Valle, Pablo, et al.
Published: (2026) -
Meta-Fair: AI-Assisted Fairness Testing of Large Language Models
by: Romero-Arjona, Miguel, et al.
Published: (2025)