On the Soundness and Consistency of LLM Agents for Executing Test Cases Written in Natural Language
Fuente:
arXiv
Salvato in:
| Autori principali: | Salva, Sébastien, Taguelmimt, Redha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Validating Formal Specifications with LLM-generated Test Cases
di: Cunha, Alcino, et al.
Pubblicazione: (2025)
di: Cunha, Alcino, et al.
Pubblicazione: (2025)
NeuroLog: Reasoning You Can Audit -- Neuro-Symbolic Vulnerability Discovery via LLM Facts, Datalog, and SMT
di: Rawat, Sanjay
Pubblicazione: (2026)
di: Rawat, Sanjay
Pubblicazione: (2026)
Synthesizing Test Cases for Narrowing Specification Candidates
di: Cunha, Alcino, et al.
Pubblicazione: (2025)
di: Cunha, Alcino, et al.
Pubblicazione: (2025)
SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark
di: Yu, Boxi, et al.
Pubblicazione: (2026)
di: Yu, Boxi, et al.
Pubblicazione: (2026)
Testing SSD Firmware with State Data-Aware Fuzzing: Accelerating Coverage in Nondeterministic I/O Environments
di: Yoon, Gangho, et al.
Pubblicazione: (2025)
di: Yoon, Gangho, et al.
Pubblicazione: (2025)
Do Unit Proofs Work? An Empirical Study of Compositional Bounded Model Checking for Memory Safety Verification
di: Amusuo, Paschal C., et al.
Pubblicazione: (2025)
di: Amusuo, Paschal C., et al.
Pubblicazione: (2025)
QuickCheck for VDM
di: Battle, Nick, et al.
Pubblicazione: (2024)
di: Battle, Nick, et al.
Pubblicazione: (2024)
A Unit Proofing Framework for Code-level Verification: A Research Agenda
di: Amusuo, Paschal C., et al.
Pubblicazione: (2024)
di: Amusuo, Paschal C., et al.
Pubblicazione: (2024)
Generative transformations and patterns in LLM-native approaches for software verification and falsification
di: Braberman, Víctor A., et al.
Pubblicazione: (2024)
di: Braberman, Víctor A., et al.
Pubblicazione: (2024)
Combined Program Analysis Techniques: A Systematic Mapping Study
di: Braione, Pietro, et al.
Pubblicazione: (2026)
di: Braione, Pietro, et al.
Pubblicazione: (2026)
Automatically Detecting Numerical Instability in Machine Learning Applications via Soft Assertions
di: Sharmin, Shaila, et al.
Pubblicazione: (2025)
di: Sharmin, Shaila, et al.
Pubblicazione: (2025)
Comparing Human and LLM Generated Code: The Jury is Still Out!
di: Licorish, Sherlock A., et al.
Pubblicazione: (2025)
di: Licorish, Sherlock A., et al.
Pubblicazione: (2025)
Software Verification with CPAchecker 3.0: Tutorial and User Guide (Extended Version)
di: Baier, Daniel, et al.
Pubblicazione: (2024)
di: Baier, Daniel, et al.
Pubblicazione: (2024)
MoXIchecker: An Extensible Model Checker for MoXI
di: Ates, Salih, et al.
Pubblicazione: (2024)
di: Ates, Salih, et al.
Pubblicazione: (2024)
LLMLOOP: Improving LLM-Generated Code and Tests through Automated Iterative Feedback Loops
di: Ravi, Ravin, et al.
Pubblicazione: (2026)
di: Ravi, Ravin, et al.
Pubblicazione: (2026)
The concept of class invariant in object-oriented programming
di: Meyer, Bertrand, et al.
Pubblicazione: (2021)
di: Meyer, Bertrand, et al.
Pubblicazione: (2021)
Validating Solidity Code Defects using Symbolic and Concrete Execution powered by Large Language Models
di: Susan, Ştefan-Claudiu, et al.
Pubblicazione: (2025)
di: Susan, Ştefan-Claudiu, et al.
Pubblicazione: (2025)
Understanding and Reusing Test Suites Across Database Systems
di: Zhong, Suyang, et al.
Pubblicazione: (2024)
di: Zhong, Suyang, et al.
Pubblicazione: (2024)
Interpolation and SAT-Based Model Checking Revisited: Adoption to Software Verification
di: Beyer, Dirk, et al.
Pubblicazione: (2022)
di: Beyer, Dirk, et al.
Pubblicazione: (2022)
AutoSOUP: Safety-Oriented Unit Proof Generation for Component-level Memory-Safety Verification
di: Amusuo, Paschal C., et al.
Pubblicazione: (2026)
di: Amusuo, Paschal C., et al.
Pubblicazione: (2026)
Constrained LTL Specification Learning from Examples
di: Zhang, Changjian, et al.
Pubblicazione: (2024)
di: Zhang, Changjian, et al.
Pubblicazione: (2024)
GBM Returns the Best Prediction Performance among Regression Approaches: A Case Study of Stack Overflow Code Quality
di: Licorish, Sherlock A., et al.
Pubblicazione: (2025)
di: Licorish, Sherlock A., et al.
Pubblicazione: (2025)
Evaluating Cryptographic API Misuse Detectors for Go
di: Andersson, Vivi, et al.
Pubblicazione: (2026)
di: Andersson, Vivi, et al.
Pubblicazione: (2026)
Tractable Verification of Model Transformations: A Cutoff-Theorem Approach for DSLTrans
di: Lucio, Levi
Pubblicazione: (2026)
di: Lucio, Levi
Pubblicazione: (2026)
The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review
di: Zietsman, Christo
Pubblicazione: (2026)
di: Zietsman, Christo
Pubblicazione: (2026)
Intent Formalization: A Grand Challenge for Reliable Coding in the Age of AI Agents
di: Lahiri, Shuvendu K.
Pubblicazione: (2026)
di: Lahiri, Shuvendu K.
Pubblicazione: (2026)
Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance
di: Calboreanu, Elias
Pubblicazione: (2026)
di: Calboreanu, Elias
Pubblicazione: (2026)
Talk is Cheap, Logic is Hard: Benchmarking LLMs on Post-Condition Formalization
di: Prasetya, I. S. W. B., et al.
Pubblicazione: (2026)
di: Prasetya, I. S. W. B., et al.
Pubblicazione: (2026)
Quantifying Confidence in Assurance 2.0 Arguments
di: Bloomfield, Robin, et al.
Pubblicazione: (2026)
di: Bloomfield, Robin, et al.
Pubblicazione: (2026)
Path-optimal symbolic execution of heap-manipulating programs
di: Braione, Pietro, et al.
Pubblicazione: (2024)
di: Braione, Pietro, et al.
Pubblicazione: (2024)
Towards a Probabilistic Framework for Analyzing and Improving LLM-Enabled Software
di: Baldonado, Juan Manuel, et al.
Pubblicazione: (2025)
di: Baldonado, Juan Manuel, et al.
Pubblicazione: (2025)
AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
Cryptographic Registry Provenance: Structural Defense Against Dependency Confusion in AI Package Ecosystems
di: McCann, Alan L.
Pubblicazione: (2026)
di: McCann, Alan L.
Pubblicazione: (2026)
Kajal: Extracting Grammar of a Source Code Using Large Language Models
di: Torkamani, Mohammad Jalili
Pubblicazione: (2024)
di: Torkamani, Mohammad Jalili
Pubblicazione: (2024)
Trace Validation of Unmodified Concurrent Systems with OmniLink
di: Hackett, Finn, et al.
Pubblicazione: (2026)
di: Hackett, Finn, et al.
Pubblicazione: (2026)
From Scientific Texts to Verifiable Code: Automating the Process with Transformers
di: Wang, Changjie, et al.
Pubblicazione: (2025)
di: Wang, Changjie, et al.
Pubblicazione: (2025)
FalseCrashReducer: Mitigating False Positive Crashes in OSS-Fuzz-Gen Using Agentic AI
di: Amusuo, Paschal C., et al.
Pubblicazione: (2025)
di: Amusuo, Paschal C., et al.
Pubblicazione: (2025)
A Short Survey on Formalising Software Requirements using Large Language Models
di: Beg, Arshad, et al.
Pubblicazione: (2025)
di: Beg, Arshad, et al.
Pubblicazione: (2025)
Automated Vulnerability Detection Using Deep Learning Technique
di: Yang, Guan-Yan, et al.
Pubblicazione: (2024)
di: Yang, Guan-Yan, et al.
Pubblicazione: (2024)
Assessing Reliability of Statistical Maximum Coverage Estimators in Fuzzing
di: Liyanage, Danushka, et al.
Pubblicazione: (2025)
di: Liyanage, Danushka, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Validating Formal Specifications with LLM-generated Test Cases
di: Cunha, Alcino, et al.
Pubblicazione: (2025) -
NeuroLog: Reasoning You Can Audit -- Neuro-Symbolic Vulnerability Discovery via LLM Facts, Datalog, and SMT
di: Rawat, Sanjay
Pubblicazione: (2026) -
Synthesizing Test Cases for Narrowing Specification Candidates
di: Cunha, Alcino, et al.
Pubblicazione: (2025) -
SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark
di: Yu, Boxi, et al.
Pubblicazione: (2026) -
Testing SSD Firmware with State Data-Aware Fuzzing: Accelerating Coverage in Nondeterministic I/O Environments
di: Yoon, Gangho, et al.
Pubblicazione: (2025)