Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy
Fuente:
arXiv
Saved in:
| Main Authors: | Taherkhani, Hamed, Shin, Jiho, Tahir, Muhammad Ammar, Misu, Md Rakib Hossain, Gattani, Vineet Sunil, Hemmati, Hadi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models
by: Sepidband, Melika, et al.
Published: (2026)
by: Sepidband, Melika, et al.
Published: (2026)
Domain Adaptation for Code Model-based Unit Test Case Generation
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
Assessing Evaluation Metrics for Neural Test Oracle Generation
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach
by: Sepidband, Melika, et al.
Published: (2025)
by: Sepidband, Melika, et al.
Published: (2025)
Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions
by: Taherkhani, Hamed, et al.
Published: (2026)
by: Taherkhani, Hamed, et al.
Published: (2026)
Automated Prompt Engineering for Cost-Effective Code Generation Using Evolutionary Algorithm
by: Taherkhani, Hamed, et al.
Published: (2024)
by: Taherkhani, Hamed, et al.
Published: (2024)
Towards AI-Assisted Synthesis of Verified Dafny Methods
by: Misu, Md Rakib Hossain, et al.
Published: (2024)
by: Misu, Md Rakib Hossain, et al.
Published: (2024)
Test Smell: A Parasitic Energy Consumer in Software Testing
by: Misu, Md Rakib Hossain, et al.
Published: (2023)
by: Misu, Md Rakib Hossain, et al.
Published: (2023)
VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications
by: Misu, Md Rakib Hossain, et al.
Published: (2026)
by: Misu, Md Rakib Hossain, et al.
Published: (2026)
Retrieval-Augmented Test Generation: How Far Are We?
by: Shin, Jiho, et al.
Published: (2024)
by: Shin, Jiho, et al.
Published: (2024)
Prompt Engineering or Fine-Tuning: An Empirical Assessment of LLMs for Code
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
What's in a Proof? Analyzing Expert Proof-Writing Processes in F* and Verus
by: Jain, Rijul, et al.
Published: (2025)
by: Jain, Rijul, et al.
Published: (2025)
Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
FlakyFix: Using Large Language Models for Predicting Flaky Test Fix Categories and Test Code Repair
by: Fatima, Sakina, et al.
Published: (2023)
by: Fatima, Sakina, et al.
Published: (2023)
StaAgent: An Agentic Framework for Testing Static Analyzers
by: Nnorom, Elijah, et al.
Published: (2025)
by: Nnorom, Elijah, et al.
Published: (2025)
Automated Proof Generation for Rust Code via Self-Evolution
by: Chen, Tianyu, et al.
Published: (2024)
by: Chen, Tianyu, et al.
Published: (2024)
AutoVerus: Automated Proof Generation for Rust Code
by: Yang, Chenyuan, et al.
Published: (2024)
by: Yang, Chenyuan, et al.
Published: (2024)
Communication-Efficient Federated Learning over Wireless Channels via Gradient Sketching
by: Gattani, Vineet Sunil, et al.
Published: (2024)
by: Gattani, Vineet Sunil, et al.
Published: (2024)
CIgrate: Automating CI Service Migration with Large Language Models
by: Hossain, Md Nazmul, et al.
Published: (2025)
by: Hossain, Md Nazmul, et al.
Published: (2025)
On the Role of Fault Localization Context for LLM-Based Program Repair
by: Sepidband, Melika, et al.
Published: (2026)
by: Sepidband, Melika, et al.
Published: (2026)
Automatic Instantiation of Assurance Cases from Patterns Using Large Language Models
by: Odu, Oluwafemi, et al.
Published: (2024)
by: Odu, Oluwafemi, et al.
Published: (2024)
DafnyBench: A Benchmark for Formal Software Verification
by: Loughridge, Chloe, et al.
Published: (2024)
by: Loughridge, Chloe, et al.
Published: (2024)
An Empirical Study on Bug Severity Estimation using Source Code Metrics and Static Analysis
by: Mashhadi, Ehsan, et al.
Published: (2022)
by: Mashhadi, Ehsan, et al.
Published: (2022)
A Systematic Mapping Study of Crowd Knowledge Enhanced Software Engineering Research Using Stack Overflow
by: Tanzil, Minaoar, et al.
Published: (2024)
by: Tanzil, Minaoar, et al.
Published: (2024)
Automated Unit Test Case Generation: A Systematic Literature Review
by: Wang, Jason, et al.
Published: (2025)
by: Wang, Jason, et al.
Published: (2025)
SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection
by: Ahmed, Md Basim Uddin, et al.
Published: (2025)
by: Ahmed, Md Basim Uddin, et al.
Published: (2025)
Automated Harmfulness Testing for Code Large Language Models
by: Tan, Honghao, et al.
Published: (2025)
by: Tan, Honghao, et al.
Published: (2025)
Automated Test Case Repair Using Language Models
by: Yaraghi, Ahmadreza Saboor, et al.
Published: (2024)
by: Yaraghi, Ahmadreza Saboor, et al.
Published: (2024)
Automated Test Validators for Flaky Cyber-Physical System Simulators: Approach and Evaluation
by: Jodat, Baharin A., et al.
Published: (2025)
by: Jodat, Baharin A., et al.
Published: (2025)
Towards Automated Crowdsourced Testing via Personified-LLM
by: Yu, Shengcheng, et al.
Published: (2026)
by: Yu, Shengcheng, et al.
Published: (2026)
From Requirements to Test Cases: An NLP-Based Approach for High-Performance ECU Test Case Automation
by: Medeshetty, Nikitha, et al.
Published: (2025)
by: Medeshetty, Nikitha, et al.
Published: (2025)
Generating Project-Specific Test Cases with Requirement Validation Intention
by: Qi, Binhang, et al.
Published: (2025)
by: Qi, Binhang, et al.
Published: (2025)
Automated Testing of Prevalent 3D User Interactions in Virtual Reality Applications
by: Gu, Ruizhen, et al.
Published: (2026)
by: Gu, Ruizhen, et al.
Published: (2026)
Program Slicing in the Era of Large Language Models
by: Shahandashti, Kimya Khakzad, et al.
Published: (2024)
by: Shahandashti, Kimya Khakzad, et al.
Published: (2024)
Applications and Challenges of Fairness APIs in Machine Learning Software
by: Das, Ajoy, et al.
Published: (2025)
by: Das, Ajoy, et al.
Published: (2025)
The Good, the Bad, and the Missing: Neural Code Generation for Machine Learning Tasks
by: Shin, Jiho, et al.
Published: (2023)
by: Shin, Jiho, et al.
Published: (2023)
The Future of Software Testing: AI-Powered Test Case Generation and Validation
by: Baqar, Mohammad, et al.
Published: (2024)
by: Baqar, Mohammad, et al.
Published: (2024)
From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification
by: Erfan, Md, et al.
Published: (2026)
by: Erfan, Md, et al.
Published: (2026)
Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation
by: Abdollahi, Mohammad, et al.
Published: (2025)
by: Abdollahi, Mohammad, et al.
Published: (2025)
Introducing Ensemble Machine Learning Algorithms for Automatic Test Case Generation using Learning Based Testing
by: Rahman, Sheikh Md. Mushfiqur, et al.
Published: (2024)
by: Rahman, Sheikh Md. Mushfiqur, et al.
Published: (2024)
Similar Items
-
RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models
by: Sepidband, Melika, et al.
Published: (2026) -
Domain Adaptation for Code Model-based Unit Test Case Generation
by: Shin, Jiho, et al.
Published: (2023) -
Assessing Evaluation Metrics for Neural Test Oracle Generation
by: Shin, Jiho, et al.
Published: (2023) -
Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach
by: Sepidband, Melika, et al.
Published: (2025) -
Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions
by: Taherkhani, Hamed, et al.
Published: (2026)