Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Yuheng, Song, Jiayang, Wang, Zhijie, Zhao, Shengming, Chen, Huaming, Juefei-Xu, Felix, Ma, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling
by: Huang, Yuheng, et al.
Published: (2024)
by: Huang, Yuheng, et al.
Published: (2024)
Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems
by: Zhao, Shengming, et al.
Published: (2024)
by: Zhao, Shengming, et al.
Published: (2024)
LeCov: Multi-level Testing Criteria for Large Language Models
by: Xie, Xuan, et al.
Published: (2024)
by: Xie, Xuan, et al.
Published: (2024)
LUNA: A Model-Based Universal Analysis Framework for Large Language Models
by: Song, Da, et al.
Published: (2023)
by: Song, Da, et al.
Published: (2023)
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
by: Wang, Zhijie, et al.
Published: (2024)
by: Wang, Zhijie, et al.
Published: (2024)
TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
by: Sun, Ruoyu, et al.
Published: (2025)
by: Sun, Ruoyu, et al.
Published: (2025)
Towards Understanding the Characteristics of Code Generation Errors Made by Large Language Models
by: Wang, Zhijie, et al.
Published: (2024)
by: Wang, Zhijie, et al.
Published: (2024)
LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models
by: Huang, Linghan, et al.
Published: (2025)
by: Huang, Linghan, et al.
Published: (2025)
On the Challenges of Fuzzing Techniques via Large Language Models
by: Huang, Linghan, et al.
Published: (2024)
by: Huang, Linghan, et al.
Published: (2024)
TESTEVAL: Benchmarking Large Language Models for Test Case Generation
by: Wang, Wenhan, et al.
Published: (2024)
by: Wang, Wenhan, et al.
Published: (2024)
Evaluating LLMs on Sequential API Call Through Automated Test Generation
by: Huang, Yuheng, et al.
Published: (2025)
by: Huang, Yuheng, et al.
Published: (2025)
Are Large Language Models a Threat to Programming Platforms? An Exploratory Study
by: Billah, Md Mustakim, et al.
Published: (2024)
by: Billah, Md Mustakim, et al.
Published: (2024)
LLMParser: An Exploratory Study on Using Large Language Models for Log Parsing
by: Ma, Zeyang, et al.
Published: (2024)
by: Ma, Zeyang, et al.
Published: (2024)
Not All RAGs Are Created Equal: A Component-Wise Empirical Study for Software Engineering Tasks
by: Ke, Qiang, et al.
Published: (2026)
by: Ke, Qiang, et al.
Published: (2026)
Large Language Models for Automated Web-Form-Test Generation: An Empirical Study
by: Li, Tao, et al.
Published: (2024)
by: Li, Tao, et al.
Published: (2024)
Fine-grained Testing for Autonomous Driving Software: a Study on Autoware with LLM-driven Unit Testing
by: Wang, Wenhan, et al.
Published: (2025)
by: Wang, Wenhan, et al.
Published: (2025)
Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward
by: Xie, Xuan, et al.
Published: (2024)
by: Xie, Xuan, et al.
Published: (2024)
Containers as the Quantum Leap in Software Development
by: Ahmad, Iftikhar, et al.
Published: (2025)
by: Ahmad, Iftikhar, et al.
Published: (2025)
An Exploratory Study of Bayesian Prompt Optimization for Test-Driven Code Generation with Large Language Models
by: Tomar, Shlok, et al.
Published: (2025)
by: Tomar, Shlok, et al.
Published: (2025)
What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code
by: Wen, Jiawen, et al.
Published: (2024)
by: Wen, Jiawen, et al.
Published: (2024)
Method Names in Jupyter Notebooks: An Exploratory Study
by: Wong, Carol, et al.
Published: (2025)
by: Wong, Carol, et al.
Published: (2025)
Evaluation and Improvement of Fault Detection for Large Language Models
by: Hu, Qiang, et al.
Published: (2024)
by: Hu, Qiang, et al.
Published: (2024)
Towards Advancing Code Generation with Large Language Models: A Research Roadmap
by: Jin, Haolin, et al.
Published: (2025)
by: Jin, Haolin, et al.
Published: (2025)
An Exploratory Study on Just-in-Time Multi-Programming-Language Bug Prediction
by: Li, Zengyang, et al.
Published: (2024)
by: Li, Zengyang, et al.
Published: (2024)
Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
by: Jin, Haolin, et al.
Published: (2025)
by: Jin, Haolin, et al.
Published: (2025)
Bug Priority Change Prediction: An Exploratory Study on Apache Software
by: Cai, Guangzong, et al.
Published: (2025)
by: Cai, Guangzong, et al.
Published: (2025)
Towards Building AI-CPS with NVIDIA Isaac Sim: An Industrial Benchmark and Case Study for Robotics Manipulation
by: Zhou, Zhehua, et al.
Published: (2023)
by: Zhou, Zhehua, et al.
Published: (2023)
An Exploratory Study on Build Issue Resolution Among Computer Science Students
by: Huang, Sunzhou, et al.
Published: (2025)
by: Huang, Sunzhou, et al.
Published: (2025)
Identifier Name Similarities: An Exploratory Study
by: Wong, Carol, et al.
Published: (2025)
by: Wong, Carol, et al.
Published: (2025)
MultiTest: Physical-Aware Object Insertion for Testing Multi-sensor Fusion Perception Systems
by: Gao, Xinyu, et al.
Published: (2024)
by: Gao, Xinyu, et al.
Published: (2024)
An Exploratory Study on Fine-Tuning Large Language Models for Secure Code Generation
by: Li, Junjie, et al.
Published: (2024)
by: Li, Junjie, et al.
Published: (2024)
These Aren't the Reviews You're Looking For How Humans Review AI-Generated Pull Requests
by: Duma, Kacper, et al.
Published: (2026)
by: Duma, Kacper, et al.
Published: (2026)
Test Before You Deploy: Governing Updates in the LLM Supply Chain
by: Chishti, Mohd Sameen, et al.
Published: (2026)
by: Chishti, Mohd Sameen, et al.
Published: (2026)
MORTAR: A Model-based Runtime Action Repair Framework for AI-enabled Cyber-Physical Systems
by: Wang, Renzhi, et al.
Published: (2024)
by: Wang, Renzhi, et al.
Published: (2024)
Can Large Language Models Solve Path Constraints in Symbolic Execution?
by: Wang, Wenhan, et al.
Published: (2025)
by: Wang, Wenhan, et al.
Published: (2025)
The Emergence of Large Language Models in Static Analysis: A First Look through Micro-Benchmarks
by: Venkatesh, Ashwin Prasad Shivarpatna, et al.
Published: (2024)
by: Venkatesh, Ashwin Prasad Shivarpatna, et al.
Published: (2024)
Configuring Agentic AI Coding Tools: An Exploratory Study
by: Galster, Matthias, et al.
Published: (2026)
by: Galster, Matthias, et al.
Published: (2026)
Readability and Understandability Scores for Snippet Assessment: an Exploratory Study
by: Dantas, Carlos Eduardo C., et al.
Published: (2021)
by: Dantas, Carlos Eduardo C., et al.
Published: (2021)
Test It Before You Trust It: Applying Software Testing for Trustworthy In-context Learning
by: Racharak, Teeradaj, et al.
Published: (2025)
by: Racharak, Teeradaj, et al.
Published: (2025)
Repair Ingredients Are All You Need: Improving Large Language Model-Based Program Repair via Repair Ingredients Search
by: Zhang, Jiayi, et al.
Published: (2025)
by: Zhang, Jiayi, et al.
Published: (2025)
Similar Items
-
AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling
by: Huang, Yuheng, et al.
Published: (2024) -
Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems
by: Zhao, Shengming, et al.
Published: (2024) -
LeCov: Multi-level Testing Criteria for Large Language Models
by: Xie, Xuan, et al.
Published: (2024) -
LUNA: A Model-Based Universal Analysis Framework for Large Language Models
by: Song, Da, et al.
Published: (2023) -
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
by: Wang, Zhijie, et al.
Published: (2024)