A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Aghazadeh-Chakherlou, Robab, Guo, Qing, Khastgir, Siddartha, Popov, Peter, Zhang, Xiaoge, Zhao, Xingyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On the Need for a Statistical Foundation in Scenario-Based Testing of Autonomous Vehicles
por: Zhao, Xingyu, et al.
Publicado: (2025)
por: Zhao, Xingyu, et al.
Publicado: (2025)
A Scalable Framework for Safety Assurance of Self-Driving Vehicles based on Assurance 2.0
por: Chen, Shufeng, et al.
Publicado: (2025)
por: Chen, Shufeng, et al.
Publicado: (2025)
Uncertainty-Aware Measurement of Scenario Suite Representativeness for Autonomous Systems
por: Chakherlou, Robab Aghazadeh, et al.
Publicado: (2025)
por: Chakherlou, Robab Aghazadeh, et al.
Publicado: (2025)
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
por: Qi, Yi, et al.
Publicado: (2023)
por: Qi, Yi, et al.
Publicado: (2023)
Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling
por: Broadwater, Keita
Publicado: (2026)
por: Broadwater, Keita
Publicado: (2026)
Assessing the Business Process Modeling Competences of Large Language Models
por: Lauer, Chantale, et al.
Publicado: (2026)
por: Lauer, Chantale, et al.
Publicado: (2026)
On the Challenges of Fuzzing Techniques via Large Language Models
por: Huang, Linghan, et al.
Publicado: (2024)
por: Huang, Linghan, et al.
Publicado: (2024)
RePaCA: Leveraging Reasoning Large Language Models for Static Automated Patch Correctness Assessment
por: Fuster-Pena, Marcos, et al.
Publicado: (2025)
por: Fuster-Pena, Marcos, et al.
Publicado: (2025)
An Effective Approach to Embedding Source Code by Combining Large Language and Sentence Embedding Models
por: Xian, Zixiang, et al.
Publicado: (2024)
por: Xian, Zixiang, et al.
Publicado: (2024)
Personality-Guided Code Generation Using Large Language Models
por: Guo, Yaoqi, et al.
Publicado: (2024)
por: Guo, Yaoqi, et al.
Publicado: (2024)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
por: Liu, Jingjing, et al.
Publicado: (2025)
por: Liu, Jingjing, et al.
Publicado: (2025)
A System for Automated Unit Test Generation Using Large Language Models and Assessment of Generated Test Suites
por: Lops, Andrea, et al.
Publicado: (2024)
por: Lops, Andrea, et al.
Publicado: (2024)
Enhancing Large Language Model Efficiencyvia Symbolic Compression: A Formal Approach Towards Interpretability
por: AI, Lumen, et al.
Publicado: (2025)
por: AI, Lumen, et al.
Publicado: (2025)
Quality Assessment of Tabular Data using Large Language Models and Code Generation
por: Akella, Ashlesha, et al.
Publicado: (2025)
por: Akella, Ashlesha, et al.
Publicado: (2025)
A Contemporary Survey of Large Language Model Assisted Program Analysis
por: Wang, Jiayimei, et al.
Publicado: (2025)
por: Wang, Jiayimei, et al.
Publicado: (2025)
Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection
por: Mudunuri, Sarat, et al.
Publicado: (2026)
por: Mudunuri, Sarat, et al.
Publicado: (2026)
Vulnerability Detection: From Formal Verification to Large Language Models and Hybrid Approaches: A Comprehensive Overview
por: Tihanyi, Norbert, et al.
Publicado: (2025)
por: Tihanyi, Norbert, et al.
Publicado: (2025)
LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models
por: Huang, Linghan, et al.
Publicado: (2025)
por: Huang, Linghan, et al.
Publicado: (2025)
Nova: Generative Language Models for Assembly Code with Hierarchical Attention and Contrastive Learning
por: Jiang, Nan, et al.
Publicado: (2023)
por: Jiang, Nan, et al.
Publicado: (2023)
Exploringand Unleashing the Power of Large Language Models in CI/CD Configuration Translation
por: Wang, Chong, et al.
Publicado: (2025)
por: Wang, Chong, et al.
Publicado: (2025)
Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead
por: Rao, Hongzhou, et al.
Publicado: (2025)
por: Rao, Hongzhou, et al.
Publicado: (2025)
Simulation Streams: A Programming Paradigm for Controlling Large Language Models and Building Complex Systems with Generative AI
por: Sunehag, Peter, et al.
Publicado: (2025)
por: Sunehag, Peter, et al.
Publicado: (2025)
HFuzzer: Testing Large Language Models for Package Hallucinations via Phrase-based Fuzzing
por: Zhao, Yukai, et al.
Publicado: (2025)
por: Zhao, Yukai, et al.
Publicado: (2025)
LogiDebrief: A Signal-Temporal Logic based Automated Debriefing Approach with Large Language Models Integration
por: Chen, Zirong, et al.
Publicado: (2025)
por: Chen, Zirong, et al.
Publicado: (2025)
Synthline: A Product Line Approach for Synthetic Requirements Engineering Data Generation using Large Language Models
por: El-Hajjami, Abdelkarim, et al.
Publicado: (2025)
por: El-Hajjami, Abdelkarim, et al.
Publicado: (2025)
Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
por: Zhou, Yongxi, et al.
Publicado: (2026)
por: Zhou, Yongxi, et al.
Publicado: (2026)
StackTrans: From Large Language Model to Large Pushdown Automata Model
por: Zhang, Kechi, et al.
Publicado: (2025)
por: Zhang, Kechi, et al.
Publicado: (2025)
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
por: He, Yibo, et al.
Publicado: (2025)
por: He, Yibo, et al.
Publicado: (2025)
Large Language Models for Software Engineering: A Systematic Literature Review
por: Hou, Xinyi, et al.
Publicado: (2023)
por: Hou, Xinyi, et al.
Publicado: (2023)
Explore-Construct-Filter: An Automated Framework for Rich and Reliable API Knowledge Graph Construction
por: Sun, Yanbang, et al.
Publicado: (2025)
por: Sun, Yanbang, et al.
Publicado: (2025)
Metamorphic Testing of Large Language Models for Natural Language Processing
por: Cho, Steven, et al.
Publicado: (2025)
por: Cho, Steven, et al.
Publicado: (2025)
LUK: Empowering Log Understanding with Expert Knowledge from Large Language Models
por: Ma, Lipeng, et al.
Publicado: (2024)
por: Ma, Lipeng, et al.
Publicado: (2024)
Evaluating Large Language Models for Code Review
por: Cihan, Umut, et al.
Publicado: (2025)
por: Cihan, Umut, et al.
Publicado: (2025)
Explaining Software Vulnerabilities with Large Language Models
por: Johnson, Oshando, et al.
Publicado: (2025)
por: Johnson, Oshando, et al.
Publicado: (2025)
From Flat Logs to Causal Graphs: Hierarchical Failure Attribution for LLM-based Multi-Agent Systems
por: Wang, Yawen, et al.
Publicado: (2026)
por: Wang, Yawen, et al.
Publicado: (2026)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
From Charts to Code: A Hierarchical Benchmark for Multimodal Models
por: Tang, Jiahao, et al.
Publicado: (2025)
por: Tang, Jiahao, et al.
Publicado: (2025)
The Systems Engineering Approach in Times of Large Language Models
por: Cabrera, Christian, et al.
Publicado: (2024)
por: Cabrera, Christian, et al.
Publicado: (2024)
Peer-aided Repairer: Empowering Large Language Models to Repair Advanced Student Assignments
por: Zhao, Qianhui, et al.
Publicado: (2024)
por: Zhao, Qianhui, et al.
Publicado: (2024)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
Ejemplares similares
-
On the Need for a Statistical Foundation in Scenario-Based Testing of Autonomous Vehicles
por: Zhao, Xingyu, et al.
Publicado: (2025) -
A Scalable Framework for Safety Assurance of Self-Driving Vehicles based on Assurance 2.0
por: Chen, Shufeng, et al.
Publicado: (2025) -
Uncertainty-Aware Measurement of Scenario Suite Representativeness for Autonomous Systems
por: Chakherlou, Robab Aghazadeh, et al.
Publicado: (2025) -
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
por: Qi, Yi, et al.
Publicado: (2023) -
Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling
por: Broadwater, Keita
Publicado: (2026)