Drowzee: Metamorphic Testing for Fact-Conflicting Hallucination Detection in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Ningke, Li, Yuekang, Liu, Yi, Shi, Ling, Wang, Kailong, Wang, Haoyu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MeTMaP: Metamorphic Testing for Detecting False Vector Matching Problems in LLM Augmented Generation
by: Wang, Guanyu, et al.
Published: (2024)
by: Wang, Guanyu, et al.
Published: (2024)
Large Language Models are overconfident and amplify human bias
by: Sun, Fengfei, et al.
Published: (2025)
by: Sun, Fengfei, et al.
Published: (2025)
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
MiniScope: Automated UI Exploration and Privacy Inconsistency Detection of MiniApps via Two-phase Iterative Hybrid Analysis
by: Wang, Shenao, et al.
Published: (2024)
by: Wang, Shenao, et al.
Published: (2024)
Detecting LLM Fact-conflicting Hallucinations Enhanced by Temporal-logic-based Reasoning
by: Li, Ningke, et al.
Published: (2025)
by: Li, Ningke, et al.
Published: (2025)
Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks
by: Zhou, Shide, et al.
Published: (2024)
by: Zhou, Shide, et al.
Published: (2024)
Enhancing Semantic Understanding in Pointer Analysis using Large Language Models
by: Cheng, Baijun, et al.
Published: (2025)
by: Cheng, Baijun, et al.
Published: (2025)
Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
by: Zheng, Xinyi, et al.
Published: (2025)
by: Zheng, Xinyi, et al.
Published: (2025)
Semantic-Enhanced Indirect Call Analysis with Large Language Models
by: Cheng, Baijun, et al.
Published: (2024)
by: Cheng, Baijun, et al.
Published: (2024)
Hallucination Detection for LLM-based Text-to-SQL Generation via Two-Stage Metamorphic Testing
by: Yang, Bo, et al.
Published: (2025)
by: Yang, Bo, et al.
Published: (2025)
Boosting Pointer Analysis With LLM-Enhanced Allocation Function Detection
by: Cheng, Baijun, et al.
Published: (2025)
by: Cheng, Baijun, et al.
Published: (2025)
SPOLRE: Semantic Preserving Object Layout Reconstruction for Image Captioning System Testing
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
NeuSemSlice: Towards Effective DNN Model Maintenance via Neuron-level Semantic Slicing
by: Zhou, Shide, et al.
Published: (2024)
by: Zhou, Shide, et al.
Published: (2024)
CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation
by: Xiong, Zhanhang, et al.
Published: (2025)
by: Xiong, Zhanhang, et al.
Published: (2025)
Metamorphic Testing of Large Language Models for Natural Language Processing
by: Cho, Steven, et al.
Published: (2025)
by: Cho, Steven, et al.
Published: (2025)
Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey
by: Zheng, Zheng, et al.
Published: (2026)
by: Zheng, Zheng, et al.
Published: (2026)
DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation
by: Yang, Mingke, et al.
Published: (2024)
by: Yang, Mingke, et al.
Published: (2024)
Large Language Models for Software Engineering: A Systematic Literature Review
by: Hou, Xinyi, et al.
Published: (2023)
by: Hou, Xinyi, et al.
Published: (2023)
Test Adequacy for Metamorphic Testing: Criteria, Measurement, and Implication
by: Fu, An, et al.
Published: (2024)
by: Fu, An, et al.
Published: (2024)
Efficient Fairness Testing in Large Language Models: Prioritizing Metamorphic Relations for Bias Detection
by: Giramata, Suavis, et al.
Published: (2025)
by: Giramata, Suavis, et al.
Published: (2025)
Towards Generating Executable Metamorphic Relations Using Large Language Models
by: Shin, Seung Yeob, et al.
Published: (2024)
by: Shin, Seung Yeob, et al.
Published: (2024)
Improving Deep Learning Framework Testing with Model-Level Metamorphic Testing
by: Mu, Yanzhou, et al.
Published: (2025)
by: Mu, Yanzhou, et al.
Published: (2025)
CodeMorph: Mitigating Data Leakage in Large Language Model Assessment
by: Rao, Hongzhou, et al.
Published: (2025)
by: Rao, Hongzhou, et al.
Published: (2025)
Metamorphic Testing of Vision-Language Action-Enabled Robots
by: Valle, Pablo, et al.
Published: (2026)
by: Valle, Pablo, et al.
Published: (2026)
Metamorphic Testing of Image Captioning Systems via Image-Level Reduction
by: Xie, Xiaoyuan, et al.
Published: (2023)
by: Xie, Xiaoyuan, et al.
Published: (2023)
Exploring and Lifting the Robustness of LLM-powered Automated Program Repair with Metamorphic Testing
by: Xue, Pengyu, et al.
Published: (2024)
by: Xue, Pengyu, et al.
Published: (2024)
Leveraging Large Vision Language Model For Better Automatic Web GUI Testing
by: Wang, Siyi, et al.
Published: (2024)
by: Wang, Siyi, et al.
Published: (2024)
Redefining Crowdsourced Test Report Prioritization: An Innovative Approach with Large Language Model
by: Ling, Yuchen, et al.
Published: (2024)
by: Ling, Yuchen, et al.
Published: (2024)
MT4DP: Data Poisoning Attack Detection for DL-based Code Search Models via Metamorphic Testing
by: Chen, Gong, et al.
Published: (2025)
by: Chen, Gong, et al.
Published: (2025)
Validating LLM-Generated Programs with Metamorphic Prompt Testing
by: Wang, Xiaoyin, et al.
Published: (2024)
by: Wang, Xiaoyin, et al.
Published: (2024)
SliceLocator: Locating Vulnerable Statements with Graph-based Detectors
by: Cheng, Baijun, et al.
Published: (2024)
by: Cheng, Baijun, et al.
Published: (2024)
Detecting Non-Optimal Decisions of Embodied Agents via Diversity-Guided Metamorphic Testing
by: Wu, Wenzhao, et al.
Published: (2025)
by: Wu, Wenzhao, et al.
Published: (2025)
Large Language Model Supply Chain: A Research Agenda
by: Wang, Shenao, et al.
Published: (2024)
by: Wang, Shenao, et al.
Published: (2024)
Word Closure-Based Metamorphic Testing for Machine Translation
by: Xie, Xiaoyuan, et al.
Published: (2023)
by: Xie, Xiaoyuan, et al.
Published: (2023)
WaDec: Decompiling WebAssembly Using Large Language Model
by: She, Xinyu, et al.
Published: (2024)
by: She, Xinyu, et al.
Published: (2024)
Detecting Semantic Conflicts with Unit Tests
by: Da Silva, Léuson, et al.
Published: (2023)
by: Da Silva, Léuson, et al.
Published: (2023)
Software Testing with Large Language Models: Survey, Landscape, and Vision
by: Wang, Junjie, et al.
Published: (2023)
by: Wang, Junjie, et al.
Published: (2023)
Interleaving Large Language Models for Compiler Testing
by: Ni, Yunbo, et al.
Published: (2025)
by: Ni, Yunbo, et al.
Published: (2025)
Metamorphic Testing of Multimodal Human Trajectory Prediction
by: Spieker, Helge, et al.
Published: (2025)
by: Spieker, Helge, et al.
Published: (2025)
Metamorphic Testing for Audio Content Moderation Software
by: Wang, Wenxuan, et al.
Published: (2025)
by: Wang, Wenxuan, et al.
Published: (2025)
Similar Items
-
MeTMaP: Metamorphic Testing for Detecting False Vector Matching Problems in LLM Augmented Generation
by: Wang, Guanyu, et al.
Published: (2024) -
Large Language Models are overconfident and amplify human bias
by: Sun, Fengfei, et al.
Published: (2025) -
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
by: Li, Yuxi, et al.
Published: (2024) -
MiniScope: Automated UI Exploration and Privacy Inconsistency Detection of MiniApps via Two-phase Iterative Hybrid Analysis
by: Wang, Shenao, et al.
Published: (2024) -
Detecting LLM Fact-conflicting Hallucinations Enhanced by Temporal-logic-based Reasoning
by: Li, Ningke, et al.
Published: (2025)