The Case for Repeatable, Open, and Expert-Grounded Hallucination Benchmarks in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Norman, Justin D., Rivera, Michael U., Hughes, D. Alex |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models
by: Hong, Giwon, et al.
Published: (2024)
by: Hong, Giwon, et al.
Published: (2024)
Osiris: A Lightweight Open-Source Hallucination Detection System
by: Shan, Alex, et al.
Published: (2025)
by: Shan, Alex, et al.
Published: (2025)
HalluScore: Large Language Model Hallucination Question Answering Benchmark
by: Alansari, Aisha, et al.
Published: (2026)
by: Alansari, Aisha, et al.
Published: (2026)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
by: Moratelli, Nicholas, et al.
Published: (2026)
by: Moratelli, Nicholas, et al.
Published: (2026)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
by: Hosseini, Mohammad, et al.
Published: (2025)
by: Hosseini, Mohammad, et al.
Published: (2025)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
by: Sun, Yuhong, et al.
Published: (2024)
by: Sun, Yuhong, et al.
Published: (2024)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
by: Liang, Xun, et al.
Published: (2023)
by: Liang, Xun, et al.
Published: (2023)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
by: Geigle, Gregor, et al.
Published: (2024)
by: Geigle, Gregor, et al.
Published: (2024)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
by: Tu, Yahan, et al.
Published: (2024)
by: Tu, Yahan, et al.
Published: (2024)
WikiChat: Stopping the Hallucination of Large Language Model Chatbots by Few-Shot Grounding on Wikipedia
by: Semnani, Sina J., et al.
Published: (2023)
by: Semnani, Sina J., et al.
Published: (2023)
A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions
by: Huang, Lei, et al.
Published: (2023)
by: Huang, Lei, et al.
Published: (2023)
Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models
by: Zhang, Hanzhi, et al.
Published: (2025)
by: Zhang, Hanzhi, et al.
Published: (2025)
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
by: Hu, Xiangkun, et al.
Published: (2024)
by: Hu, Xiangkun, et al.
Published: (2024)
Multilingual Hallucination Gaps in Large Language Models
by: Chataigner, Cléa, et al.
Published: (2024)
by: Chataigner, Cléa, et al.
Published: (2024)
IDEAlign: Comparing Large Language Models to Human Experts in Open-ended Interpretive Annotations
by: Nam, Hyunji, et al.
Published: (2025)
by: Nam, Hyunji, et al.
Published: (2025)
LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence
by: Liu, Wenjin, et al.
Published: (2025)
by: Liu, Wenjin, et al.
Published: (2025)
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
by: Zhang, Yue, et al.
Published: (2023)
by: Zhang, Yue, et al.
Published: (2023)
Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models
by: Xie, Zikai
Published: (2024)
by: Xie, Zikai
Published: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
by: Chen, Kedi, et al.
Published: (2024)
by: Chen, Kedi, et al.
Published: (2024)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Open Grounded Planning: Challenges and Benchmark Construction
by: Guo, Shiguang, et al.
Published: (2024)
by: Guo, Shiguang, et al.
Published: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
by: Lu, Yifan, et al.
Published: (2025)
by: Lu, Yifan, et al.
Published: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
by: Cui, Justin, et al.
Published: (2024)
by: Cui, Justin, et al.
Published: (2024)
Exploring and Mitigating Fawning Hallucinations in Large Language Models
by: Shangguan, Zixuan, et al.
Published: (2025)
by: Shangguan, Zixuan, et al.
Published: (2025)
Large Language Models Hallucination: A Comprehensive Survey
by: Alansari, Aisha, et al.
Published: (2025)
by: Alansari, Aisha, et al.
Published: (2025)
Mitigating Large Language Model Hallucination with Faithful Finetuning
by: Hu, Minda, et al.
Published: (2024)
by: Hu, Minda, et al.
Published: (2024)
Unveiling Super Experts in Mixture-of-Experts Large Language Models
by: Su, Zunhai, et al.
Published: (2025)
by: Su, Zunhai, et al.
Published: (2025)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
by: Zhao, Linxi, et al.
Published: (2024)
by: Zhao, Linxi, et al.
Published: (2024)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
by: Zuo, Kaiwen, et al.
Published: (2024)
by: Zuo, Kaiwen, et al.
Published: (2024)
How Large Language Models are Designed to Hallucinate
by: Ackermann, Richard, et al.
Published: (2025)
by: Ackermann, Richard, et al.
Published: (2025)
Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
by: Guo, Hongcheng, et al.
Published: (2025)
by: Guo, Hongcheng, et al.
Published: (2025)
Hallucination Detection and Evaluation of Large Language Model
by: Zhang, Chenggong, et al.
Published: (2025)
by: Zhang, Chenggong, et al.
Published: (2025)
An Evolutionary Large Language Model for Hallucination Mitigation
by: Boulesnane, Abdennour, et al.
Published: (2024)
by: Boulesnane, Abdennour, et al.
Published: (2024)
MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models
by: Liu, Weixin, et al.
Published: (2026)
by: Liu, Weixin, et al.
Published: (2026)
Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models
by: Damianos, Dimitrios, et al.
Published: (2026)
by: Damianos, Dimitrios, et al.
Published: (2026)
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
by: Ha, Jiwoo, et al.
Published: (2026)
by: Ha, Jiwoo, et al.
Published: (2026)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
by: Huang, Yipo, et al.
Published: (2024)
by: Huang, Yipo, et al.
Published: (2024)
Addressing Topic Granularity and Hallucination in Large Language Models for Topic Modelling
by: Mu, Yida, et al.
Published: (2024)
by: Mu, Yida, et al.
Published: (2024)
Knowledge Overshadowing Causes Amalgamated Hallucination in Large Language Models
by: Zhang, Yuji, et al.
Published: (2024)
by: Zhang, Yuji, et al.
Published: (2024)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
by: Hu, Jiliang, et al.
Published: (2025)
by: Hu, Jiliang, et al.
Published: (2025)
Similar Items
-
The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models
by: Hong, Giwon, et al.
Published: (2024) -
Osiris: A Lightweight Open-Source Hallucination Detection System
by: Shan, Alex, et al.
Published: (2025) -
HalluScore: Large Language Model Hallucination Question Answering Benchmark
by: Alansari, Aisha, et al.
Published: (2026) -
Benchmarking Deflection and Hallucination in Large Vision-Language Models
by: Moratelli, Nicholas, et al.
Published: (2026) -
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
by: Hosseini, Mohammad, et al.
Published: (2025)