Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kulkarni, Atharva, Zhang, Yuan, Moniz, Joel Ruben Antony, Ge, Xiou, Tseng, Bo-Hsiang, Piraviperumal, Dhivya, Swayamdipta, Swabha, Yu, Hong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SynthDST: Synthetic Data is All You Need for Few-Shot Dialog State Tracking
par: Kulkarni, Atharva, et autres
Publié: (2024)
par: Kulkarni, Atharva, et autres
Publié: (2024)
Can Large Language Models Understand Context?
par: Zhu, Yilun, et autres
Publié: (2024)
par: Zhu, Yilun, et autres
Publié: (2024)
Disentangling Geometry, Performance, and Training in Language Models
par: Kulkarni, Atharva, et autres
Publié: (2026)
par: Kulkarni, Atharva, et autres
Publié: (2026)
BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity
par: Diddee, Harshita, et autres
Publié: (2026)
par: Diddee, Harshita, et autres
Publié: (2026)
Compare without Despair: Reliable Preference Evaluation with Generation Separability
par: Ghosh, Sayan, et autres
Publié: (2024)
par: Ghosh, Sayan, et autres
Publié: (2024)
Understanding Dataset Difficulty with $\mathcal{V}$-Usable Information
par: Ethayarajh, Kawin, et autres
Publié: (2021)
par: Ethayarajh, Kawin, et autres
Publié: (2021)
How to Detect and Defeat Molecular Mirage: A Metric-Driven Benchmark for Hallucination in LLM-based Molecular Comprehension
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Annotating FrameNet via Structure-Conditioned Language Generation
par: Cui, Xinyue, et autres
Publié: (2024)
par: Cui, Xinyue, et autres
Publié: (2024)
ChEmREF: Evaluating Language Model Readiness for Chemical Emergency Response
par: Surana, Risha, et autres
Publié: (2025)
par: Surana, Risha, et autres
Publié: (2025)
Logits of API-Protected LLMs Leak Proprietary Information
par: Finlayson, Matthew, et autres
Publié: (2024)
par: Finlayson, Matthew, et autres
Publié: (2024)
Evaluation Under Imperfect Benchmarks and Ratings: A Case Study in Text Simplification
par: Liu, Joseph, et autres
Publié: (2025)
par: Liu, Joseph, et autres
Publié: (2025)
Why Fine-Tuning Encourages Hallucinations and How to Fix It
par: Kaplan, Guy, et autres
Publié: (2026)
par: Kaplan, Guy, et autres
Publié: (2026)
ReALM: Reference Resolution As Language Modeling
par: Moniz, Joel Ruben Antony, et autres
Publié: (2024)
par: Moniz, Joel Ruben Antony, et autres
Publié: (2024)
How Reliable is Language Model Micro-Benchmarking?
par: Yauney, Gregory, et autres
Publié: (2025)
par: Yauney, Gregory, et autres
Publié: (2025)
Every Language Model Has a Forgery-Resistant Signature
par: Finlayson, Matthew, et autres
Publié: (2025)
par: Finlayson, Matthew, et autres
Publié: (2025)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?
par: Khurana, Urja, et autres
Publié: (2024)
par: Khurana, Urja, et autres
Publié: (2024)
Generative Explanations for Program Synthesizers
par: Nazari, Amirmohammad, et autres
Publié: (2024)
par: Nazari, Amirmohammad, et autres
Publié: (2024)
Do Compact SSL Backbones Matter for Audio Deepfake Detection? A Controlled Study with RAPTOR
par: Kulkarni, Ajinkya, et autres
Publié: (2026)
par: Kulkarni, Ajinkya, et autres
Publié: (2026)
Comparing Hallucination Detection Metrics for Multilingual Generation
par: Kang, Haoqiang, et autres
Publié: (2024)
par: Kang, Haoqiang, et autres
Publié: (2024)
Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis
par: Hengle, Amey, et autres
Publié: (2024)
par: Hengle, Amey, et autres
Publié: (2024)
Enhancing Knowledge Graph Construction: Evaluating with Emphasis on Hallucination, Omission, and Graph Similarity Metrics
par: Ghanem, Hussam, et autres
Publié: (2025)
par: Ghanem, Hussam, et autres
Publié: (2025)
Side-by-side Comparison Amplifies Dialect Bias in Language Models
par: Kondapally, Kritee, et autres
Publié: (2026)
par: Kondapally, Kritee, et autres
Publié: (2026)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
par: Matsuda, Kazuki, et autres
Publié: (2024)
par: Matsuda, Kazuki, et autres
Publié: (2024)
A Survey of Automatic Hallucination Evaluation on Natural Language Generation
par: Qi, Siya, et autres
Publié: (2024)
par: Qi, Siya, et autres
Publié: (2024)
ELI-Why: Evaluating the Pedagogical Utility of Language Model Explanations
par: Joshi, Brihi, et autres
Publié: (2025)
par: Joshi, Brihi, et autres
Publié: (2025)
The Two Sides of the Coin: Hallucination Generation and Detection with LLMs as Evaluators for LLMs
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
par: Bui, Anh Thu Maria, et autres
Publié: (2024)
The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
Teaching Models to Understand (but not Generate) High-risk Data
par: Wang, Ryan, et autres
Publié: (2025)
par: Wang, Ryan, et autres
Publié: (2025)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
par: Hao, Yijie, et autres
Publié: (2025)
par: Hao, Yijie, et autres
Publié: (2025)
MedHal: An Evaluation Dataset for Medical Hallucination Detection
par: Mehenni, Gaya, et autres
Publié: (2025)
par: Mehenni, Gaya, et autres
Publié: (2025)
Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
par: Ghosh, Sayan, et autres
Publié: (2025)
par: Ghosh, Sayan, et autres
Publié: (2025)
Improving Language Model Personas via Rationalization with Psychological Scaffolds
par: Joshi, Brihi, et autres
Publié: (2025)
par: Joshi, Brihi, et autres
Publié: (2025)
Better Language Model Inversion by Compactly Representing Next-Token Distributions
par: Nazir, Murtaza, et autres
Publié: (2025)
par: Nazir, Murtaza, et autres
Publié: (2025)
From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
par: Zhang, Le, et autres
Publié: (2026)
par: Zhang, Le, et autres
Publié: (2026)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
par: Tang, Liyan, et autres
Publié: (2024)
par: Tang, Liyan, et autres
Publié: (2024)
Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge
par: Cui, Xinyue, et autres
Publié: (2025)
par: Cui, Xinyue, et autres
Publié: (2025)
Lynx: An Open Source Hallucination Evaluation Model
par: Ravi, Selvan Sunitha, et autres
Publié: (2024)
par: Ravi, Selvan Sunitha, et autres
Publié: (2024)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
par: Mündler, Niels, et autres
Publié: (2023)
par: Mündler, Niels, et autres
Publié: (2023)
ASPERA: A Simulated Environment to Evaluate Planning for Complex Action Execution
par: Coca, Alexandru, et autres
Publié: (2025)
par: Coca, Alexandru, et autres
Publié: (2025)
Documents similaires
-
SynthDST: Synthetic Data is All You Need for Few-Shot Dialog State Tracking
par: Kulkarni, Atharva, et autres
Publié: (2024) -
Can Large Language Models Understand Context?
par: Zhu, Yilun, et autres
Publié: (2024) -
Disentangling Geometry, Performance, and Training in Language Models
par: Kulkarni, Atharva, et autres
Publié: (2026) -
BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity
par: Diddee, Harshita, et autres
Publié: (2026) -
Compare without Despair: Reliable Preference Evaluation with Generation Separability
par: Ghosh, Sayan, et autres
Publié: (2024)