A Survey of Automatic Hallucination Evaluation on Natural Language Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Siya, Gui, Lin, He, Yulan, Yuan, Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating LLMs' Assessment of Mixed-Context Hallucination Through the Lens of Summarization
di: Qi, Siya, et al.
Pubblicazione: (2025)
di: Qi, Siya, et al.
Pubblicazione: (2025)
Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
ExDDI: Explaining Drug-Drug Interaction Predictions with Natural Language
di: Sun, Zhaoyue, et al.
Pubblicazione: (2024)
di: Sun, Zhaoyue, et al.
Pubblicazione: (2024)
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
di: Zhang, Guo-Biao, et al.
Pubblicazione: (2026)
di: Zhang, Guo-Biao, et al.
Pubblicazione: (2026)
Mirror: A Multiple-perspective Self-Reflection Method for Knowledge-rich Reasoning
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention
di: Qi, Siya, et al.
Pubblicazione: (2026)
di: Qi, Siya, et al.
Pubblicazione: (2026)
Large Language Models Fall Short: Understanding Complex Relationships in Detective Narratives
di: Zhao, Runcong, et al.
Pubblicazione: (2024)
di: Zhao, Runcong, et al.
Pubblicazione: (2024)
Cascading Large Language Models for Salient Event Graph Generation
di: Tan, Xingwei, et al.
Pubblicazione: (2024)
di: Tan, Xingwei, et al.
Pubblicazione: (2024)
SymbolicThought: Integrating Language Models and Symbolic Reasoning for Consistent and Interpretable Human Relationship Understanding
di: Zhao, Runcong, et al.
Pubblicazione: (2025)
di: Zhao, Runcong, et al.
Pubblicazione: (2025)
Hallucination-Free Automatic Question & Answer Generation for Intuitive Learning
di: Wang, Nicholas X., et al.
Pubblicazione: (2026)
di: Wang, Nicholas X., et al.
Pubblicazione: (2026)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
di: Chen, Kedi, et al.
Pubblicazione: (2024)
di: Chen, Kedi, et al.
Pubblicazione: (2024)
Encourage or Inhibit Monosemanticity? Revisit Monosemanticity from a Feature Decorrelation Perspective
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
CWTM: Leveraging Contextualized Word Embeddings from BERT for Neural Topic Modeling
di: Fang, Zheng, et al.
Pubblicazione: (2023)
di: Fang, Zheng, et al.
Pubblicazione: (2023)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
di: Yuan, Lin, et al.
Pubblicazione: (2025)
di: Yuan, Lin, et al.
Pubblicazione: (2025)
NLAS-multi: A Multilingual Corpus of Automatically Generated Natural Language Argumentation Schemes
di: Ruiz-Dolz, Ramon, et al.
Pubblicazione: (2024)
di: Ruiz-Dolz, Ramon, et al.
Pubblicazione: (2024)
Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Models
di: Zhang, Yanyue, et al.
Pubblicazione: (2025)
di: Zhang, Yanyue, et al.
Pubblicazione: (2025)
Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation
di: Hu, Zhanghao, et al.
Pubblicazione: (2026)
di: Hu, Zhanghao, et al.
Pubblicazione: (2026)
Evaluation of Retrieval-Augmented Generation: A Survey
di: Yu, Hao, et al.
Pubblicazione: (2024)
di: Yu, Hao, et al.
Pubblicazione: (2024)
Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
Natural Language Interfaces for Tabular Data Querying and Visualization: A Survey
di: Zhang, Weixu, et al.
Pubblicazione: (2023)
di: Zhang, Weixu, et al.
Pubblicazione: (2023)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
LightHouse: A Survey of AGI Hallucination
di: Wang, Feng
Pubblicazione: (2024)
di: Wang, Feng
Pubblicazione: (2024)
A Systematic Survey of Automatic Prompt Optimization Techniques
di: Ramnath, Kiran, et al.
Pubblicazione: (2025)
di: Ramnath, Kiran, et al.
Pubblicazione: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
di: Jiang, Nan, et al.
Pubblicazione: (2024)
di: Jiang, Nan, et al.
Pubblicazione: (2024)
A Systematic Survey of Natural Language Processing for the Greek Language
di: Bakagianni, Juli, et al.
Pubblicazione: (2024)
di: Bakagianni, Juli, et al.
Pubblicazione: (2024)
AutoSurvey: Large Language Models Can Automatically Write Surveys
di: Wang, Yidong, et al.
Pubblicazione: (2024)
di: Wang, Yidong, et al.
Pubblicazione: (2024)
A Survey on Evaluation of Large Language Models
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
di: Hao, Yijie, et al.
Pubblicazione: (2025)
di: Hao, Yijie, et al.
Pubblicazione: (2025)
DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models
di: Zheng, Xiao
Pubblicazione: (2025)
di: Zheng, Xiao
Pubblicazione: (2025)
Computational Politeness in Natural Language Processing: A Survey
di: Priya, Priyanshu, et al.
Pubblicazione: (2024)
di: Priya, Priyanshu, et al.
Pubblicazione: (2024)
SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
di: Xiang, Yanzheng, et al.
Pubblicazione: (2025)
di: Xiang, Yanzheng, et al.
Pubblicazione: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
di: Mündler, Niels, et al.
Pubblicazione: (2023)
di: Mündler, Niels, et al.
Pubblicazione: (2023)
WRDScore: New Metric for Evaluation of Natural Language Generation Models
di: Mussabayev, Ravil
Pubblicazione: (2024)
di: Mussabayev, Ravil
Pubblicazione: (2024)
Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question Answering
di: Hu, Zhanghao, et al.
Pubblicazione: (2025)
di: Hu, Zhanghao, et al.
Pubblicazione: (2025)
HICD: Hallucination-Inducing via Attention Dispersion for Contrastive Decoding to Mitigate Hallucinations in Large Language Models
di: Jiang, Xinyan, et al.
Pubblicazione: (2025)
di: Jiang, Xinyan, et al.
Pubblicazione: (2025)
Large, Small or Both: A Novel Data Augmentation Framework Based on Language Models for Debiasing Opinion Summarization
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
Meow: End-to-End Outline Writing for Automatic Academic Survey
di: Ma, Zhaoyu, et al.
Pubblicazione: (2025)
di: Ma, Zhaoyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evaluating LLMs' Assessment of Mixed-Context Hallucination Through the Lens of Summarization
di: Qi, Siya, et al.
Pubblicazione: (2025) -
Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain
di: Liu, Wei, et al.
Pubblicazione: (2026) -
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025) -
ExDDI: Explaining Drug-Drug Interaction Predictions with Natural Language
di: Sun, Zhaoyue, et al.
Pubblicazione: (2024) -
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
di: Zhang, Guo-Biao, et al.
Pubblicazione: (2026)