OnionEval: An Unified Evaluation of Fact-conflicting Hallucination for Small-Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Chongren, Li, Yuran, Wu, Di, Boulet, Benoit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement
di: Li, Yuran, et al.
Pubblicazione: (2026)
di: Li, Yuran, et al.
Pubblicazione: (2026)
Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments
di: Li, Yuran, et al.
Pubblicazione: (2025)
di: Li, Yuran, et al.
Pubblicazione: (2025)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
di: Zhu, Zhiying, et al.
Pubblicazione: (2024)
di: Zhu, Zhiying, et al.
Pubblicazione: (2024)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
di: Hao, Yijie, et al.
Pubblicazione: (2025)
di: Hao, Yijie, et al.
Pubblicazione: (2025)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
Detecting LLM Fact-conflicting Hallucinations Enhanced by Temporal-logic-based Reasoning
di: Li, Ningke, et al.
Pubblicazione: (2025)
di: Li, Ningke, et al.
Pubblicazione: (2025)
On Large Language Models' Hallucination with Regard to Known Facts
di: Jiang, Che, et al.
Pubblicazione: (2024)
di: Jiang, Che, et al.
Pubblicazione: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
di: Shen, Tianhao, et al.
Pubblicazione: (2023)
di: Shen, Tianhao, et al.
Pubblicazione: (2023)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
di: Rahman, Subhey Sadi, et al.
Pubblicazione: (2025)
di: Rahman, Subhey Sadi, et al.
Pubblicazione: (2025)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
di: Wu, Junjie, et al.
Pubblicazione: (2024)
di: Wu, Junjie, et al.
Pubblicazione: (2024)
Towards Unification of Hallucination Detection and Fact Verification for Large Language Models
di: Su, Weihang, et al.
Pubblicazione: (2025)
di: Su, Weihang, et al.
Pubblicazione: (2025)
Language Models Hallucinate, but May Excel at Fact Verification
di: Guan, Jian, et al.
Pubblicazione: (2023)
di: Guan, Jian, et al.
Pubblicazione: (2023)
OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
di: Yang, Haote, et al.
Pubblicazione: (2025)
di: Yang, Haote, et al.
Pubblicazione: (2025)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
di: Patel, Piyushkumar
Pubblicazione: (2025)
di: Patel, Piyushkumar
Pubblicazione: (2025)
Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hanzhi, et al.
Pubblicazione: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
Small Agent Can Also Rock! Empowering Small Language Models as Hallucination Detector
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2024)
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2024)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
Give Us the Facts: Enhancing Large Language Models with Knowledge Graphs for Fact-aware Language Modeling
di: Yang, Linyao, et al.
Pubblicazione: (2023)
di: Yang, Linyao, et al.
Pubblicazione: (2023)
Large Language Models are Skeptics: False Negative Problem of Input-conflicting Hallucination
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
di: Song, Jongyoon, et al.
Pubblicazione: (2024)
ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
di: Yu, Xiaodong, et al.
Pubblicazione: (2023)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
di: Jin, Haoan, et al.
Pubblicazione: (2025)
di: Jin, Haoan, et al.
Pubblicazione: (2025)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
di: Sun, Chongyan, et al.
Pubblicazione: (2024)
di: Sun, Chongyan, et al.
Pubblicazione: (2024)
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
di: Park, Dojun, et al.
Pubblicazione: (2024)
di: Park, Dojun, et al.
Pubblicazione: (2024)
Hallucination Detection and Evaluation of Large Language Model
di: Zhang, Chenggong, et al.
Pubblicazione: (2025)
di: Zhang, Chenggong, et al.
Pubblicazione: (2025)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
di: Ren, Huimin, et al.
Pubblicazione: (2025)
di: Ren, Huimin, et al.
Pubblicazione: (2025)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
From Hallucinations to Facts: Enhancing Language Models with Curated Knowledge Graphs
di: Joshi, Ratnesh Kumar, et al.
Pubblicazione: (2024)
di: Joshi, Ratnesh Kumar, et al.
Pubblicazione: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
DnA-Eval: Enhancing Large Language Model Evaluation through Decomposition and Aggregation
di: Li, Minzhi, et al.
Pubblicazione: (2024)
di: Li, Minzhi, et al.
Pubblicazione: (2024)
PsyEval: A Suite of Mental Health Related Tasks for Evaluating Large Language Models
di: Jin, Haoan, et al.
Pubblicazione: (2023)
di: Jin, Haoan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A Training-Free Regeneration Paradigm: Contrastive Reflection Memory Guided Self-Verification and Self-Improvement
di: Li, Yuran, et al.
Pubblicazione: (2026) -
Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments
di: Li, Yuran, et al.
Pubblicazione: (2025) -
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
di: Zhu, Zhiying, et al.
Pubblicazione: (2024) -
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
di: Hao, Yijie, et al.
Pubblicazione: (2025) -
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)