DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Kedi, Chen, Qin, Zhou, Jie, He, Yishen, He, Liang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024)
por: Agarwal, Vibhor, et al.
Publicado: (2024)
Enhancing Uncertainty Modeling with Semantic Graph for Hallucination Detection
por: Chen, Kedi, et al.
Publicado: (2025)
por: Chen, Kedi, et al.
Publicado: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026)
por: Yin, Jianghao, et al.
Publicado: (2026)
A Regularization-based Transfer Learning Method for Information Extraction via Instructed Graph Decoder
por: Chen, Kedi, et al.
Publicado: (2024)
por: Chen, Kedi, et al.
Publicado: (2024)
Halu-J: Critique-Based Hallucination Judge
por: Wang, Binjie, et al.
Publicado: (2024)
por: Wang, Binjie, et al.
Publicado: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
por: Bai, Ge, et al.
Publicado: (2024)
por: Bai, Ge, et al.
Publicado: (2024)
Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA
por: Lamba, Naveen, et al.
Publicado: (2025)
por: Lamba, Naveen, et al.
Publicado: (2025)
Code-driven Number Sequence Calculation: Enhancing the inductive Reasoning Abilities of Large Language Models
por: Chen, Kedi, et al.
Publicado: (2025)
por: Chen, Kedi, et al.
Publicado: (2025)
A Survey of Inductive Reasoning for Large Language Models
por: Chen, Kedi, et al.
Publicado: (2025)
por: Chen, Kedi, et al.
Publicado: (2025)
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
por: Lamba, Naveen, et al.
Publicado: (2025)
por: Lamba, Naveen, et al.
Publicado: (2025)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
por: Zhang, Xiaotian, et al.
Publicado: (2023)
por: Zhang, Xiaotian, et al.
Publicado: (2023)
LLM-KT: Aligning Large Language Models with Knowledge Tracing using a Plug-and-Play Instruction
por: Wang, Ziwei, et al.
Publicado: (2025)
por: Wang, Ziwei, et al.
Publicado: (2025)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
por: Zhang, Yuxiang, et al.
Publicado: (2024)
por: Zhang, Yuxiang, et al.
Publicado: (2024)
KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
por: Mündler, Niels, et al.
Publicado: (2023)
por: Mündler, Niels, et al.
Publicado: (2023)
Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language Models
por: Lv, Qitan, et al.
Publicado: (2024)
por: Lv, Qitan, et al.
Publicado: (2024)
A Survey of Automatic Hallucination Evaluation on Natural Language Generation
por: Qi, Siya, et al.
Publicado: (2024)
por: Qi, Siya, et al.
Publicado: (2024)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
por: Liu, Yinhong, et al.
Publicado: (2025)
por: Liu, Yinhong, et al.
Publicado: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
por: Zhou, Chengfeng, et al.
Publicado: (2025)
por: Zhou, Chengfeng, et al.
Publicado: (2025)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
por: Kazi, Taaha, et al.
Publicado: (2024)
por: Kazi, Taaha, et al.
Publicado: (2024)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026)
por: Chen, Kesheng, et al.
Publicado: (2026)
Neural Probe-Based Hallucination Detection for Large Language Models
por: Liang, Shize, et al.
Publicado: (2025)
por: Liang, Shize, et al.
Publicado: (2025)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
por: Hao, Yijie, et al.
Publicado: (2025)
por: Hao, Yijie, et al.
Publicado: (2025)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
por: Zhu, Zhiying, et al.
Publicado: (2024)
por: Zhu, Zhiying, et al.
Publicado: (2024)
EMRModel: A Large Language Model for Extracting Medical Consultation Dialogues into Structured Medical Records
por: Zhao, Shuguang, et al.
Publicado: (2025)
por: Zhao, Shuguang, et al.
Publicado: (2025)
ANAH: Analytical Annotation of Hallucinations in Large Language Models
por: Ji, Ziwei, et al.
Publicado: (2024)
por: Ji, Ziwei, et al.
Publicado: (2024)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
por: Pandit, Shrey, et al.
Publicado: (2025)
por: Pandit, Shrey, et al.
Publicado: (2025)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
por: Xu, Hainiu, et al.
Publicado: (2024)
por: Xu, Hainiu, et al.
Publicado: (2024)
Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning
por: Wang, Shengyuan, et al.
Publicado: (2025)
por: Wang, Shengyuan, et al.
Publicado: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
por: Zhu, Jie, et al.
Publicado: (2024)
por: Zhu, Jie, et al.
Publicado: (2024)
Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models
por: Huang, Cheng Peng, et al.
Publicado: (2025)
por: Huang, Cheng Peng, et al.
Publicado: (2025)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
por: Yang, Ge, et al.
Publicado: (2024)
por: Yang, Ge, et al.
Publicado: (2024)
Attention-guided Self-reflection for Zero-shot Hallucination Detection in Large Language Models
por: Liu, Qiang, et al.
Publicado: (2025)
por: Liu, Qiang, et al.
Publicado: (2025)
A Survey of the Evolution of Language Model-Based Dialogue Systems: Data, Task and Models
por: Wang, Hongru, et al.
Publicado: (2023)
por: Wang, Hongru, et al.
Publicado: (2023)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models
por: Feng, Yujie, et al.
Publicado: (2026)
por: Feng, Yujie, et al.
Publicado: (2026)
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
por: Nguyen, Vy, et al.
Publicado: (2025)
por: Nguyen, Vy, et al.
Publicado: (2025)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
por: He, Kaiyu, et al.
Publicado: (2025)
por: He, Kaiyu, et al.
Publicado: (2025)
Ejemplares similares
-
MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024) -
Enhancing Uncertainty Modeling with Semantic Graph for Hallucination Detection
por: Chen, Kedi, et al.
Publicado: (2025) -
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026) -
A Regularization-based Transfer Learning Method for Information Extraction via Instructed Graph Decoder
por: Chen, Kedi, et al.
Publicado: (2024) -
Halu-J: Critique-Based Hallucination Judge
por: Wang, Binjie, et al.
Publicado: (2024)