ERBench: An Entity-Relationship based Automatically Verifiable Hallucination Benchmark for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Oh, Jio, Kim, Soyeon, Seo, Junseok, Wang, Jindong, Xu, Ruochen, Xie, Xing, Whang, Steven Euijong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Classroom AI: Large Language Models as Grade-Specific Teachers
by: Oh, Jio, et al.
Published: (2026)
by: Oh, Jio, et al.
Published: (2026)
Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models
by: Kim, Soyeon, et al.
Published: (2025)
by: Kim, Soyeon, et al.
Published: (2025)
DeFrame: Debiasing Large Language Models Against Framing Effects
by: Lim, Kahee, et al.
Published: (2026)
by: Lim, Kahee, et al.
Published: (2026)
DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English
by: Oh, Jio, et al.
Published: (2026)
by: Oh, Jio, et al.
Published: (2026)
Talking with Tables for Better LLM Factual Data Interactions
by: Oh, Jio, et al.
Published: (2024)
by: Oh, Jio, et al.
Published: (2024)
PFGuard: A Generative Framework with Privacy and Fairness Safeguards
by: Kim, Soyeon, et al.
Published: (2024)
by: Kim, Soyeon, et al.
Published: (2024)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
by: Zhu, Kaijie, et al.
Published: (2024)
by: Zhu, Kaijie, et al.
Published: (2024)
GradMix: Gradient-based Selective Mixup for Robust Data Augmentation in Class-Incremental Learning
by: Kim, Minsu, et al.
Published: (2025)
by: Kim, Minsu, et al.
Published: (2025)
Fair Class-Incremental Learning using Sample Weighting
by: Park, Jaeyoung, et al.
Published: (2024)
by: Park, Jaeyoung, et al.
Published: (2024)
HalluEntity: Benchmarking and Understanding Entity-Level Hallucination Detection
by: Yeh, Min-Hsuan, et al.
Published: (2025)
by: Yeh, Min-Hsuan, et al.
Published: (2025)
Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models
by: Moon, Hyeonseok, et al.
Published: (2025)
by: Moon, Hyeonseok, et al.
Published: (2025)
Mitigating Entity-Level Hallucination in Large Language Models
by: Su, Weihang, et al.
Published: (2024)
by: Su, Weihang, et al.
Published: (2024)
T-CIL: Temperature Scaling using Adversarial Perturbation for Calibration in Class-Incremental Learning
by: Hwang, Seong-Hyeon, et al.
Published: (2025)
by: Hwang, Seong-Hyeon, et al.
Published: (2025)
RC-Mixup: A Data Augmentation Strategy against Noisy Data for Regression Tasks
by: Hwang, Seong-Hyeon, et al.
Published: (2024)
by: Hwang, Seong-Hyeon, et al.
Published: (2024)
MIDAS: Misalignment-based Data Augmentation Strategy for Imbalanced Multimodal Learning
by: Hwang, Seong-Hyeon, et al.
Published: (2025)
by: Hwang, Seong-Hyeon, et al.
Published: (2025)
Supervised Knowledge Makes Large Language Models Better In-context Learners
by: Yang, Linyi, et al.
Published: (2023)
by: Yang, Linyi, et al.
Published: (2023)
Language Models Identify Ambiguities and Exploit Loopholes
by: Choi, Jio, et al.
Published: (2025)
by: Choi, Jio, et al.
Published: (2025)
Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models
by: Xie, Zikai
Published: (2024)
by: Xie, Zikai
Published: (2024)
The Impact of Negated Text on Hallucination with Large Language Models
by: Seo, Jaehyung, et al.
Published: (2025)
by: Seo, Jaehyung, et al.
Published: (2025)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
by: Yan, Yuchen, et al.
Published: (2025)
by: Yan, Yuchen, et al.
Published: (2025)
Topics as Entity Clusters: Entity-based Topics from Large Language Models and Graph Neural Networks
by: Loureiro, Manuel V., et al.
Published: (2023)
by: Loureiro, Manuel V., et al.
Published: (2023)
VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language Models
by: Kim, Seoyeon, et al.
Published: (2024)
by: Kim, Seoyeon, et al.
Published: (2024)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
by: Luo, Wen, et al.
Published: (2024)
by: Luo, Wen, et al.
Published: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
by: Sun, Yuhong, et al.
Published: (2024)
by: Sun, Yuhong, et al.
Published: (2024)
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
by: Hu, Xiangkun, et al.
Published: (2024)
by: Hu, Xiangkun, et al.
Published: (2024)
CultureLLM: Incorporating Cultural Differences into Large Language Models
by: Li, Cheng, et al.
Published: (2024)
by: Li, Cheng, et al.
Published: (2024)
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
by: Wu, Xiyang, et al.
Published: (2024)
by: Wu, Xiyang, et al.
Published: (2024)
Can I understand what I create? Self-Knowledge Evaluation of Large Language Models
by: Tan, Zhiquan, et al.
Published: (2024)
by: Tan, Zhiquan, et al.
Published: (2024)
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
by: Wang, Yidong, et al.
Published: (2023)
by: Wang, Yidong, et al.
Published: (2023)
PromptBench: A Unified Library for Evaluation of Large Language Models
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
by: Chang, Shenxu, et al.
Published: (2025)
by: Chang, Shenxu, et al.
Published: (2025)
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
by: Oh, Juhyun, et al.
Published: (2025)
by: Oh, Juhyun, et al.
Published: (2025)
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
by: Zhao, Qinlin, et al.
Published: (2023)
by: Zhao, Qinlin, et al.
Published: (2023)
HalluScore: Large Language Model Hallucination Question Answering Benchmark
by: Alansari, Aisha, et al.
Published: (2026)
by: Alansari, Aisha, et al.
Published: (2026)
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
by: Lee, Junseok, et al.
Published: (2026)
by: Lee, Junseok, et al.
Published: (2026)
CulturePark: Boosting Cross-cultural Understanding in Large Language Models
by: Li, Cheng, et al.
Published: (2024)
by: Li, Cheng, et al.
Published: (2024)
Korean Bio-Medical Corpus (KBMC) for Medical Named Entity Recognition
by: Byun, Sungjoo, et al.
Published: (2024)
by: Byun, Sungjoo, et al.
Published: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
by: Wang, Xinran, et al.
Published: (2026)
by: Wang, Xinran, et al.
Published: (2026)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
by: Gao, Kuofeng, et al.
Published: (2024)
by: Gao, Kuofeng, et al.
Published: (2024)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
by: Kim, Kyuyoung, et al.
Published: (2026)
by: Kim, Kyuyoung, et al.
Published: (2026)
Similar Items
-
Classroom AI: Large Language Models as Grade-Specific Teachers
by: Oh, Jio, et al.
Published: (2026) -
Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models
by: Kim, Soyeon, et al.
Published: (2025) -
DeFrame: Debiasing Large Language Models Against Framing Effects
by: Lim, Kahee, et al.
Published: (2026) -
DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English
by: Oh, Jio, et al.
Published: (2026) -
Talking with Tables for Better LLM Factual Data Interactions
by: Oh, Jio, et al.
Published: (2024)