C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xu, Liu, Zhifei, Wang, Jiahao, Zhang, Huixuan, Xu, Fan, Zhang, Junzhe, Wan, Xiaojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
par: Zhang, Zhenliang, et autres
Publié: (2025)
par: Zhang, Zhenliang, et autres
Publié: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025)
par: Jia, Boyu, et autres
Publié: (2025)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
par: Zhang, Huixuan, et autres
Publié: (2023)
par: Zhang, Huixuan, et autres
Publié: (2023)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query Generation
par: Xu, Fan, et autres
Publié: (2025)
par: Xu, Fan, et autres
Publié: (2025)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
FAITH: A Framework for Assessing Intrinsic Tabular Hallucinations in Finance
par: Zhang, Mengao, et autres
Publié: (2025)
par: Zhang, Mengao, et autres
Publié: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark
par: Zhang, Junzhao, et autres
Publié: (2026)
par: Zhang, Junzhao, et autres
Publié: (2026)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
par: Liu, Zhiqiang, et autres
Publié: (2025)
par: Liu, Zhiqiang, et autres
Publié: (2025)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
par: Li, Youquan, et autres
Publié: (2024)
par: Li, Youquan, et autres
Publié: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
par: Li, Zhong-Zhi, et autres
Publié: (2024)
par: Li, Zhong-Zhi, et autres
Publié: (2024)
Chinese Spelling Correction: A Comprehensive Survey of Progress, Challenges, and Opportunities
par: Liu, Changchun, et autres
Publié: (2025)
par: Liu, Changchun, et autres
Publié: (2025)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
par: Zhao, Jiahao, et autres
Publié: (2025)
par: Zhao, Jiahao, et autres
Publié: (2025)
Cross-Layer Attention Probing for Fine-Grained Hallucination Detection
par: Suresh, Malavika, et autres
Publié: (2025)
par: Suresh, Malavika, et autres
Publié: (2025)
MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks
par: Niu, Yadong, et autres
Publié: (2025)
par: Niu, Yadong, et autres
Publié: (2025)
CMB: A Comprehensive Medical Benchmark in Chinese
par: Wang, Xidong, et autres
Publié: (2023)
par: Wang, Xidong, et autres
Publié: (2023)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
FactLens: Benchmarking Fine-Grained Fact Verification
par: Mitra, Kushan, et autres
Publié: (2024)
par: Mitra, Kushan, et autres
Publié: (2024)
HACo-Det: A Study Towards Fine-Grained Machine-Generated Text Detection under Human-AI Coauthoring
par: Su, Zhixiong, et autres
Publié: (2025)
par: Su, Zhixiong, et autres
Publié: (2025)
Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models
par: Ju, Li, et autres
Publié: (2026)
par: Ju, Li, et autres
Publié: (2026)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2024)
par: Zhou, Ziyi, et autres
Publié: (2024)
FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs
par: Bao, Forrest Sheng, et autres
Publié: (2024)
par: Bao, Forrest Sheng, et autres
Publié: (2024)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
par: Ni, Shiwen, et autres
Publié: (2024)
par: Ni, Shiwen, et autres
Publié: (2024)
Small Updates, Big Doubts: Does Parameter-Efficient Fine-tuning Enhance Hallucination Detection ?
par: Hu, Xu, et autres
Publié: (2026)
par: Hu, Xu, et autres
Publié: (2026)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
par: Bai, Ge, et autres
Publié: (2024)
par: Bai, Ge, et autres
Publié: (2024)
Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language Models
par: Lv, Qitan, et autres
Publié: (2024)
par: Lv, Qitan, et autres
Publié: (2024)
HalluLens: LLM Hallucination Benchmark
par: Bang, Yejin, et autres
Publié: (2025)
par: Bang, Yejin, et autres
Publié: (2025)
Documents similaires
-
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
par: Zhang, Zhenliang, et autres
Publié: (2025) -
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025) -
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025) -
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025) -
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)