Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ramprasad, Sanjana, Wallace, Byron C. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
di: Ramprasad, Sanjana, et al.
Pubblicazione: (2024)
di: Ramprasad, Sanjana, et al.
Pubblicazione: (2024)
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
di: Krishna, Kundan, et al.
Pubblicazione: (2024)
di: Krishna, Kundan, et al.
Pubblicazione: (2024)
Less is More for Improving Automatic Evaluation of Factual Consistency
di: Wang, Tong, et al.
Pubblicazione: (2024)
di: Wang, Tong, et al.
Pubblicazione: (2024)
Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation
di: Gong, Ziwei, et al.
Pubblicazione: (2026)
di: Gong, Ziwei, et al.
Pubblicazione: (2026)
Generating Benchmarks for Factuality Evaluation of Language Models
di: Muhlgay, Dor, et al.
Pubblicazione: (2023)
di: Muhlgay, Dor, et al.
Pubblicazione: (2023)
Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
Permutation-Consensus Listwise Judging for Robust Factuality Evaluation
di: Huang, Tianyi, et al.
Pubblicazione: (2026)
di: Huang, Tianyi, et al.
Pubblicazione: (2026)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
di: Huang, Minghui
Pubblicazione: (2025)
di: Huang, Minghui
Pubblicazione: (2025)
AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
di: Aghaebrahimian, Ahmad
Pubblicazione: (2025)
di: Aghaebrahimian, Ahmad
Pubblicazione: (2025)
FIBER: A Multilingual Evaluation Resource for Factual Inference Bias
di: Munis, Evren Ayberk, et al.
Pubblicazione: (2025)
di: Munis, Evren Ayberk, et al.
Pubblicazione: (2025)
Stress Testing Factual Consistency Metrics for Long-Document Summarization
di: Mujahid, Zain Muhammad, et al.
Pubblicazione: (2025)
di: Mujahid, Zain Muhammad, et al.
Pubblicazione: (2025)
Analyzing LLM Behavior in Dialogue Summarization: Unveiling Circumstantial Hallucination Trends
di: Ramprasad, Sanjana, et al.
Pubblicazione: (2024)
di: Ramprasad, Sanjana, et al.
Pubblicazione: (2024)
EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts
di: Kruthof, Garvin
Pubblicazione: (2026)
di: Kruthof, Garvin
Pubblicazione: (2026)
Is Factuality Enhancement a Free Lunch For LLMs? Better Factuality Can Lead to Worse Context-Faithfulness
di: Bi, Baolong, et al.
Pubblicazione: (2024)
di: Bi, Baolong, et al.
Pubblicazione: (2024)
Factuality of Large Language Models: A Survey
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
di: Zhong, Yang, et al.
Pubblicazione: (2025)
di: Zhong, Yang, et al.
Pubblicazione: (2025)
Is Conformal Factuality for RAG-based LLMs Robust? Novel Metrics and Systematic Insights
di: Chen, Yi, et al.
Pubblicazione: (2026)
di: Chen, Yi, et al.
Pubblicazione: (2026)
On Early Detection of Hallucinations in Factual Question Answering
di: Snyder, Ben, et al.
Pubblicazione: (2023)
di: Snyder, Ben, et al.
Pubblicazione: (2023)
Language Models' Factuality Depends on the Language of Inquiry
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
From Confidence to Collapse in LLM Factual Robustness
di: Fastowski, Alina, et al.
Pubblicazione: (2025)
di: Fastowski, Alina, et al.
Pubblicazione: (2025)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
di: Xu, Yunqi, et al.
Pubblicazione: (2024)
di: Xu, Yunqi, et al.
Pubblicazione: (2024)
HGOT: Hierarchical Graph of Thoughts for Retrieval-Augmented In-Context Learning in Factuality Evaluation
di: Fang, Yihao, et al.
Pubblicazione: (2024)
di: Fang, Yihao, et al.
Pubblicazione: (2024)
Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents
di: Li, Yifei, et al.
Pubblicazione: (2026)
di: Li, Yifei, et al.
Pubblicazione: (2026)
Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes
di: Jiao, Rui, et al.
Pubblicazione: (2025)
di: Jiao, Rui, et al.
Pubblicazione: (2025)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
di: Lage, Lucas Fonseca, et al.
Pubblicazione: (2025)
di: Lage, Lucas Fonseca, et al.
Pubblicazione: (2025)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2023)
Evaluating Robustness of Generative Search Engine on Adversarial Factual Questions
di: Hu, Xuming, et al.
Pubblicazione: (2024)
di: Hu, Xuming, et al.
Pubblicazione: (2024)
Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall
di: Yuan, Jiaqing, et al.
Pubblicazione: (2024)
di: Yuan, Jiaqing, et al.
Pubblicazione: (2024)
Real-time Factuality Assessment from Adversarial Feedback
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
FLAME: Factuality-Aware Alignment for Large Language Models
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
di: Lin, Sheng-Chieh, et al.
Pubblicazione: (2024)
FAME: Towards Factual Multi-Task Model Editing
di: Zeng, Li, et al.
Pubblicazione: (2024)
di: Zeng, Li, et al.
Pubblicazione: (2024)
InFact: Informativeness Alignment for Improved LLM Factuality
di: Cohen, Roi, et al.
Pubblicazione: (2025)
di: Cohen, Roi, et al.
Pubblicazione: (2025)
Aligning Knowledge Graphs and Language Models for Factual Accuracy
di: Nishat, Nur A Zarin, et al.
Pubblicazione: (2025)
di: Nishat, Nur A Zarin, et al.
Pubblicazione: (2025)
PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise
di: Harary, Sapir, et al.
Pubblicazione: (2025)
di: Harary, Sapir, et al.
Pubblicazione: (2025)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
di: Tran, Hieu, et al.
Pubblicazione: (2024)
di: Tran, Hieu, et al.
Pubblicazione: (2024)
WildHallucinations: Evaluating Long-form Factuality in LLMs with Real-World Entity Queries
di: Zhao, Wenting, et al.
Pubblicazione: (2024)
di: Zhao, Wenting, et al.
Pubblicazione: (2024)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
di: Ning, Yucheng, et al.
Pubblicazione: (2025)
di: Ning, Yucheng, et al.
Pubblicazione: (2025)
Language Models with Conformal Factuality Guarantees
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
di: Mohri, Christopher, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
di: Ramprasad, Sanjana, et al.
Pubblicazione: (2024) -
GenAudit: Fixing Factual Errors in Language Model Outputs with Evidence
di: Krishna, Kundan, et al.
Pubblicazione: (2024) -
Less is More for Improving Automatic Evaluation of Factual Consistency
di: Wang, Tong, et al.
Pubblicazione: (2024) -
Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation
di: Gong, Ziwei, et al.
Pubblicazione: (2026) -
Generating Benchmarks for Factuality Evaluation of Language Models
di: Muhlgay, Dor, et al.
Pubblicazione: (2023)