Stress Testing Factual Consistency Metrics for Long-Document Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mujahid, Zain Muhammad, Wright, Dustin, Augenstein, Isabelle |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unstructured Evidence Attribution for Long Context Query Focused Summarization
par: Wright, Dustin, et autres
Publié: (2025)
par: Wright, Dustin, et autres
Publié: (2025)
Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Experts
par: Mujahid, Zain Muhammad, et autres
Publié: (2025)
par: Mujahid, Zain Muhammad, et autres
Publié: (2025)
Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement
par: Islam, Sekh Mainul, et autres
Publié: (2025)
par: Islam, Sekh Mainul, et autres
Publié: (2025)
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
par: Ramprasad, Sanjana, et autres
Publié: (2024)
par: Ramprasad, Sanjana, et autres
Publié: (2024)
Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models
par: Arakelyan, Erik, et autres
Publié: (2024)
par: Arakelyan, Erik, et autres
Publié: (2024)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
par: Li, Junliang, et autres
Publié: (2025)
par: Li, Junliang, et autres
Publié: (2025)
SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages
par: Ghazaryan, Gayane, et autres
Publié: (2024)
par: Ghazaryan, Gayane, et autres
Publié: (2024)
Factuality Challenges in the Era of Large Language Models
par: Augenstein, Isabelle, et autres
Publié: (2023)
par: Augenstein, Isabelle, et autres
Publié: (2023)
Entity-level Factual Adaptiveness of Fine-tuning based Abstractive Summarization Models
par: Song, Jongyoon, et autres
Publié: (2024)
par: Song, Jongyoon, et autres
Publié: (2024)
Incorporating Distributions of Discourse Structure for Long Document Abstractive Summarization
par: Liu, Dongqi, et autres
Publié: (2023)
par: Liu, Dongqi, et autres
Publié: (2023)
Less is More for Improving Automatic Evaluation of Factual Consistency
par: Wang, Tong, et autres
Publié: (2024)
par: Wang, Tong, et autres
Publié: (2024)
Epistemic Diversity and Knowledge Collapse in Large Language Models
par: Wright, Dustin, et autres
Publié: (2025)
par: Wright, Dustin, et autres
Publié: (2025)
Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization
par: Sun, Jingyi, et autres
Publié: (2026)
par: Sun, Jingyi, et autres
Publié: (2026)
Modeling Public Perceptions of Science in Media
par: Pei, Jiaxin, et autres
Publié: (2025)
par: Pei, Jiaxin, et autres
Publié: (2025)
LongDocFACTScore: Evaluating the Factuality of Long Document Abstractive Summarisation
par: Bishop, Jennifer A, et autres
Publié: (2023)
par: Bishop, Jennifer A, et autres
Publié: (2023)
Is Conformal Factuality for RAG-based LLMs Robust? Novel Metrics and Systematic Insights
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
How Does Response Length Affect Long-Form Factuality
par: Zhao, James Xu, et autres
Publié: (2025)
par: Zhao, James Xu, et autres
Publié: (2025)
RST-LoRA: A Discourse-Aware Low-Rank Adaptation for Long Document Abstractive Summarization
par: Liu, Dongqi, et autres
Publié: (2024)
par: Liu, Dongqi, et autres
Publié: (2024)
FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
par: Nie, Fan, et autres
Publié: (2024)
par: Nie, Fan, et autres
Publié: (2024)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation
par: Islam, Sekh Mainul, et autres
Publié: (2025)
par: Islam, Sekh Mainul, et autres
Publié: (2025)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
par: Xu, Xiaoyue, et autres
Publié: (2024)
par: Xu, Xiaoyue, et autres
Publié: (2024)
FLARE: Faithful Logic-Aided Reasoning and Exploration
par: Arakelyan, Erik, et autres
Publié: (2024)
par: Arakelyan, Erik, et autres
Publié: (2024)
Cross-Lingual Consistency of Factual Knowledge in Multilingual Language Models
par: Qi, Jirui, et autres
Publié: (2023)
par: Qi, Jirui, et autres
Publié: (2023)
MGM: Global Understanding of Audience Overlap Graphs for Predicting the Factuality and the Bias of News Media
par: Manzoor, Muhammad Arslan, et autres
Publié: (2024)
par: Manzoor, Muhammad Arslan, et autres
Publié: (2024)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
par: Feng, Huawen, et autres
Publié: (2023)
par: Feng, Huawen, et autres
Publié: (2023)
Characterizing Multimodal Long-form Summarization: A Case Study on Financial Reports
par: Cao, Tianyu, et autres
Publié: (2024)
par: Cao, Tianyu, et autres
Publié: (2024)
Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with Graphs
par: Zhang, Haozhen, et autres
Publié: (2024)
par: Zhang, Haozhen, et autres
Publié: (2024)
Aggregating Soft Labels from Crowd Annotations Improves Uncertainty Estimation Under Distribution Shift
par: Wright, Dustin, et autres
Publié: (2022)
par: Wright, Dustin, et autres
Publié: (2022)
Language Models with Conformal Factuality Guarantees
par: Mohri, Christopher, et autres
Publié: (2024)
par: Mohri, Christopher, et autres
Publié: (2024)
Revealing Fine-Grained Values and Opinions in Large Language Models
par: Wright, Dustin, et autres
Publié: (2024)
par: Wright, Dustin, et autres
Publié: (2024)
Knowledge-based Consistency Testing of Large Language Models
par: Rajan, Sai Sathiesh, et autres
Publié: (2024)
par: Rajan, Sai Sathiesh, et autres
Publié: (2024)
Event-Keyed Summarization
par: Gantt, William, et autres
Publié: (2024)
par: Gantt, William, et autres
Publié: (2024)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
par: Yang, Junxiao, et autres
Publié: (2025)
par: Yang, Junxiao, et autres
Publié: (2025)
Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization
par: Lu, Yen-Ju, et autres
Publié: (2025)
par: Lu, Yen-Ju, et autres
Publié: (2025)
Graph-based Uncertainty Metrics for Long-form Language Model Outputs
par: Jiang, Mingjian, et autres
Publié: (2024)
par: Jiang, Mingjian, et autres
Publié: (2024)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall
par: Yuan, Jiaqing, et autres
Publié: (2024)
par: Yuan, Jiaqing, et autres
Publié: (2024)
Integrative Decoding: Improve Factuality via Implicit Self-consistency
par: Cheng, Yi, et autres
Publié: (2024)
par: Cheng, Yi, et autres
Publié: (2024)
Improving Summarization with Human Edits
par: Yao, Zonghai, et autres
Publié: (2023)
par: Yao, Zonghai, et autres
Publié: (2023)
Documents similaires
-
Unstructured Evidence Attribution for Long Context Query Focused Summarization
par: Wright, Dustin, et autres
Publié: (2025) -
Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Experts
par: Mujahid, Zain Muhammad, et autres
Publié: (2025) -
Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement
par: Islam, Sekh Mainul, et autres
Publié: (2025) -
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
par: Ramprasad, Sanjana, et autres
Publié: (2024) -
Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models
par: Arakelyan, Erik, et autres
Publié: (2024)