FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain
Fuente:
arXiv
Saved in:
| Main Authors: | Afzal, Anum, Vladika, Juraj, Matthes, Florian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Comparing Knowledge Sources for Open-Domain Scientific Claim Verification
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
On the Influence of Context Size and Model Choice in Retrieval-Augmented Generation Systems
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
Can Smaller LLMs do better? Unlocking Cross-Domain Potential through Parameter-Efficient Fine-Tuning for Text Summarization
by: Afzal, Anum, et al.
Published: (2025)
by: Afzal, Anum, et al.
Published: (2025)
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
JaccDiv: A Metric and Benchmark for Quantifying Diversity of Generated Marketing Text in the Music Industry
by: Afzal, Anum, et al.
Published: (2025)
by: Afzal, Anum, et al.
Published: (2025)
Enhancing Answer Attribution for Faithful Text Generation with Large Language Models
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
Improving Health Question Answering with Reliable and Time-Aware Evidence Retrieval
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
Correcting Hallucinations in News Summaries: Exploration of Self-Correcting LLM Methods with External Knowledge
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
Step-by-Step Fact Verification System for Medical Claims with Explainable Reasoning
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
HealthFC: Verifying Health Claims with Evidence-Based Medical Fact-Checking
by: Vladika, Juraj, et al.
Published: (2023)
by: Vladika, Juraj, et al.
Published: (2023)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
by: Afzal, Anum, et al.
Published: (2024)
by: Afzal, Anum, et al.
Published: (2024)
Lexical Substitution is not Synonym Substitution: On the Importance of Producing Contextually Relevant Word Substitutes
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
DP-MLM: Differentially Private Text Rewriting Using Masked Language Models
by: Meisenbacher, Stephen, et al.
Published: (2024)
by: Meisenbacher, Stephen, et al.
Published: (2024)
Towards A Structured Overview of Use Cases for Natural Language Processing in the Legal Domain: A German Perspective
by: Vladika, Juraj, et al.
Published: (2024)
by: Vladika, Juraj, et al.
Published: (2024)
Enterprise Use Cases Combining Knowledge Graphs and Natural Language Processing
by: Schneider, Phillip, et al.
Published: (2024)
by: Schneider, Phillip, et al.
Published: (2024)
Knowing Before Saying: LLM Representations Encode Information About Chain-of-Thought Success Before Completion
by: Afzal, Anum, et al.
Published: (2025)
by: Afzal, Anum, et al.
Published: (2025)
Towards Optimizing a Retrieval Augmented Generation using Large Language Model on Academic Data
by: Afzal, Anum, et al.
Published: (2024)
by: Afzal, Anum, et al.
Published: (2024)
Towards Optimizing and Evaluating a Retrieval Augmented QA Chatbot using LLMs with Human in the Loop
by: Afzal, Anum, et al.
Published: (2024)
by: Afzal, Anum, et al.
Published: (2024)
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
by: Wang, Yuxia, et al.
Published: (2023)
by: Wang, Yuxia, et al.
Published: (2023)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
by: Lage, Lucas Fonseca, et al.
Published: (2025)
by: Lage, Lucas Fonseca, et al.
Published: (2025)
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
Adapter-based Approaches to Knowledge-enhanced Language Models -- A Survey
by: Fichtl, Alexander, et al.
Published: (2024)
by: Fichtl, Alexander, et al.
Published: (2024)
Can LLM-Generated Textual Explanations Enhance Model Classification Performance? An Empirical Study
by: Dhaini, Mahdi, et al.
Published: (2025)
by: Dhaini, Mahdi, et al.
Published: (2025)
Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches
by: Afzal, Anum, et al.
Published: (2026)
by: Afzal, Anum, et al.
Published: (2026)
An Analysis of Multilingual FActScore
by: Vu, Kim Trong, et al.
Published: (2024)
by: Vu, Kim Trong, et al.
Published: (2024)
DocLens: Multi-aspect Fine-grained Evaluation for Medical Text Generation
by: Xie, Yiqing, et al.
Published: (2023)
by: Xie, Yiqing, et al.
Published: (2023)
LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data
by: Meisenbacher, Stephen, et al.
Published: (2025)
by: Meisenbacher, Stephen, et al.
Published: (2025)
Thinking Outside of the Differential Privacy Box: A Case Study in Text Privatization with Language Model Prompting
by: Meisenbacher, Stephen, et al.
Published: (2024)
by: Meisenbacher, Stephen, et al.
Published: (2024)
LCTG Bench: LLM Controlled Text Generation Benchmark
by: Kurihara, Kentaro, et al.
Published: (2025)
by: Kurihara, Kentaro, et al.
Published: (2025)
With Privacy, Size Matters: On the Importance of Dataset Size in Differentially Private Text Rewriting
by: Meisenbacher, Stephen, et al.
Published: (2025)
by: Meisenbacher, Stephen, et al.
Published: (2025)
A Systematic Exploration of Text Decomposition and Budget Distribution in Differentially Private Text Obfuscation
by: Meisenbacher, Stephen, et al.
Published: (2026)
by: Meisenbacher, Stephen, et al.
Published: (2026)
Just Rewrite It Again: A Post-Processing Method for Enhanced Semantic Similarity and Privacy Preservation of Differentially Private Rewritten Text
by: Meisenbacher, Stephen, et al.
Published: (2024)
by: Meisenbacher, Stephen, et al.
Published: (2024)
M4GT-Bench: Evaluation Benchmark for Black-Box Machine-Generated Text Detection
by: Wang, Yuxia, et al.
Published: (2024)
by: Wang, Yuxia, et al.
Published: (2024)
The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
A Comparative Analysis of Conversational Large Language Models in Knowledge-Based Text Generation
by: Schneider, Phillip, et al.
Published: (2024)
by: Schneider, Phillip, et al.
Published: (2024)
Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation
by: Li, Yihang, et al.
Published: (2026)
by: Li, Yihang, et al.
Published: (2026)
On the Impact of Noise in Differentially Private Text Rewriting
by: Meisenbacher, Stephen, et al.
Published: (2025)
by: Meisenbacher, Stephen, et al.
Published: (2025)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
by: Chen, Yelin, et al.
Published: (2026)
by: Chen, Yelin, et al.
Published: (2026)
Similar Items
-
Comparing Knowledge Sources for Open-Domain Scientific Claim Verification
by: Vladika, Juraj, et al.
Published: (2024) -
MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature
by: Vladika, Juraj, et al.
Published: (2025) -
On the Influence of Context Size and Model Choice in Retrieval-Augmented Generation Systems
by: Vladika, Juraj, et al.
Published: (2025) -
Can Smaller LLMs do better? Unlocking Cross-Domain Potential through Parameter-Efficient Fine-Tuning for Text Summarization
by: Afzal, Anum, et al.
Published: (2025) -
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
by: Vladika, Juraj, et al.
Published: (2025)