OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuxia, Wang, Minghan, Iqbal, Hasan, Georgiev, Georgi, Geng, Jiahui, Nakov, Preslav |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
por: Iqbal, Hasan, et al.
Publicado: (2024)
por: Iqbal, Hasan, et al.
Publicado: (2024)
UrduFactCheck: An Agentic Fact-Checking Framework for Urdu with Evidence Boosting and Benchmarking
por: Ahmad, Sarfraz, et al.
Publicado: (2025)
por: Ahmad, Sarfraz, et al.
Publicado: (2025)
The CLEF-2025 CheckThat! Lab: Subjectivity, Fact-Checking, Claim Normalization, and Retrieval
por: Alam, Firoj, et al.
Publicado: (2025)
por: Alam, Firoj, et al.
Publicado: (2025)
Retrieve-Refine-Calibrate: A Framework for Complex Claim Fact-Checking
por: Sun, Mingwei, et al.
Publicado: (2026)
por: Sun, Mingwei, et al.
Publicado: (2026)
A Knowledge Enhanced Learning and Semantic Composition Model for Multi-Claim Fact Checking
por: Wang, Shuai, et al.
Publicado: (2021)
por: Wang, Shuai, et al.
Publicado: (2021)
Integrating Causal Reasoning into Automated Fact-Checking
por: Rebboud, Youssra, et al.
Publicado: (2025)
por: Rebboud, Youssra, et al.
Publicado: (2025)
Detecting Check-Worthy Claims in Political Debates, Speeches, and Interviews Using Audio Data
por: Ivanov, Petar, et al.
Publicado: (2023)
por: Ivanov, Petar, et al.
Publicado: (2023)
"The Data Says Otherwise"-Towards Automated Fact-checking and Communication of Data Claims
por: Fu, Yu, et al.
Publicado: (2024)
por: Fu, Yu, et al.
Publicado: (2024)
Atomic Inference for NLI with Generated Facts as Atoms
por: Stacey, Joe, et al.
Publicado: (2023)
por: Stacey, Joe, et al.
Publicado: (2023)
ReFactX: Scalable Reasoning with Reliable Facts via Constrained Generation
por: Pozzi, Riccardo, et al.
Publicado: (2025)
por: Pozzi, Riccardo, et al.
Publicado: (2025)
Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification
por: Kolli, Shaghayegh, et al.
Publicado: (2025)
por: Kolli, Shaghayegh, et al.
Publicado: (2025)
Whose Facts Win? LLM Source Preferences under Knowledge Conflicts
por: Schuster, Jakob, et al.
Publicado: (2026)
por: Schuster, Jakob, et al.
Publicado: (2026)
Pipeline and Dataset Generation for Automated Fact-checking in Almost Any Language
por: Drchal, Jan, et al.
Publicado: (2023)
por: Drchal, Jan, et al.
Publicado: (2023)
From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge
por: Chowdhury, Nafis, et al.
Publicado: (2025)
por: Chowdhury, Nafis, et al.
Publicado: (2025)
From Chaos to Clarity: Claim Normalization to Empower Fact-Checking
por: Sundriyal, Megha, et al.
Publicado: (2023)
por: Sundriyal, Megha, et al.
Publicado: (2023)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2026)
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2026)
Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation
por: Dejl, Adam, et al.
Publicado: (2025)
por: Dejl, Adam, et al.
Publicado: (2025)
GenAI Content Detection Task 3: Cross-Domain Machine-Generated Text Detection Challenge
por: Dugan, Liam, et al.
Publicado: (2025)
por: Dugan, Liam, et al.
Publicado: (2025)
Multimodal Large Language Models to Support Real-World Fact-Checking
por: Geng, Jiahui, et al.
Publicado: (2024)
por: Geng, Jiahui, et al.
Publicado: (2024)
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
por: The Omnilingual MT Team, et al.
Publicado: (2025)
por: The Omnilingual MT Team, et al.
Publicado: (2025)
LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters
por: van der Meer, Virgill, et al.
Publicado: (2026)
por: van der Meer, Virgill, et al.
Publicado: (2026)
Mr. Snuffleupagus at SemEval-2025 Task 4: Unlearning Factual Knowledge from LLMs Using Adaptive RMU
por: Dosajh, Arjun, et al.
Publicado: (2025)
por: Dosajh, Arjun, et al.
Publicado: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
por: Saji, Alan, et al.
Publicado: (2025)
por: Saji, Alan, et al.
Publicado: (2025)
HalalBench: A Multilingual OCR Benchmark for Food Packaging Ingredient Extraction
por: Arief, Hasan
Publicado: (2026)
por: Arief, Hasan
Publicado: (2026)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
por: Karinshak, Elise, et al.
Publicado: (2024)
por: Karinshak, Elise, et al.
Publicado: (2024)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
por: Jiang, Yilin, et al.
Publicado: (2025)
por: Jiang, Yilin, et al.
Publicado: (2025)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
por: Simhi, Adi, et al.
Publicado: (2024)
por: Simhi, Adi, et al.
Publicado: (2024)
How Do Large Language Models Acquire Factual Knowledge During Pretraining?
por: Chang, Hoyeon, et al.
Publicado: (2024)
por: Chang, Hoyeon, et al.
Publicado: (2024)
MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs
por: Bouchekif, Abdessalam, et al.
Publicado: (2026)
por: Bouchekif, Abdessalam, et al.
Publicado: (2026)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
por: Palit, Sayon, et al.
Publicado: (2025)
por: Palit, Sayon, et al.
Publicado: (2025)
Evaluating Relational Reasoning in LLMs with REL
por: Fesser, Lukas, et al.
Publicado: (2026)
por: Fesser, Lukas, et al.
Publicado: (2026)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
por: Li, Bowen, et al.
Publicado: (2026)
por: Li, Bowen, et al.
Publicado: (2026)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
por: Muller, Sacha, et al.
Publicado: (2024)
por: Muller, Sacha, et al.
Publicado: (2024)
NeuralNexus at BEA 2025 Shared Task: Retrieval-Augmented Prompting for Mistake Identification in AI Tutors
por: Naeem, Numaan, et al.
Publicado: (2025)
por: Naeem, Numaan, et al.
Publicado: (2025)
Comparing Complex Concepts with Transformers: Matching Patent Claims Against Natural Language Text
por: Blume, Matthias, et al.
Publicado: (2024)
por: Blume, Matthias, et al.
Publicado: (2024)
LLM Uncertainty Quantification through Directional Entailment Graph and Claim Level Response Augmentation
por: Da, Longchao, et al.
Publicado: (2024)
por: Da, Longchao, et al.
Publicado: (2024)
Pareto-Optimized Open-Source LLMs for Healthcare via Context Retrieval
por: Bayarri-Planas, Jordi, et al.
Publicado: (2024)
por: Bayarri-Planas, Jordi, et al.
Publicado: (2024)
Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Experts
por: Mujahid, Zain Muhammad, et al.
Publicado: (2025)
por: Mujahid, Zain Muhammad, et al.
Publicado: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
por: Ashuach, Tomer, et al.
Publicado: (2025)
por: Ashuach, Tomer, et al.
Publicado: (2025)
LLMs Are Not Scorers: Rethinking MT Evaluation with Generation-Based Methods
por: Cui, Hyang
Publicado: (2025)
por: Cui, Hyang
Publicado: (2025)
Ejemplares similares
-
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
por: Iqbal, Hasan, et al.
Publicado: (2024) -
UrduFactCheck: An Agentic Fact-Checking Framework for Urdu with Evidence Boosting and Benchmarking
por: Ahmad, Sarfraz, et al.
Publicado: (2025) -
The CLEF-2025 CheckThat! Lab: Subjectivity, Fact-Checking, Claim Normalization, and Retrieval
por: Alam, Firoj, et al.
Publicado: (2025) -
Retrieve-Refine-Calibrate: A Framework for Complex Claim Fact-Checking
por: Sun, Mingwei, et al.
Publicado: (2026) -
A Knowledge Enhanced Learning and Semantic Composition Model for Multi-Claim Fact Checking
por: Wang, Shuai, et al.
Publicado: (2021)