OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lage, Lucas Fonseca, Ostermann, Simon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
por: Shafayat, Sheikh, et al.
Publicado: (2024)
por: Shafayat, Sheikh, et al.
Publicado: (2024)
Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation
por: Gong, Ziwei, et al.
Publicado: (2026)
por: Gong, Ziwei, et al.
Publicado: (2026)
Lynx: An Open Source Hallucination Evaluation Model
por: Ravi, Selvan Sunitha, et al.
Publicado: (2024)
por: Ravi, Selvan Sunitha, et al.
Publicado: (2024)
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
por: Iqbal, Hasan, et al.
Publicado: (2024)
por: Iqbal, Hasan, et al.
Publicado: (2024)
AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
por: Aghaebrahimian, Ahmad
Publicado: (2025)
por: Aghaebrahimian, Ahmad
Publicado: (2025)
Towards More Effective Table-to-Text Generation: Assessing In-Context Learning and Self-Evaluation with Open-Source Models
por: Iravani, Sahar, et al.
Publicado: (2024)
por: Iravani, Sahar, et al.
Publicado: (2024)
Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks
por: Guo, Yuting, et al.
Publicado: (2025)
por: Guo, Yuting, et al.
Publicado: (2025)
Generating Benchmarks for Factuality Evaluation of Language Models
por: Muhlgay, Dor, et al.
Publicado: (2023)
por: Muhlgay, Dor, et al.
Publicado: (2023)
Classifying Cancer Stage with Open-Source Clinical Large Language Models
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights
por: Abbas, Alexandra, et al.
Publicado: (2025)
por: Abbas, Alexandra, et al.
Publicado: (2025)
An Open Multilingual System for Scoring Readability of Wikipedia
por: Trokhymovych, Mykola, et al.
Publicado: (2024)
por: Trokhymovych, Mykola, et al.
Publicado: (2024)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
por: Shin, Jisu, et al.
Publicado: (2025)
por: Shin, Jisu, et al.
Publicado: (2025)
An Analysis of Multilingual FActScore
por: Vu, Kim Trong, et al.
Publicado: (2024)
por: Vu, Kim Trong, et al.
Publicado: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
System Message Generation for User Preferences using Open-Source Models
por: Jeong, Minbyul, et al.
Publicado: (2025)
por: Jeong, Minbyul, et al.
Publicado: (2025)
Narrative Context Protocol: An Open-Source Storytelling Framework for Generative AI
por: Gerba, Hank
Publicado: (2025)
por: Gerba, Hank
Publicado: (2025)
Medical mT5: An Open-Source Multilingual Text-to-Text LLM for The Medical Domain
por: García-Ferrero, Iker, et al.
Publicado: (2024)
por: García-Ferrero, Iker, et al.
Publicado: (2024)
Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
por: Ramprasad, Sanjana, et al.
Publicado: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
por: Du, Yuwen, et al.
Publicado: (2026)
por: Du, Yuwen, et al.
Publicado: (2026)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
por: Carlsson, Fredrik, et al.
Publicado: (2024)
por: Carlsson, Fredrik, et al.
Publicado: (2024)
Orchard: An Open-Source Agentic Modeling Framework
por: Peng, Baolin, et al.
Publicado: (2026)
por: Peng, Baolin, et al.
Publicado: (2026)
Qabas: An Open-Source Arabic Lexicographic Database
por: Jarrar, Mustafa, et al.
Publicado: (2024)
por: Jarrar, Mustafa, et al.
Publicado: (2024)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
por: Golde, Jonas, et al.
Publicado: (2023)
por: Golde, Jonas, et al.
Publicado: (2023)
Is Open-Source There Yet? A Comparative Study on Commercial and Open-Source LLMs in Their Ability to Label Chest X-Ray Reports
por: Dorfner, Felix J., et al.
Publicado: (2024)
por: Dorfner, Felix J., et al.
Publicado: (2024)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
por: Wang, Jize, et al.
Publicado: (2026)
por: Wang, Jize, et al.
Publicado: (2026)
Open-SQL Framework: Enhancing Text-to-SQL on Open-source Large Language Models
por: Chen, Xiaojun, et al.
Publicado: (2024)
por: Chen, Xiaojun, et al.
Publicado: (2024)
Evaluating Text Summaries Generated by Large Language Models Using OpenAI's GPT
por: Shakil, Hassan, et al.
Publicado: (2024)
por: Shakil, Hassan, et al.
Publicado: (2024)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese
por: Kawai, Masataka, et al.
Publicado: (2026)
por: Kawai, Masataka, et al.
Publicado: (2026)
TinyLlama: An Open-Source Small Language Model
por: Zhang, Peiyuan, et al.
Publicado: (2024)
por: Zhang, Peiyuan, et al.
Publicado: (2024)
Design of an Open-Source Architecture for Neural Machine Translation
por: Lankford, Séamus, et al.
Publicado: (2024)
por: Lankford, Séamus, et al.
Publicado: (2024)
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
por: Gurgurov, Daniil, et al.
Publicado: (2024)
por: Gurgurov, Daniil, et al.
Publicado: (2024)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
por: Huang, Minghui
Publicado: (2025)
por: Huang, Minghui
Publicado: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
por: Harsh, Reetu Raj, et al.
Publicado: (2026)
por: Harsh, Reetu Raj, et al.
Publicado: (2026)
OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data
por: Nguyen, Tan Sang, et al.
Publicado: (2026)
por: Nguyen, Tan Sang, et al.
Publicado: (2026)
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
por: Lai, Wen, et al.
Publicado: (2026)
por: Lai, Wen, et al.
Publicado: (2026)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
por: Xu, Yunqi, et al.
Publicado: (2024)
por: Xu, Yunqi, et al.
Publicado: (2024)
LlamaTurk: Adapting Open-Source Generative Large Language Models for Low-Resource Language
por: Toraman, Cagri
Publicado: (2024)
por: Toraman, Cagri
Publicado: (2024)
LIMBA: An Open-Source Framework for the Preservation and Valorization of Low-Resource Languages using Generative Models
por: Carta, Salvatore Mario, et al.
Publicado: (2024)
por: Carta, Salvatore Mario, et al.
Publicado: (2024)
Ejemplares similares
-
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
por: Shafayat, Sheikh, et al.
Publicado: (2024) -
Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation
por: Gong, Ziwei, et al.
Publicado: (2026) -
Lynx: An Open Source Hallucination Evaluation Model
por: Ravi, Selvan Sunitha, et al.
Publicado: (2024) -
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
por: Iqbal, Hasan, et al.
Publicado: (2024) -
AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
por: Aghaebrahimian, Ahmad
Publicado: (2025)