Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
Fuente:
arXiv
Guardado en:
| Autores principales: | Shafayat, Sheikh, Kim, Eunsu, Oh, Juhyun, Oh, Alice |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Analysis of Multilingual FActScore
por: Vu, Kim Trong, et al.
Publicado: (2024)
por: Vu, Kim Trong, et al.
Publicado: (2024)
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
por: Oh, Juhyun, et al.
Publicado: (2025)
por: Oh, Juhyun, et al.
Publicado: (2025)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
por: Lage, Lucas Fonseca, et al.
Publicado: (2025)
por: Lage, Lucas Fonseca, et al.
Publicado: (2025)
The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate
por: Oh, Juhyun, et al.
Publicado: (2024)
por: Oh, Juhyun, et al.
Publicado: (2024)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
por: Shin, Jisu, et al.
Publicado: (2025)
por: Shin, Jisu, et al.
Publicado: (2025)
DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts
por: Braun, Tobias, et al.
Publicado: (2024)
por: Braun, Tobias, et al.
Publicado: (2024)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
por: Shin, Jisu, et al.
Publicado: (2025)
por: Shin, Jisu, et al.
Publicado: (2025)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
por: Kim, Eunsu, et al.
Publicado: (2025)
por: Kim, Eunsu, et al.
Publicado: (2025)
Uncovering Factor Level Preferences to Improve Human-Model Alignment
por: Oh, Juhyun, et al.
Publicado: (2024)
por: Oh, Juhyun, et al.
Publicado: (2024)
FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain
por: Afzal, Anum, et al.
Publicado: (2025)
por: Afzal, Anum, et al.
Publicado: (2025)
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
por: Kabir, Daeen, et al.
Publicado: (2025)
por: Kabir, Daeen, et al.
Publicado: (2025)
OLA: Output Language Alignment in Code-Switched LLM Interactions
por: Oh, Juhyun, et al.
Publicado: (2026)
por: Oh, Juhyun, et al.
Publicado: (2026)
LangBridge: Multilingual Reasoning Without Multilingual Supervision
por: Yoon, Dongkeun, et al.
Publicado: (2024)
por: Yoon, Dongkeun, et al.
Publicado: (2024)
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
por: Kim, Eunsu, et al.
Publicado: (2024)
por: Kim, Eunsu, et al.
Publicado: (2024)
A 2-step Framework for Automated Literary Translation Evaluation: Its Promises and Pitfalls
por: Shafayat, Sheikh, et al.
Publicado: (2024)
por: Shafayat, Sheikh, et al.
Publicado: (2024)
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
por: Song, Seyoung, et al.
Publicado: (2025)
por: Song, Seyoung, et al.
Publicado: (2025)
Culture is Everywhere: A Call for Intentionally Cultural Evaluation
por: Oh, Juhyun, et al.
Publicado: (2025)
por: Oh, Juhyun, et al.
Publicado: (2025)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
por: Kim, Eunsu, et al.
Publicado: (2024)
por: Kim, Eunsu, et al.
Publicado: (2024)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
por: Shafayat, Sheikh, et al.
Publicado: (2024)
por: Shafayat, Sheikh, et al.
Publicado: (2024)
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
por: Jeong, Seogyeong, et al.
Publicado: (2026)
por: Jeong, Seogyeong, et al.
Publicado: (2026)
FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation
por: Oh, Juhyun, et al.
Publicado: (2026)
por: Oh, Juhyun, et al.
Publicado: (2026)
Code-Switching Curriculum Learning for Multilingual Transfer in LLMs
por: Yoo, Haneul, et al.
Publicado: (2024)
por: Yoo, Haneul, et al.
Publicado: (2024)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
por: Kim, Eunsu, et al.
Publicado: (2025)
por: Kim, Eunsu, et al.
Publicado: (2025)
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
por: Jin, Jiho, et al.
Publicado: (2026)
por: Jin, Jiho, et al.
Publicado: (2026)
When Tom Eats Kimchi: Evaluating Cultural Bias of Multimodal Large Language Models in Cultural Mixture Contexts
por: Kim, Jun Seong, et al.
Publicado: (2025)
por: Kim, Jun Seong, et al.
Publicado: (2025)
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
por: Yoo, Haneul, et al.
Publicado: (2024)
por: Yoo, Haneul, et al.
Publicado: (2024)
On the Effect of Uncertainty on Layer-wise Inference Dynamics
por: Kim, Sunwoo, et al.
Publicado: (2025)
por: Kim, Sunwoo, et al.
Publicado: (2025)
Tracing Multilingual Factual Knowledge Acquisition in Pretraining
por: Liu, Yihong, et al.
Publicado: (2025)
por: Liu, Yihong, et al.
Publicado: (2025)
House of Cards: Massive Weights in LLMs
por: Oh, Jaehoon, et al.
Publicado: (2024)
por: Oh, Jaehoon, et al.
Publicado: (2024)
Cross-Lingual Auto Evaluation for Assessing Multilingual LLMs
por: Doddapaneni, Sumanth, et al.
Publicado: (2024)
por: Doddapaneni, Sumanth, et al.
Publicado: (2024)
Multilingual Knowledge Editing with Language-Agnostic Factual Neurons
por: Zhang, Xue, et al.
Publicado: (2024)
por: Zhang, Xue, et al.
Publicado: (2024)
mFACE: Multilingual Summarization with Factual Consistency Evaluation
por: Aharoni, Roee, et al.
Publicado: (2022)
por: Aharoni, Roee, et al.
Publicado: (2022)
A Framework to Assess Multilingual Vulnerabilities of LLMs
por: Tang, Likai, et al.
Publicado: (2025)
por: Tang, Likai, et al.
Publicado: (2025)
Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages
por: Rohera, Pritika, et al.
Publicado: (2025)
por: Rohera, Pritika, et al.
Publicado: (2025)
Factual Consistency of Multilingual Pretrained Language Models
por: Fierro, Constanza, et al.
Publicado: (2022)
por: Fierro, Constanza, et al.
Publicado: (2022)
Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipeline
por: Lu, Meng, et al.
Publicado: (2025)
por: Lu, Meng, et al.
Publicado: (2025)
Trans-EnV: A Framework for Evaluating the Linguistic Robustness of LLMs Against English Varieties
por: Lee, Jiyoung, et al.
Publicado: (2025)
por: Lee, Jiyoung, et al.
Publicado: (2025)
Factual Inconsistencies in Multilingual Wikipedia Tables
por: Cappa, Silvia, et al.
Publicado: (2025)
por: Cappa, Silvia, et al.
Publicado: (2025)
Does Alignment Tuning Really Break LLMs' Internal Confidence?
por: Oh, Hongseok, et al.
Publicado: (2024)
por: Oh, Hongseok, et al.
Publicado: (2024)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
Ejemplares similares
-
An Analysis of Multilingual FActScore
por: Vu, Kim Trong, et al.
Publicado: (2024) -
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
por: Oh, Juhyun, et al.
Publicado: (2025) -
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
por: Lage, Lucas Fonseca, et al.
Publicado: (2025) -
The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate
por: Oh, Juhyun, et al.
Publicado: (2024) -
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
por: Shin, Jisu, et al.
Publicado: (2025)