A multilingual hallucination benchmark: MultiWikiQHalluA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thoresen, Freja, Smart, Dan Saattrup |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages
par: Smart, Dan Saattrup
Publié: (2025)
par: Smart, Dan Saattrup
Publié: (2025)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
par: Bruun, Sofie Helene, et autres
Publié: (2025)
par: Bruun, Sofie Helene, et autres
Publié: (2025)
Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs
par: Abdaljalil, Samir, et autres
Publié: (2026)
par: Abdaljalil, Samir, et autres
Publié: (2026)
FoQA: A Faroese Question-Answering Dataset
par: Simonsen, Annika, et autres
Publié: (2025)
par: Simonsen, Annika, et autres
Publié: (2025)
Hotter and Colder: A New Approach to Annotating Sentiment, Emotions, and Bias in Icelandic Blog Comments
par: Friðriksdóttir, Steinunn Rut, et autres
Publié: (2025)
par: Friðriksdóttir, Steinunn Rut, et autres
Publié: (2025)
MultiLoKo: a multilingual local knowledge benchmark for LLMs spanning 31 languages
par: Hupkes, Dieuwke, et autres
Publié: (2025)
par: Hupkes, Dieuwke, et autres
Publié: (2025)
Encoder vs Decoder: Comparative Analysis of Encoder and Decoder Language Models on Multilingual NLU Tasks
par: Nielsen, Dan Saattrup, et autres
Publié: (2024)
par: Nielsen, Dan Saattrup, et autres
Publié: (2024)
A novel hallucination classification framework
par: Zavhorodnii, Maksym, et autres
Publié: (2025)
par: Zavhorodnii, Maksym, et autres
Publié: (2025)
Wiki-Quantities and Wiki-Measurements: Datasets of Quantities and their Measurement Context from Wikipedia
par: Göpfert, Jan, et autres
Publié: (2025)
par: Göpfert, Jan, et autres
Publié: (2025)
`Generalization is hallucination' through the lens of tensor completions
par: Wong, Liang Ze
Publié: (2025)
par: Wong, Liang Ze
Publié: (2025)
A review of faithfulness metrics for hallucination assessment in Large Language Models
par: Malin, Ben, et autres
Publié: (2024)
par: Malin, Ben, et autres
Publié: (2024)
MultiCaption: Detecting disinformation using multilingual visual claims
par: Frade, Rafael Martins, et autres
Publié: (2026)
par: Frade, Rafael Martins, et autres
Publié: (2026)
A comprehensive taxonomy of hallucinations in Large Language Models
par: Cossio, Manuel
Publié: (2025)
par: Cossio, Manuel
Publié: (2025)
EvoWiki: Evaluating LLMs on Evolving Knowledge
par: Tang, Wei, et autres
Publié: (2024)
par: Tang, Wei, et autres
Publié: (2024)
Probabilistic distances-based hallucination detection in LLMs with RAG
par: Oblovatny, Rodion, et autres
Publié: (2025)
par: Oblovatny, Rodion, et autres
Publié: (2025)
WiCER: Wiki-memory Compile, Evaluate, Refine Iterative Knowledge Compilation for LLM Wiki Systems
par: Huerta, Juan M.
Publié: (2026)
par: Huerta, Juan M.
Publié: (2026)
Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark
par: Wu, Jian, et autres
Publié: (2024)
par: Wu, Jian, et autres
Publié: (2024)
WikiSQE: A Large-Scale Dataset for Sentence Quality Estimation in Wikipedia
par: Ando, Kenichiro, et autres
Publié: (2023)
par: Ando, Kenichiro, et autres
Publié: (2023)
Wiki Dumps to Training Corpora: South Slavic Case
par: Škorić, Mihailo, et autres
Publié: (2026)
par: Škorić, Mihailo, et autres
Publié: (2026)
WikiSplit++: Easy Data Refinement for Split and Rephrase
par: Tsukagoshi, Hayato, et autres
Publié: (2024)
par: Tsukagoshi, Hayato, et autres
Publié: (2024)
Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval and haystacks
par: Hengle, Amey, et autres
Publié: (2025)
par: Hengle, Amey, et autres
Publié: (2025)
VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing
par: Huang, Yanbin, et autres
Publié: (2026)
par: Huang, Yanbin, et autres
Publié: (2026)
Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research
par: Cochran, Theodore O.
Publié: (2026)
par: Cochran, Theodore O.
Publié: (2026)
Morphosyntactic probing of multilingual BERT models
par: Acs, Judit, et autres
Publié: (2023)
par: Acs, Judit, et autres
Publié: (2023)
ACL-Verbatim: hallucination-free question answering for research
par: Recski, Gábor, et autres
Publié: (2026)
par: Recski, Gábor, et autres
Publié: (2026)
WikiHint: A Human-Annotated Dataset for Hint Ranking and Generation
par: Mozafari, Jamshid, et autres
Publié: (2024)
par: Mozafari, Jamshid, et autres
Publié: (2024)
Ask-EDA: A Design Assistant Empowered by LLM, Hybrid RAG and Abbreviation De-hallucination
par: Shi, Luyao, et autres
Publié: (2024)
par: Shi, Luyao, et autres
Publié: (2024)
Do LLM hallucination detectors suffer from low-resource effect?
par: Datta, Debtanu, et autres
Publié: (2026)
par: Datta, Debtanu, et autres
Publié: (2026)
How do language models learn facts? Dynamics, curricula and hallucinations
par: Zucchet, Nicolas, et autres
Publié: (2025)
par: Zucchet, Nicolas, et autres
Publié: (2025)
GLeMM: A large-scale multilingual dataset for morphological research
par: Nabil, Hathout, et autres
Publié: (2026)
par: Nabil, Hathout, et autres
Publié: (2026)
WikiVideo: Article Generation from Multiple Videos
par: Martin, Alexander, et autres
Publié: (2025)
par: Martin, Alexander, et autres
Publié: (2025)
MAGPIE: A benchmark for Multi-AGent contextual PrIvacy Evaluation
par: Juneja, Gurusha, et autres
Publié: (2025)
par: Juneja, Gurusha, et autres
Publié: (2025)
Continuous sentiment scores for literary and multilingual contexts
par: Lyngbaek, Laurits, et autres
Publié: (2025)
par: Lyngbaek, Laurits, et autres
Publié: (2025)
A multimodal multiplex of the mental lexicon for multilingual individuals
par: Huynh, Maria, et autres
Publié: (2025)
par: Huynh, Maria, et autres
Publié: (2025)
Strong hallucinations from negation and how to fix them
par: Asher, Nicholas, et autres
Publié: (2024)
par: Asher, Nicholas, et autres
Publié: (2024)
WikiNER-fr-gold: A Gold-Standard NER Corpus
par: Cao, Danrun, et autres
Publié: (2024)
par: Cao, Danrun, et autres
Publié: (2024)
AILS-NTUA at SemEval-2024 Task 6: Efficient model tuning for hallucination detection and analysis
par: Grigoriadou, Natalia, et autres
Publié: (2024)
par: Grigoriadou, Natalia, et autres
Publié: (2024)
Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki
par: Ming, Haoliang, et autres
Publié: (2026)
par: Ming, Haoliang, et autres
Publié: (2026)
SLPL SHROOM at SemEval2024 Task 06: A comprehensive study on models ability to detect hallucination
par: Fallah, Pouya, et autres
Publié: (2024)
par: Fallah, Pouya, et autres
Publié: (2024)
Understanding the role of FFNs in driving multilingual behaviour in LLMs
par: Bhattacharya, Sunit, et autres
Publié: (2024)
par: Bhattacharya, Sunit, et autres
Publié: (2024)
Documents similaires
-
MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages
par: Smart, Dan Saattrup
Publié: (2025) -
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
par: Bruun, Sofie Helene, et autres
Publié: (2025) -
Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs
par: Abdaljalil, Samir, et autres
Publié: (2026) -
FoQA: A Faroese Question-Answering Dataset
par: Simonsen, Annika, et autres
Publié: (2025) -
Hotter and Colder: A New Approach to Annotating Sentiment, Emotions, and Bias in Icelandic Blog Comments
par: Friðriksdóttir, Steinunn Rut, et autres
Publié: (2025)