SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects
Fuente:
arXiv
Guardado en:
| Autores principales: | Adelani, David Ifeoluwa, Liu, Hannah, Shen, Xiaoyu, Vassilyev, Nikita, Alabi, Jesujoba O., Mao, Yanke, Gao, Haonan, Lee, Annie En-Shiun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
por: Alabi, Jesujoba O., et al.
Publicado: (2025)
por: Alabi, Jesujoba O., et al.
Publicado: (2025)
MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning
por: Uemura, Kosei, et al.
Publicado: (2025)
por: Uemura, Kosei, et al.
Publicado: (2025)
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
por: Falola, Peace Busola, et al.
Publicado: (2026)
por: Falola, Peace Busola, et al.
Publicado: (2026)
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
por: Aremu, Anuoluwapo, et al.
Publicado: (2023)
por: Aremu, Anuoluwapo, et al.
Publicado: (2023)
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
por: Oberkircher, Lena S., et al.
Publicado: (2026)
por: Oberkircher, Lena S., et al.
Publicado: (2026)
Natural language processing for African languages
por: Adelani, David Ifeoluwa
Publicado: (2025)
por: Adelani, David Ifeoluwa
Publicado: (2025)
EkoHate: Abusive Language and Hate Speech Detection for Code-switched Political Discussions on Nigerian Twitter
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
YAD: Leveraging T5 for Improved Automatic Diacritization of Yorùbá Text
por: Olawole, Akindele Michael, et al.
Publicado: (2024)
por: Olawole, Akindele Michael, et al.
Publicado: (2024)
ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
por: Quinjica, Osvaldo Luamba, et al.
Publicado: (2024)
por: Quinjica, Osvaldo Luamba, et al.
Publicado: (2024)
Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects
por: Ahia, Orevaoghene, et al.
Publicado: (2024)
por: Ahia, Orevaoghene, et al.
Publicado: (2024)
OasisSimp: An Open-source Asian-English Sentence Simplification Dataset
por: Liu, Hannah, et al.
Publicado: (2026)
por: Liu, Hannah, et al.
Publicado: (2026)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
por: Ojo, Jessica, et al.
Publicado: (2025)
por: Ojo, Jessica, et al.
Publicado: (2025)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
por: Uemura, Kosei, et al.
Publicado: (2025)
por: Uemura, Kosei, et al.
Publicado: (2025)
INJONGO: A Multicultural Intent Detection and Slot-filling Dataset for 16 African Languages
por: Yu, Hao, et al.
Publicado: (2025)
por: Yu, Hao, et al.
Publicado: (2025)
The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional Analysis
por: Zhang, Miaoran, et al.
Publicado: (2024)
por: Zhang, Miaoran, et al.
Publicado: (2024)
MINERS: Multilingual Language Models as Semantic Retrievers
por: Winata, Genta Indra, et al.
Publicado: (2024)
por: Winata, Genta Indra, et al.
Publicado: (2024)
AfriHuBERT: A self-supervised speech representation model for African languages
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
UNIQORN: Unified Question Answering over RDF Knowledge Graphs and Natural Language Text
por: Pramanik, Soumajit, et al.
Publicado: (2021)
por: Pramanik, Soumajit, et al.
Publicado: (2021)
AAdaM at SemEval-2024 Task 1: Augmentation and Adaptation for Multilingual Semantic Textual Relatedness
por: Zhang, Miaoran, et al.
Publicado: (2024)
por: Zhang, Miaoran, et al.
Publicado: (2024)
Prakriti200: A Questionnaire-Based Dataset of 200 Ayurvedic Prakriti Assessments
por: Singh, Aryan Kumar, et al.
Publicado: (2025)
por: Singh, Aryan Kumar, et al.
Publicado: (2025)
Lugha-Llama: Adapting Large Language Models for African Languages
por: Buzaaba, Happy, et al.
Publicado: (2025)
por: Buzaaba, Happy, et al.
Publicado: (2025)
Less is More: The Effectiveness of Compact Typological Language Representations
por: Ng, York Hay, et al.
Publicado: (2025)
por: Ng, York Hay, et al.
Publicado: (2025)
Ibom NLP: A Step Toward Inclusive Natural Language Processing for Nigeria's Minority Languages
por: Kalejaiye, Oluwadara, et al.
Publicado: (2025)
por: Kalejaiye, Oluwadara, et al.
Publicado: (2025)
The Hidden Space of Transformer Language Adapters
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
Simple Additions, Substantial Gains: Expanding Scripts, Languages, and Lineage Coverage in URIEL+
por: Shipton, Mason, et al.
Publicado: (2025)
por: Shipton, Mason, et al.
Publicado: (2025)
Exploiting Domain-Specific Parallel Data on Multilingual Language Models for Low-resource Language Translation
por: Ranathungaa, Surangika, et al.
Publicado: (2024)
por: Ranathungaa, Surangika, et al.
Publicado: (2024)
Multilinguality as Sense Adaptation
por: Cruz, Jan Christian Blaise, et al.
Publicado: (2026)
por: Cruz, Jan Christian Blaise, et al.
Publicado: (2026)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
por: Schmidt, Fabian David, et al.
Publicado: (2025)
por: Schmidt, Fabian David, et al.
Publicado: (2025)
Does Generative AI speak Nigerian-Pidgin?: Issues about Representativeness and Bias for Multilingualism in LLMs
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matching
por: Schmidt, Fabian David, et al.
Publicado: (2025)
por: Schmidt, Fabian David, et al.
Publicado: (2025)
Reflective Context Learning: Studying the Optimization Primitives of Context Space
por: Vassilyev, Nikita, et al.
Publicado: (2026)
por: Vassilyev, Nikita, et al.
Publicado: (2026)
Inclusive jet cross section in $pp$ collisions at $\sqrt{s} = 200$ and $510$ GeV
por: The STAR Collaboration
Publicado: (2026)
por: The STAR Collaboration
Publicado: (2026)
ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus
por: Ogunremi, Tolulope, et al.
Publicado: (2023)
por: Ogunremi, Tolulope, et al.
Publicado: (2023)
An Empirical Study of Many-Shot In-Context Learning for Machine Translation of Low-Resource Languages
por: Lu, Yinhan, et al.
Publicado: (2026)
por: Lu, Yinhan, et al.
Publicado: (2026)
AfriHG: News headline generation for African Languages
por: Ogunremi, Toyib, et al.
Publicado: (2024)
por: Ogunremi, Toyib, et al.
Publicado: (2024)
Comparing LLM prompting with Cross-lingual transfer performance on Indigenous and Low-resource Brazilian Languages
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages
por: Bayes, Edward, et al.
Publicado: (2024)
por: Bayes, Edward, et al.
Publicado: (2024)
TranslationCorrect: A Unified Framework for Machine Translation Post-Editing with Predictive Error Assistance
por: Wasti, Syed Mekael, et al.
Publicado: (2025)
por: Wasti, Syed Mekael, et al.
Publicado: (2025)
Beyond Vanilla Fine-Tuning: Leveraging Multistage, Multilingual, and Domain-Specific Methods for Low-Resource Machine Translation
por: Thillainathan, Sarubi, et al.
Publicado: (2025)
por: Thillainathan, Sarubi, et al.
Publicado: (2025)
Ejemplares similares
-
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
por: Alabi, Jesujoba O., et al.
Publicado: (2025) -
MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning
por: Uemura, Kosei, et al.
Publicado: (2025) -
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
por: Falola, Peace Busola, et al.
Publicado: (2026) -
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
por: Aremu, Anuoluwapo, et al.
Publicado: (2023) -
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
por: Oberkircher, Lena S., et al.
Publicado: (2026)