Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects
Fuente:
arXiv
Saved in:
| Main Authors: | Ahia, Orevaoghene, Aremu, Anuoluwapo, Abagyan, Diana, Gonen, Hila, Adelani, David Ifeoluwa, Abolade, Daud, Smith, Noah A., Tsvetkov, Yulia |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024)
by: Xie, Roy, et al.
Published: (2024)
ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus
by: Ogunremi, Tolulope, et al.
Published: (2023)
by: Ogunremi, Tolulope, et al.
Published: (2023)
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
by: Aremu, Anuoluwapo, et al.
Published: (2023)
by: Aremu, Anuoluwapo, et al.
Published: (2023)
DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Does Generative AI speak Nigerian-Pidgin?: Issues about Representativeness and Bias for Multilingualism in LLMs
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
by: Limisiewicz, Tomasz, et al.
Published: (2024)
by: Limisiewicz, Tomasz, et al.
Published: (2024)
BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning
by: Jang, Min, et al.
Published: (2026)
by: Jang, Min, et al.
Published: (2026)
IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation
by: Kantharuban, Anjali, et al.
Published: (2026)
by: Kantharuban, Anjali, et al.
Published: (2026)
Natural language processing for African languages
by: Adelani, David Ifeoluwa
Published: (2025)
by: Adelani, David Ifeoluwa
Published: (2025)
BLAB: Brutally Long Audio Bench
by: Ahia, Orevaoghene, et al.
Published: (2025)
by: Ahia, Orevaoghene, et al.
Published: (2025)
FLEXITOKENS: Flexible Tokenization for Evolving Language Models
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
by: Falola, Peace Busola, et al.
Published: (2026)
by: Falola, Peace Busola, et al.
Published: (2026)
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
by: Alabi, Jesujoba O., et al.
Published: (2025)
by: Alabi, Jesujoba O., et al.
Published: (2025)
Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior
by: Nadkarni, Rahul, et al.
Published: (2025)
by: Nadkarni, Rahul, et al.
Published: (2025)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
by: Feng, Shangbin, et al.
Published: (2024)
by: Feng, Shangbin, et al.
Published: (2024)
Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
by: Zheng, Brian Siyuan, et al.
Published: (2025)
by: Zheng, Brian Siyuan, et al.
Published: (2025)
ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language Models
by: Gonen, Hila, et al.
Published: (2024)
by: Gonen, Hila, et al.
Published: (2024)
Demystifying Prompts in Language Models via Perplexity Estimation
by: Gonen, Hila, et al.
Published: (2022)
by: Gonen, Hila, et al.
Published: (2022)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
by: Uemura, Kosei, et al.
Published: (2025)
by: Uemura, Kosei, et al.
Published: (2025)
YAD: Leveraging T5 for Improved Automatic Diacritization of Yorùbá Text
by: Olawole, Akindele Michael, et al.
Published: (2024)
by: Olawole, Akindele Michael, et al.
Published: (2024)
An Empirical Study of Many-Shot In-Context Learning for Machine Translation of Low-Resource Languages
by: Lu, Yinhan, et al.
Published: (2026)
by: Lu, Yinhan, et al.
Published: (2026)
MINERS: Multilingual Language Models as Semantic Retrievers
by: Winata, Genta Indra, et al.
Published: (2024)
by: Winata, Genta Indra, et al.
Published: (2024)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
by: Ojo, Jessica, et al.
Published: (2025)
by: Ojo, Jessica, et al.
Published: (2025)
SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects
by: Adelani, David Ifeoluwa, et al.
Published: (2023)
by: Adelani, David Ifeoluwa, et al.
Published: (2023)
Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs
by: An, Joesph, et al.
Published: (2026)
by: An, Joesph, et al.
Published: (2026)
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
by: Blevins, Terra, et al.
Published: (2024)
by: Blevins, Terra, et al.
Published: (2024)
Multilinguality as Sense Adaptation
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
by: Schmidt, Fabian David, et al.
Published: (2025)
by: Schmidt, Fabian David, et al.
Published: (2025)
ComPO: Community Preferences for Language Model Personalization
by: Kumar, Sachin, et al.
Published: (2024)
by: Kumar, Sachin, et al.
Published: (2024)
Lugha-Llama: Adapting Large Language Models for African Languages
by: Buzaaba, Happy, et al.
Published: (2025)
by: Buzaaba, Happy, et al.
Published: (2025)
Ibom NLP: A Step Toward Inclusive Natural Language Processing for Nigeria's Minority Languages
by: Kalejaiye, Oluwadara, et al.
Published: (2025)
by: Kalejaiye, Oluwadara, et al.
Published: (2025)
Critical Learning Periods: Leveraging Early Training Dynamics for Efficient Data Pruning
by: Chimoto, Everlyn Asiko, et al.
Published: (2024)
by: Chimoto, Everlyn Asiko, et al.
Published: (2024)
AfriHG: News headline generation for African Languages
by: Ogunremi, Toyib, et al.
Published: (2024)
by: Ogunremi, Toyib, et al.
Published: (2024)
Comparing LLM prompting with Cross-lingual transfer performance on Indigenous and Low-resource Brazilian Languages
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
by: Adelani, David Ifeoluwa, et al.
Published: (2024)
Tuning Language Models by Proxy
by: Liu, Alisa, et al.
Published: (2024)
by: Liu, Alisa, et al.
Published: (2024)
NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages
by: Maltais, Marie, et al.
Published: (2026)
by: Maltais, Marie, et al.
Published: (2026)
GRDD: A Dataset for Greek Dialectal NLP
by: Chatzikyriakidis, Stergios, et al.
Published: (2023)
by: Chatzikyriakidis, Stergios, et al.
Published: (2023)
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection
by: Ahuja, Kabir, et al.
Published: (2025)
by: Ahuja, Kabir, et al.
Published: (2025)
Similar Items
-
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024) -
ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus
by: Ogunremi, Tolulope, et al.
Published: (2023) -
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
by: Ahia, Orevaoghene, et al.
Published: (2024) -
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
by: Aremu, Anuoluwapo, et al.
Published: (2023) -
DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
by: Faisal, Fahim, et al.
Published: (2024)