YAD: Leveraging T5 for Improved Automatic Diacritization of Yorùbá Text
Fuente:
arXiv
Saved in:
| Main Authors: | Olawole, Akindele Michael, Alabi, Jesujoba O., Sakpere, Aderonke Busayo, Adelani, David I. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
by: Falola, Peace Busola, et al.
Published: (2026)
by: Falola, Peace Busola, et al.
Published: (2026)
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
by: Alabi, Jesujoba O., et al.
Published: (2025)
by: Alabi, Jesujoba O., et al.
Published: (2025)
Are LLMs Good Text Diacritizers? An Arabic and Yoruba Case Study
by: Toyin, Hawau Olamide, et al.
Published: (2025)
by: Toyin, Hawau Olamide, et al.
Published: (2025)
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
by: Aremu, Anuoluwapo, et al.
Published: (2023)
by: Aremu, Anuoluwapo, et al.
Published: (2023)
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
by: Beyene, Luel Hagos, et al.
Published: (2025)
by: Beyene, Luel Hagos, et al.
Published: (2025)
Arabic Diacritics in the Wild: Exploiting Opportunities for Improved Diacritization
by: Elgamal, Salman, et al.
Published: (2024)
by: Elgamal, Salman, et al.
Published: (2024)
EkoHate: Abusive Language and Hate Speech Detection for Code-switched Political Discussions on Nigerian Twitter
by: Ilevbare, Comfort Eseohen, et al.
Published: (2024)
by: Ilevbare, Comfort Eseohen, et al.
Published: (2024)
MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning
by: Uemura, Kosei, et al.
Published: (2025)
by: Uemura, Kosei, et al.
Published: (2025)
AAdaM at SemEval-2024 Task 1: Augmentation and Adaptation for Multilingual Semantic Textual Relatedness
by: Zhang, Miaoran, et al.
Published: (2024)
by: Zhang, Miaoran, et al.
Published: (2024)
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
by: Oberkircher, Lena S., et al.
Published: (2026)
by: Oberkircher, Lena S., et al.
Published: (2026)
SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects
by: Adelani, David Ifeoluwa, et al.
Published: (2023)
by: Adelani, David Ifeoluwa, et al.
Published: (2023)
UNIQORN: Unified Question Answering over RDF Knowledge Graphs and Natural Language Text
by: Pramanik, Soumajit, et al.
Published: (2021)
by: Pramanik, Soumajit, et al.
Published: (2021)
ÌròyìnSpeech: A multi-purpose Yorùbá Speech Corpus
by: Ogunremi, Tolulope, et al.
Published: (2023)
by: Ogunremi, Tolulope, et al.
Published: (2023)
Automatic Restoration of Diacritics for Speech Data Sets
by: Shatnawi, Sara, et al.
Published: (2023)
by: Shatnawi, Sara, et al.
Published: (2023)
Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
AfriHuBERT: A self-supervised speech representation model for African languages
by: Alabi, Jesujoba O., et al.
Published: (2024)
by: Alabi, Jesujoba O., et al.
Published: (2024)
The Hidden Space of Transformer Language Adapters
by: Alabi, Jesujoba O., et al.
Published: (2024)
by: Alabi, Jesujoba O., et al.
Published: (2024)
Interplay of Machine Translation, Diacritics, and Diacritization
by: Chen, Wei-Rui, et al.
Published: (2024)
by: Chen, Wei-Rui, et al.
Published: (2024)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
by: Uemura, Kosei, et al.
Published: (2025)
by: Uemura, Kosei, et al.
Published: (2025)
Don't Touch My Diacritics
by: Gorman, Kyle, et al.
Published: (2024)
by: Gorman, Kyle, et al.
Published: (2024)
ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
by: Quinjica, Osvaldo Luamba, et al.
Published: (2024)
Arabic Text Diacritization In The Age Of Transfer Learning: Token Classification Is All You Need
by: Skiredj, Abderrahman, et al.
Published: (2024)
by: Skiredj, Abderrahman, et al.
Published: (2024)
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
by: Nadas, Mihai, et al.
Published: (2025)
by: Nadas, Mihai, et al.
Published: (2025)
Text Detoxification in isiXhosa and Yorùbá: A Cross-Lingual Machine Learning Approach for Low-Resource African Languages
by: Agbeyangi, Abayomi O.
Published: (2026)
by: Agbeyangi, Abayomi O.
Published: (2026)
The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional Analysis
by: Zhang, Miaoran, et al.
Published: (2024)
by: Zhang, Miaoran, et al.
Published: (2024)
TRepLiNa: Layer-wise CKA+REPINA Alignment Improves Low-Resource Machine Translation in Aya-23 8B
by: Nakai, Toshiki, et al.
Published: (2025)
by: Nakai, Toshiki, et al.
Published: (2025)
Hebrew Diacritics Restoration using Visual Representation
by: Elboher, Yair, et al.
Published: (2025)
by: Elboher, Yair, et al.
Published: (2025)
The Degree of Language Diacriticity and Its Effect on Tasks
by: Cohen, Adi, et al.
Published: (2026)
by: Cohen, Adi, et al.
Published: (2026)
Abjad AI at NADI 2025: CATT-Whisper: Multimodal Diacritic Restoration Using Text and Speech Representations
by: Ghannam, Ahmad, et al.
Published: (2025)
by: Ghannam, Ahmad, et al.
Published: (2025)
Natural language processing for African languages
by: Adelani, David Ifeoluwa
Published: (2025)
by: Adelani, David Ifeoluwa
Published: (2025)
More Data, Fewer Diacritics: Scaling Arabic TTS
by: Musleh, Ahmed, et al.
Published: (2026)
by: Musleh, Ahmed, et al.
Published: (2026)
Yankari: A Monolingual Yoruba Dataset
by: Akpobi, Maro
Published: (2024)
by: Akpobi, Maro
Published: (2024)
Reference-Based Post-OCR Processing with LLM for Precise Diacritic Text in Historical Document Recognition
by: Do, Thao, et al.
Published: (2024)
by: Do, Thao, et al.
Published: (2024)
Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages
by: Bayes, Edward, et al.
Published: (2024)
by: Bayes, Edward, et al.
Published: (2024)
Corpus-Based Approaches to Igbo Diacritic Restoration
by: Ezeani, Ignatius
Published: (2026)
by: Ezeani, Ignatius
Published: (2026)
AFRIDOC-MT: Document-level MT Corpus for African Languages
by: Alabi, Jesujoba O., et al.
Published: (2025)
by: Alabi, Jesujoba O., et al.
Published: (2025)
D-Nikud: Enhancing Hebrew Diacritization with LSTM and Pretrained Models
by: Rosenthal, Adi, et al.
Published: (2024)
by: Rosenthal, Adi, et al.
Published: (2024)
Proper Noun Diacritization for Arabic Wikipedia: A Benchmark Dataset
by: Bondok, Rawan, et al.
Published: (2025)
by: Bondok, Rawan, et al.
Published: (2025)
A Context-Contrastive Inference Approach To Partial Diacritization
by: ElNokrashy, Muhammad, et al.
Published: (2024)
by: ElNokrashy, Muhammad, et al.
Published: (2024)
No Text Needed: Forecasting MT Quality and Inequity from Fertility and Metadata
by: Lundin, Jessica M., et al.
Published: (2025)
by: Lundin, Jessica M., et al.
Published: (2025)
Similar Items
-
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
by: Falola, Peace Busola, et al.
Published: (2026) -
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
by: Alabi, Jesujoba O., et al.
Published: (2025) -
Are LLMs Good Text Diacritizers? An Arabic and Yoruba Case Study
by: Toyin, Hawau Olamide, et al.
Published: (2025) -
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
by: Aremu, Anuoluwapo, et al.
Published: (2023) -
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
by: Beyene, Luel Hagos, et al.
Published: (2025)