AFRIDOC-MT: Document-level MT Corpus for African Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Alabi, Jesujoba O., Azime, Israel Abebe, Zhang, Miaoran, España-Bonet, Cristina, Bawden, Rachel, Zhu, Dawei, Adelani, David Ifeoluwa, Odoje, Clement Oyeleke, Akinade, Idris, Maab, Iffat, David, Davis, Muhammad, Shamsuddeen Hassan, Putini, Neo, Ademuyiwa, David O., Caines, Andrew, Klakow, Dietrich |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
por: Alabi, Jesujoba O., et al.
Publicado: (2025)
por: Alabi, Jesujoba O., et al.
Publicado: (2025)
AAdaM at SemEval-2024 Task 1: Augmentation and Adaptation for Multilingual Semantic Textual Relatedness
por: Zhang, Miaoran, et al.
Publicado: (2024)
por: Zhang, Miaoran, et al.
Publicado: (2024)
AfrIFact: Cultural Information Retrieval, Evidence Extraction and Fact Checking for African Languages
por: Azime, Israel Abebe, et al.
Publicado: (2026)
por: Azime, Israel Abebe, et al.
Publicado: (2026)
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
por: Aremu, Anuoluwapo, et al.
Publicado: (2023)
por: Aremu, Anuoluwapo, et al.
Publicado: (2023)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
por: Uemura, Kosei, et al.
Publicado: (2025)
por: Uemura, Kosei, et al.
Publicado: (2025)
YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset
por: Falola, Peace Busola, et al.
Publicado: (2026)
por: Falola, Peace Busola, et al.
Publicado: (2026)
Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages
por: Bayes, Edward, et al.
Publicado: (2024)
por: Bayes, Edward, et al.
Publicado: (2024)
The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional Analysis
por: Zhang, Miaoran, et al.
Publicado: (2024)
por: Zhang, Miaoran, et al.
Publicado: (2024)
AfroXLMR-Social: Adapting Pre-trained Language Models for African Languages Social Media Text
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
por: Belay, Tadesse Destaw, et al.
Publicado: (2025)
Natural language processing for African languages
por: Adelani, David Ifeoluwa
Publicado: (2025)
por: Adelani, David Ifeoluwa
Publicado: (2025)
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
por: Oberkircher, Lena S., et al.
Publicado: (2026)
por: Oberkircher, Lena S., et al.
Publicado: (2026)
AfriHuBERT: A self-supervised speech representation model for African languages
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation
por: Abdulmumin, Idris, et al.
Publicado: (2026)
por: Abdulmumin, Idris, et al.
Publicado: (2026)
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
YAD: Leveraging T5 for Improved Automatic Diacritization of Yorùbá Text
por: Olawole, Akindele Michael, et al.
Publicado: (2024)
por: Olawole, Akindele Michael, et al.
Publicado: (2024)
MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning
por: Uemura, Kosei, et al.
Publicado: (2025)
por: Uemura, Kosei, et al.
Publicado: (2025)
EkoHate: Abusive Language and Hate Speech Detection for Code-switched Political Discussions on Nigerian Twitter
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
The Hidden Space of Transformer Language Adapters
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
por: Alabi, Jesujoba O., et al.
Publicado: (2024)
SIB-200: A Simple, Inclusive, and Big Evaluation Dataset for Topic Classification in 200+ Languages and Dialects
por: Adelani, David Ifeoluwa, et al.
Publicado: (2023)
por: Adelani, David Ifeoluwa, et al.
Publicado: (2023)
No Text Needed: Forecasting MT Quality and Inequity from Fertility and Metadata
por: Lundin, Jessica M., et al.
Publicado: (2025)
por: Lundin, Jessica M., et al.
Publicado: (2025)
ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
por: Quinjica, Osvaldo Luamba, et al.
Publicado: (2024)
por: Quinjica, Osvaldo Luamba, et al.
Publicado: (2024)
When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation
por: Huang, Nannan, et al.
Publicado: (2026)
por: Huang, Nannan, et al.
Publicado: (2026)
DunbaaBERT: From Sacrifice to Semantics
por: Maab, Iffat, et al.
Publicado: (2026)
por: Maab, Iffat, et al.
Publicado: (2026)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
por: Ojo, Jessica, et al.
Publicado: (2025)
por: Ojo, Jessica, et al.
Publicado: (2025)
SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
por: Li, Senyu, et al.
Publicado: (2025)
por: Li, Senyu, et al.
Publicado: (2025)
INJONGO: A Multicultural Intent Detection and Slot-filling Dataset for 16 African Languages
por: Yu, Hao, et al.
Publicado: (2025)
por: Yu, Hao, et al.
Publicado: (2025)
MINERS: Multilingual Language Models as Semantic Retrievers
por: Winata, Genta Indra, et al.
Publicado: (2024)
por: Winata, Genta Indra, et al.
Publicado: (2024)
Correcting FLORES Evaluation Dataset for Four African Languages
por: Abdulmumin, Idris, et al.
Publicado: (2024)
por: Abdulmumin, Idris, et al.
Publicado: (2024)
Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
por: Luo, Guoqing, et al.
Publicado: (2025)
por: Luo, Guoqing, et al.
Publicado: (2025)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
por: Schmidt, Fabian David, et al.
Publicado: (2025)
por: Schmidt, Fabian David, et al.
Publicado: (2025)
Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
por: Azime, Israel Abebe, et al.
Publicado: (2025)
por: Azime, Israel Abebe, et al.
Publicado: (2025)
Health Information Equity: Rebalancing Healthcare Collections for Racial Diversity in UK Public Service Contexts
por: O'Driscoll, Grace, et al.
Publicado: (2022)
por: O'Driscoll, Grace, et al.
Publicado: (2022)
NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages
por: Maltais, Marie, et al.
Publicado: (2026)
por: Maltais, Marie, et al.
Publicado: (2026)
Lugha-Llama: Adapting Large Language Models for African Languages
por: Buzaaba, Happy, et al.
Publicado: (2025)
por: Buzaaba, Happy, et al.
Publicado: (2025)
Information and Digital Literacies: A Review of Concepts.
por: Bawden, David
Publicado: (2001)
por: Bawden, David
Publicado: (2001)
Revisión de los conceptos de alfabetización informacional y alfabetización digital
por: David Bawden
Publicado: (2002)
por: David Bawden
Publicado: (2002)
Human Speech Perception in Noise: Can Large Language Models Paraphrase to Improve It?
por: Chingacham, Anupama, et al.
Publicado: (2024)
por: Chingacham, Anupama, et al.
Publicado: (2024)
Registration of ‘MT Blackbeard’ and ‘MT Raska’ durum wheat
por: Andrew C. Hogg, et al.
Publicado: (2025)
por: Andrew C. Hogg, et al.
Publicado: (2025)
Reducing Inhomogeneous MT ( ihMT ) Acquisition Time Using Frequency Alternation at Low Duty Cycle for Single Offset ( FALSO ) MT Preparations
por: Gopal Varma, et al.
Publicado: (2026)
por: Gopal Varma, et al.
Publicado: (2026)
Multilinguality as Sense Adaptation
por: Cruz, Jan Christian Blaise, et al.
Publicado: (2026)
por: Cruz, Jan Christian Blaise, et al.
Publicado: (2026)
Ejemplares similares
-
Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead
por: Alabi, Jesujoba O., et al.
Publicado: (2025) -
AAdaM at SemEval-2024 Task 1: Augmentation and Adaptation for Multilingual Semantic Textual Relatedness
por: Zhang, Miaoran, et al.
Publicado: (2024) -
AfrIFact: Cultural Information Retrieval, Evidence Extraction and Fact Checking for African Languages
por: Azime, Israel Abebe, et al.
Publicado: (2026) -
NaijaRC: A Multi-choice Reading Comprehension Dataset for Nigerian Languages
por: Aremu, Anuoluwapo, et al.
Publicado: (2023) -
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
por: Uemura, Kosei, et al.
Publicado: (2025)