ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Quinjica, Osvaldo Luamba, Adelani, David Ifeoluwa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Natural language processing for African languages
di: Adelani, David Ifeoluwa
Pubblicazione: (2025)
di: Adelani, David Ifeoluwa
Pubblicazione: (2025)
Lugha-Llama: Adapting Large Language Models for African Languages
di: Buzaaba, Happy, et al.
Pubblicazione: (2025)
di: Buzaaba, Happy, et al.
Pubblicazione: (2025)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
di: Ojo, Jessica, et al.
Pubblicazione: (2025)
di: Ojo, Jessica, et al.
Pubblicazione: (2025)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
di: Schmidt, Fabian David, et al.
Pubblicazione: (2025)
di: Schmidt, Fabian David, et al.
Pubblicazione: (2025)
Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State Generation
di: Li, Senyu, et al.
Pubblicazione: (2025)
di: Li, Senyu, et al.
Pubblicazione: (2025)
TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
di: Akinode, Victor, et al.
Pubblicazione: (2026)
di: Akinode, Victor, et al.
Pubblicazione: (2026)
AfroBench: How Good are Large Language Models on African Languages?
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
di: Ojo, Jessica, et al.
Pubblicazione: (2023)
AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages
di: Uemura, Kosei, et al.
Pubblicazione: (2025)
di: Uemura, Kosei, et al.
Pubblicazione: (2025)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
di: Benkirane, Kenza, et al.
Pubblicazione: (2024)
di: Benkirane, Kenza, et al.
Pubblicazione: (2024)
Ibom NLP: A Step Toward Inclusive Natural Language Processing for Nigeria's Minority Languages
di: Kalejaiye, Oluwadara, et al.
Pubblicazione: (2025)
di: Kalejaiye, Oluwadara, et al.
Pubblicazione: (2025)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
di: Zhu, Alan, et al.
Pubblicazione: (2025)
di: Zhu, Alan, et al.
Pubblicazione: (2025)
SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?
di: Li, Senyu, et al.
Pubblicazione: (2025)
di: Li, Senyu, et al.
Pubblicazione: (2025)
MINERS: Multilingual Language Models as Semantic Retrievers
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
di: Winata, Genta Indra, et al.
Pubblicazione: (2024)
MAPLE: Mobile App Prediction Leveraging Large Language Model Embeddings
di: Khaokaew, Yonchanok, et al.
Pubblicazione: (2023)
di: Khaokaew, Yonchanok, et al.
Pubblicazione: (2023)
Translation as a Scalable Proxy for Multilingual Evaluation
di: Issaka, Sheriff, et al.
Pubblicazione: (2026)
di: Issaka, Sheriff, et al.
Pubblicazione: (2026)
Scaling Laws of Synthetic Data for Language Models
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
di: Qin, Zeyu, et al.
Pubblicazione: (2025)
Backprompting: Leveraging Synthetic Production Data for Health Advice Guardrails
di: Cheng, Kellen Tan, et al.
Pubblicazione: (2025)
di: Cheng, Kellen Tan, et al.
Pubblicazione: (2025)
MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
Leveraging LLMs for Bangla Grammar Error Correction:Error Categorization, Synthetic Data, and Model Evaluation
di: Bhattacharyya, Pramit, et al.
Pubblicazione: (2024)
di: Bhattacharyya, Pramit, et al.
Pubblicazione: (2024)
Leveraging Graph Structures and Large Language Models for End-to-End Synthetic Task-Oriented Dialogues
di: Medjad, Maya, et al.
Pubblicazione: (2025)
di: Medjad, Maya, et al.
Pubblicazione: (2025)
LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation
di: Teklehaymanot, Hailay, et al.
Pubblicazione: (2026)
di: Teklehaymanot, Hailay, et al.
Pubblicazione: (2026)
Self-Boosting Large Language Models with Synthetic Preference Data
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
Configurable Safety Tuning of Language Models with Synthetic Preference Data
di: Gallego, Victor
Pubblicazione: (2024)
di: Gallego, Victor
Pubblicazione: (2024)
No Text Needed: Forecasting MT Quality and Inequity from Fertility and Metadata
di: Lundin, Jessica M., et al.
Pubblicazione: (2025)
di: Lundin, Jessica M., et al.
Pubblicazione: (2025)
Enhancing Clinical Documentation with Synthetic Data: Leveraging Generative Models for Improved Accuracy
di: Biswas, Anjanava, et al.
Pubblicazione: (2024)
di: Biswas, Anjanava, et al.
Pubblicazione: (2024)
Synthetic Data Generation for Phrase Break Prediction with Large Language Model
di: Lee, Hoyeon, et al.
Pubblicazione: (2025)
di: Lee, Hoyeon, et al.
Pubblicazione: (2025)
Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora
di: Majurski, Michael, et al.
Pubblicazione: (2025)
di: Majurski, Michael, et al.
Pubblicazione: (2025)
Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law
di: Bashir, Ali Hamza, et al.
Pubblicazione: (2026)
di: Bashir, Ali Hamza, et al.
Pubblicazione: (2026)
SmurfCat at SemEval-2024 Task 6: Leveraging Synthetic Data for Hallucination Detection
di: Rykov, Elisei, et al.
Pubblicazione: (2024)
di: Rykov, Elisei, et al.
Pubblicazione: (2024)
Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation
di: Rousseau, Cécile, et al.
Pubblicazione: (2025)
di: Rousseau, Cécile, et al.
Pubblicazione: (2025)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
di: Liu, Yihong, et al.
Pubblicazione: (2023)
di: Liu, Yihong, et al.
Pubblicazione: (2023)
CWTM: Leveraging Contextualized Word Embeddings from BERT for Neural Topic Modeling
di: Fang, Zheng, et al.
Pubblicazione: (2023)
di: Fang, Zheng, et al.
Pubblicazione: (2023)
Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation
di: Subramanian, Seganrasan, et al.
Pubblicazione: (2025)
di: Subramanian, Seganrasan, et al.
Pubblicazione: (2025)
Leveraging Online Data to Enhance Medical Knowledge in a Small Persian Language Model
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2025)
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Building Interpretable Rule-Based Data-to-Text Systems
di: Warczyński, Jędrzej, et al.
Pubblicazione: (2025)
di: Warczyński, Jędrzej, et al.
Pubblicazione: (2025)
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models
di: Adelani, David Ifeoluwa, et al.
Pubblicazione: (2024)
di: Adelani, David Ifeoluwa, et al.
Pubblicazione: (2024)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
di: Ma, Shengjie, et al.
Pubblicazione: (2025)
di: Ma, Shengjie, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Entity Matching
di: Huang, Qianyu, et al.
Pubblicazione: (2024)
di: Huang, Qianyu, et al.
Pubblicazione: (2024)
Leveraging In-Context Learning for Language Model Agents
di: Gupta, Shivanshu, et al.
Pubblicazione: (2025)
di: Gupta, Shivanshu, et al.
Pubblicazione: (2025)
CodecLM: Aligning Language Models with Tailored Synthetic Data
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Natural language processing for African languages
di: Adelani, David Ifeoluwa
Pubblicazione: (2025) -
Lugha-Llama: Adapting Large Language Models for African Languages
di: Buzaaba, Happy, et al.
Pubblicazione: (2025) -
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
di: Ojo, Jessica, et al.
Pubblicazione: (2025) -
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
di: Schmidt, Fabian David, et al.
Pubblicazione: (2025) -
Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State Generation
di: Li, Senyu, et al.
Pubblicazione: (2025)