Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
Fuente:
arXiv
Salvato in:
| Autori principali: | Krsteski, Stefan, Tashkovska, Matea, Sazdov, Borjan, Gjoreski, Hristijan, Gerazov, Branislav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
di: McMillan, Teague, et al.
Pubblicazione: (2025)
di: McMillan, Teague, et al.
Pubblicazione: (2025)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
di: Yadav, Sumit, et al.
Pubblicazione: (2025)
di: Yadav, Sumit, et al.
Pubblicazione: (2025)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
di: Gerazov, Branislav, et al.
Pubblicazione: (2025)
di: Gerazov, Branislav, et al.
Pubblicazione: (2025)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
di: Merx, Raphaël, et al.
Pubblicazione: (2025)
di: Merx, Raphaël, et al.
Pubblicazione: (2025)
Foundation Models for Low-Resource Language Education (Vision Paper)
di: Ding, Zhaojun, et al.
Pubblicazione: (2024)
di: Ding, Zhaojun, et al.
Pubblicazione: (2024)
Pashto Common Voice: Building the First Open Speech Corpus for a 60-Million-Speaker Low-Resource Language
di: Rahman, Hanif, et al.
Pubblicazione: (2026)
di: Rahman, Hanif, et al.
Pubblicazione: (2026)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2025)
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2025)
Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification
di: D, Anusha M, et al.
Pubblicazione: (2025)
di: D, Anusha M, et al.
Pubblicazione: (2025)
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2026)
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2026)
Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
di: Krsteski, Stefan, et al.
Pubblicazione: (2025)
di: Krsteski, Stefan, et al.
Pubblicazione: (2025)
Convergence Rate Maximization for Split Learning-based Control of EMG Prosthetic Devices
di: Marinova, Matea, et al.
Pubblicazione: (2024)
di: Marinova, Matea, et al.
Pubblicazione: (2024)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
Developing an Open Conversational Speech Corpus for the Isan Language
di: Na-Thalang, Adisai, et al.
Pubblicazione: (2025)
di: Na-Thalang, Adisai, et al.
Pubblicazione: (2025)
Language Portability Strategies for Open-domain Dialogue with Pre-trained Language Models from High to Low Resource Languages
di: Njifenjou, Ahmed, et al.
Pubblicazione: (2024)
di: Njifenjou, Ahmed, et al.
Pubblicazione: (2024)
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages
di: Lombard, Anri, et al.
Pubblicazione: (2026)
di: Lombard, Anri, et al.
Pubblicazione: (2026)
CorpusLM: Towards a Unified Language Model on Corpus for Knowledge-Intensive Tasks
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models
di: Liu, Chonghan, et al.
Pubblicazione: (2026)
di: Liu, Chonghan, et al.
Pubblicazione: (2026)
LlamaTurk: Adapting Open-Source Generative Large Language Models for Low-Resource Language
di: Toraman, Cagri
Pubblicazione: (2024)
di: Toraman, Cagri
Pubblicazione: (2024)
Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus
di: Arabov, Mullosharaf K.
Pubblicazione: (2026)
di: Arabov, Mullosharaf K.
Pubblicazione: (2026)
Building Efficient and Effective OpenQA Systems for Low-Resource Languages
di: Budur, Emrah, et al.
Pubblicazione: (2024)
di: Budur, Emrah, et al.
Pubblicazione: (2024)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
di: Joshi, Raviraj, et al.
Pubblicazione: (2024)
di: Joshi, Raviraj, et al.
Pubblicazione: (2024)
On Multilingual Encoder Language Model Compression for Low-Resource Languages
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
di: Gurgurov, Daniil, et al.
Pubblicazione: (2025)
TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling
di: Huang, Cheng, et al.
Pubblicazione: (2025)
di: Huang, Cheng, et al.
Pubblicazione: (2025)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
Large Language Models for Toxic Language Detection in Low-Resource Balkan Languages
di: Muminovic, Amel, et al.
Pubblicazione: (2025)
di: Muminovic, Amel, et al.
Pubblicazione: (2025)
OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models
di: Kuang, Yuxuan, et al.
Pubblicazione: (2024)
di: Kuang, Yuxuan, et al.
Pubblicazione: (2024)
Open Language Data Initiative: Advancing Low-Resource Machine Translation for Karakalpak
di: Mamasaidov, Mukhammadsaid, et al.
Pubblicazione: (2024)
di: Mamasaidov, Mukhammadsaid, et al.
Pubblicazione: (2024)
Performance of Recent Large Language Models for a Low-Resourced Language
di: Jayakody, Ravindu, et al.
Pubblicazione: (2024)
di: Jayakody, Ravindu, et al.
Pubblicazione: (2024)
Controllable and Diverse Data Augmentation with Large Language Model for Low-Resource Open-Domain Dialogue Generation
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque
di: Sainz, Oscar, et al.
Pubblicazione: (2025)
di: Sainz, Oscar, et al.
Pubblicazione: (2025)
A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus
di: Tosun, Ebubekir, et al.
Pubblicazione: (2026)
di: Tosun, Ebubekir, et al.
Pubblicazione: (2026)
Enhancing Neural Machine Translation of Low-Resource Languages: Corpus Development, Human Evaluation and Explainable AI Architectures
di: Lankford, Séamus
Pubblicazione: (2024)
di: Lankford, Séamus
Pubblicazione: (2024)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
di: Puranegedara, Imalsha, et al.
Pubblicazione: (2025)
di: Puranegedara, Imalsha, et al.
Pubblicazione: (2025)
Is Small Language Model the Silver Bullet to Low-Resource Languages Machine Translation?
di: Song, Yewei, et al.
Pubblicazione: (2025)
di: Song, Yewei, et al.
Pubblicazione: (2025)
Evaluating and Adapting Large Language Models to Represent Folktales in Low-Resource Languages
di: Meaney, JA, et al.
Pubblicazione: (2024)
di: Meaney, JA, et al.
Pubblicazione: (2024)
Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages
di: Li, Haolin, et al.
Pubblicazione: (2025)
di: Li, Haolin, et al.
Pubblicazione: (2025)
AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models
di: Belay, Tadesse Destaw, et al.
Pubblicazione: (2026)
di: Belay, Tadesse Destaw, et al.
Pubblicazione: (2026)
Building Foundations for Natural Language Processing of Historical Turkish: Resources and Models
di: Özateş, Şaziye Betül, et al.
Pubblicazione: (2025)
di: Özateş, Şaziye Betül, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
di: McMillan, Teague, et al.
Pubblicazione: (2025) -
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
di: Yadav, Sumit, et al.
Pubblicazione: (2025) -
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
di: Gerazov, Branislav, et al.
Pubblicazione: (2025) -
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
di: Merx, Raphaël, et al.
Pubblicazione: (2025) -
Foundation Models for Low-Resource Language Education (Vision Paper)
di: Ding, Zhaojun, et al.
Pubblicazione: (2024)