Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
Fuente:
arXiv
Saved in:
| Main Authors: | Fernando, Aloka, de Silva, Nisansa, Velyuthan, Menan, Rathnayake, Charitha, Ranathunga, Surangika |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
by: Fernando, Aloka, et al.
Published: (2025)
by: Fernando, Aloka, et al.
Published: (2025)
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
by: Rathnayake, Charitha, et al.
Published: (2024)
by: Rathnayake, Charitha, et al.
Published: (2024)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
by: Puranegedara, Imalsha, et al.
Published: (2025)
by: Puranegedara, Imalsha, et al.
Published: (2025)
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026)
by: de Silva, Nisansa, et al.
Published: (2026)
LMSpell: Neural Spell Checking for Low-Resource Languages
by: Gunathilake, Akesh, et al.
Published: (2025)
by: Gunathilake, Akesh, et al.
Published: (2025)
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
by: De Mel, Yomal, et al.
Published: (2024)
by: De Mel, Yomal, et al.
Published: (2024)
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025)
by: Aravinda, H. W. K., et al.
Published: (2025)
Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation
by: Su, Tong, et al.
Published: (2024)
by: Su, Tong, et al.
Published: (2024)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
by: Wickramasinghe, Kasun, et al.
Published: (2023)
by: Wickramasinghe, Kasun, et al.
Published: (2023)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Beyond Vanilla Fine-Tuning: Leveraging Multistage, Multilingual, and Domain-Specific Methods for Low-Resource Machine Translation
by: Thillainathan, Sarubi, et al.
Published: (2025)
by: Thillainathan, Sarubi, et al.
Published: (2025)
Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization
by: Senath, Thevin, et al.
Published: (2024)
by: Senath, Thevin, et al.
Published: (2024)
A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Selecting Seed Words for Wordle using Character Statistics
by: de Silva, Nisansa
Published: (2022)
by: de Silva, Nisansa
Published: (2022)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
by: de Silva, Nisansa
Published: (2019)
by: de Silva, Nisansa
Published: (2019)
GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages
by: Gyamfi, Lawrence Adu, et al.
Published: (2026)
by: Gyamfi, Lawrence Adu, et al.
Published: (2026)
A Review of the Challenges with Massive Web-mined Corpora Used in Large Language Models Pre-Training
by: Perełkiewicz, Michał, et al.
Published: (2024)
by: Perełkiewicz, Michał, et al.
Published: (2024)
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models
by: Hameed, Sameeah Noreen, et al.
Published: (2025)
by: Hameed, Sameeah Noreen, et al.
Published: (2025)
Egalitarian Language Representation in Language Models: It All Begins with Tokenizers
by: Velayuthan, Menan, et al.
Published: (2024)
by: Velayuthan, Menan, et al.
Published: (2024)
Low-Resource, High-Impact: Building Corpora for Inclusive Language Technologies
by: Artemova, Ekaterina, et al.
Published: (2025)
by: Artemova, Ekaterina, et al.
Published: (2025)
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
How Good is BLI as an Alignment Measure: A Study in Word Embedding Paradigm
by: Wickramasinghe, Kasun, et al.
Published: (2025)
by: Wickramasinghe, Kasun, et al.
Published: (2025)
Fine Tuning Named Entity Extraction Models for the Fantasy Domain
by: Sivaganeshan, Aravinth, et al.
Published: (2024)
by: Sivaganeshan, Aravinth, et al.
Published: (2024)
Parallel Corpora for Machine Translation in Low-resource Indic Languages: A Comprehensive Review
by: Raja, Rahul, et al.
Published: (2025)
by: Raja, Rahul, et al.
Published: (2025)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
by: Lin, Peiqin, et al.
Published: (2024)
by: Lin, Peiqin, et al.
Published: (2024)
SHADE: Semantic Hypernym Annotator for Domain-specific Entities -- DnD Domain Use Case
by: Peiris, Akila, et al.
Published: (2024)
by: Peiris, Akila, et al.
Published: (2024)
Elementary Math Word Problem Generation using Large Language Models
by: Ariyarathne, Nimesh, et al.
Published: (2025)
by: Ariyarathne, Nimesh, et al.
Published: (2025)
Exploiting Domain-Specific Parallel Data on Multilingual Language Models for Low-resource Language Translation
by: Ranathungaa, Surangika, et al.
Published: (2024)
by: Ranathungaa, Surangika, et al.
Published: (2024)
GeeSanBhava: Sentiment Tagged Sinhala Music Video Comment Data Set
by: De Mel, Yomal, et al.
Published: (2025)
by: De Mel, Yomal, et al.
Published: (2025)
DESS: DeBERTa Enhanced Syntactic-Semantic Aspect Sentiment Triplet Extraction
by: Thenuwara, Vishal, et al.
Published: (2025)
by: Thenuwara, Vishal, et al.
Published: (2025)
A Framework to Assess Multilingual Vulnerabilities of LLMs
by: Tang, Likai, et al.
Published: (2025)
by: Tang, Likai, et al.
Published: (2025)
Automating Research Synthesis with Domain-Specific Large Language Model Fine-Tuning
by: Susnjak, Teo, et al.
Published: (2024)
by: Susnjak, Teo, et al.
Published: (2024)
Multilingual and Explainable Text Detoxification with Parallel Corpora
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
Linguistic Analysis of Sinhala YouTube Comments on Sinhala Music Videos: A Dataset Study
by: De Mel, W. M. Yomal, et al.
Published: (2025)
by: De Mel, W. M. Yomal, et al.
Published: (2025)
M2DS: Multilingual Dataset for Multi-document Summarisation
by: Hewapathirana, Kushan, et al.
Published: (2024)
by: Hewapathirana, Kushan, et al.
Published: (2024)
CLASSLA-web: Comparable Web Corpora of South Slavic Languages Enriched with Linguistic and Genre Annotation
by: Ljubešić, Nikola, et al.
Published: (2024)
by: Ljubešić, Nikola, et al.
Published: (2024)
From Phonemes to Meaning: Evaluating Large Language Models on Tamil
by: Varsha, Jeyarajalingam, et al.
Published: (2025)
by: Varsha, Jeyarajalingam, et al.
Published: (2025)
Similar Items
-
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
by: Ranathunga, Surangika, et al.
Published: (2024) -
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
by: Fernando, Aloka, et al.
Published: (2025) -
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
by: Ranathunga, Surangika, et al.
Published: (2024) -
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
by: Rathnayake, Charitha, et al.
Published: (2024) -
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
by: Puranegedara, Imalsha, et al.
Published: (2025)