Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
Fuente:
arXiv
Salvato in:
| Autori principali: | Ranathunga, Surangika, de Silva, Nisansa, Velayuthan, Menan, Fernando, Aloka, Rathnayake, Charitha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
di: Fernando, Aloka, et al.
Pubblicazione: (2025)
di: Fernando, Aloka, et al.
Pubblicazione: (2025)
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
di: Fernando, Aloka, et al.
Pubblicazione: (2025)
di: Fernando, Aloka, et al.
Pubblicazione: (2025)
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
di: de Silva, Nisansa, et al.
Pubblicazione: (2026)
di: de Silva, Nisansa, et al.
Pubblicazione: (2026)
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
di: Rathnayake, Charitha, et al.
Pubblicazione: (2024)
di: Rathnayake, Charitha, et al.
Pubblicazione: (2024)
Egalitarian Language Representation in Language Models: It All Begins with Tokenizers
di: Velayuthan, Menan, et al.
Pubblicazione: (2024)
di: Velayuthan, Menan, et al.
Pubblicazione: (2024)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
di: Puranegedara, Imalsha, et al.
Pubblicazione: (2025)
di: Puranegedara, Imalsha, et al.
Pubblicazione: (2025)
LMSpell: Neural Spell Checking for Low-Resource Languages
di: Gunathilake, Akesh, et al.
Pubblicazione: (2025)
di: Gunathilake, Akesh, et al.
Pubblicazione: (2025)
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
di: De Mel, Yomal, et al.
Pubblicazione: (2024)
di: De Mel, Yomal, et al.
Pubblicazione: (2024)
SinLlama -- A Large Language Model for Sinhala
di: Aravinda, H. W. K., et al.
Pubblicazione: (2025)
di: Aravinda, H. W. K., et al.
Pubblicazione: (2025)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
From Phonemes to Meaning: Evaluating Large Language Models on Tamil
di: Varsha, Jeyarajalingam, et al.
Pubblicazione: (2025)
di: Varsha, Jeyarajalingam, et al.
Pubblicazione: (2025)
A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024)
Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization
di: Senath, Thevin, et al.
Pubblicazione: (2024)
di: Senath, Thevin, et al.
Pubblicazione: (2024)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
di: de Silva, Nisansa
Pubblicazione: (2019)
di: de Silva, Nisansa
Pubblicazione: (2019)
Selecting Seed Words for Wordle using Character Statistics
di: de Silva, Nisansa
Pubblicazione: (2022)
di: de Silva, Nisansa
Pubblicazione: (2022)
GADS: A Super Lightweight Model for Head Pose Estimation
di: Velayuthan, Menan, et al.
Pubblicazione: (2025)
di: Velayuthan, Menan, et al.
Pubblicazione: (2025)
Beyond Vanilla Fine-Tuning: Leveraging Multistage, Multilingual, and Domain-Specific Methods for Low-Resource Machine Translation
di: Thillainathan, Sarubi, et al.
Pubblicazione: (2025)
di: Thillainathan, Sarubi, et al.
Pubblicazione: (2025)
How Good is BLI as an Alignment Measure: A Study in Word Embedding Paradigm
di: Wickramasinghe, Kasun, et al.
Pubblicazione: (2025)
di: Wickramasinghe, Kasun, et al.
Pubblicazione: (2025)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
di: Jayatilleke, Nevidu, et al.
Pubblicazione: (2025)
di: Jayatilleke, Nevidu, et al.
Pubblicazione: (2025)
Do Language Models Care About Text Quality? Evaluating Web-Crawled Corpora Across 11 Languages
di: van Noord, Rik, et al.
Pubblicazione: (2024)
di: van Noord, Rik, et al.
Pubblicazione: (2024)
Fine Tuning Named Entity Extraction Models for the Fantasy Domain
di: Sivaganeshan, Aravinth, et al.
Pubblicazione: (2024)
di: Sivaganeshan, Aravinth, et al.
Pubblicazione: (2024)
SiDiaC: Sinhala Diachronic Corpus
di: Jayatilleke, Nevidu, et al.
Pubblicazione: (2025)
di: Jayatilleke, Nevidu, et al.
Pubblicazione: (2025)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
di: Wickramasinghe, Kasun, et al.
Pubblicazione: (2023)
di: Wickramasinghe, Kasun, et al.
Pubblicazione: (2023)
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models
di: Hameed, Sameeah Noreen, et al.
Pubblicazione: (2025)
di: Hameed, Sameeah Noreen, et al.
Pubblicazione: (2025)
Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation
di: Su, Tong, et al.
Pubblicazione: (2024)
di: Su, Tong, et al.
Pubblicazione: (2024)
Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web Corpora
di: Kim, Yungi, et al.
Pubblicazione: (2024)
di: Kim, Yungi, et al.
Pubblicazione: (2024)
A Framework to Assess Multilingual Vulnerabilities of LLMs
di: Tang, Likai, et al.
Pubblicazione: (2025)
di: Tang, Likai, et al.
Pubblicazione: (2025)
SHADE: Semantic Hypernym Annotator for Domain-specific Entities -- DnD Domain Use Case
di: Peiris, Akila, et al.
Pubblicazione: (2024)
di: Peiris, Akila, et al.
Pubblicazione: (2024)
A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
di: Nagata, Masaaki, et al.
Pubblicazione: (2024)
di: Nagata, Masaaki, et al.
Pubblicazione: (2024)
GeeSanBhava: Sentiment Tagged Sinhala Music Video Comment Data Set
di: De Mel, Yomal, et al.
Pubblicazione: (2025)
di: De Mel, Yomal, et al.
Pubblicazione: (2025)
DESS: DeBERTa Enhanced Syntactic-Semantic Aspect Sentiment Triplet Extraction
di: Thenuwara, Vishal, et al.
Pubblicazione: (2025)
di: Thenuwara, Vishal, et al.
Pubblicazione: (2025)
Linguistic Analysis of Sinhala YouTube Comments on Sinhala Music Videos: A Dataset Study
di: De Mel, W. M. Yomal, et al.
Pubblicazione: (2025)
di: De Mel, W. M. Yomal, et al.
Pubblicazione: (2025)
Multilingual and Explainable Text Detoxification with Parallel Corpora
di: Dementieva, Daryna, et al.
Pubblicazione: (2024)
di: Dementieva, Daryna, et al.
Pubblicazione: (2024)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillation
di: Song, Hoyun, et al.
Pubblicazione: (2025)
di: Song, Hoyun, et al.
Pubblicazione: (2025)
InfoTech Assistant: A Multimodal Conversational Agent for InfoTechnology Web Portal Queries
di: Gadiraju, Sai Surya, et al.
Pubblicazione: (2024)
di: Gadiraju, Sai Surya, et al.
Pubblicazione: (2024)
M2DS: Multilingual Dataset for Multi-document Summarisation
di: Hewapathirana, Kushan, et al.
Pubblicazione: (2024)
di: Hewapathirana, Kushan, et al.
Pubblicazione: (2024)
Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
Deep Active Learning for Data Mining from Conflict Text Corpora
di: Croicu, Mihai
Pubblicazione: (2024)
di: Croicu, Mihai
Pubblicazione: (2024)
Documenti analoghi
-
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
di: Fernando, Aloka, et al.
Pubblicazione: (2025) -
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
di: Ranathunga, Surangika, et al.
Pubblicazione: (2024) -
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
di: Fernando, Aloka, et al.
Pubblicazione: (2025) -
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
di: de Silva, Nisansa, et al.
Pubblicazione: (2026) -
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
di: Rathnayake, Charitha, et al.
Pubblicazione: (2024)