Saved in:
| Main Authors: | Ranathunga, Surangika, Ranasinghea, Asanka, Shamala, Janaka, Dandeniyaa, Ayodya, Galappaththia, Rashmi, Samaraweeraa, Malithi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2412.02056 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026)
by: de Silva, Nisansa, et al.
Published: (2026)
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
by: Fernando, Aloka, et al.
Published: (2025)
by: Fernando, Aloka, et al.
Published: (2025)
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025)
by: Aravinda, H. W. K., et al.
Published: (2025)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
by: De Mel, Yomal, et al.
Published: (2024)
by: De Mel, Yomal, et al.
Published: (2024)
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
by: Fernando, Aloka, et al.
Published: (2025)
by: Fernando, Aloka, et al.
Published: (2025)
Annotation Guidelines for Corpus Novelties: Part 1 -- Named Entity Recognition
by: Amalvy, Arthur, et al.
Published: (2024)
by: Amalvy, Arthur, et al.
Published: (2024)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
by: Puranegedara, Imalsha, et al.
Published: (2025)
by: Puranegedara, Imalsha, et al.
Published: (2025)
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
A Corpus for Named Entity Recognition in Chinese Novels with Multi-genres
by: Zhao, Hanjie, et al.
Published: (2023)
by: Zhao, Hanjie, et al.
Published: (2023)
NSINA: A News Corpus for Sinhala
by: Hettiarachchi, Hansi, et al.
Published: (2024)
by: Hettiarachchi, Hansi, et al.
Published: (2024)
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition
by: Hamad, Nagham, et al.
Published: (2025)
by: Hamad, Nagham, et al.
Published: (2025)
Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization
by: Senath, Thevin, et al.
Published: (2024)
by: Senath, Thevin, et al.
Published: (2024)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil
by: Kishanthan, Sukumar, et al.
Published: (2026)
by: Kishanthan, Sukumar, et al.
Published: (2026)
LMSpell: Neural Spell Checking for Low-Resource Languages
by: Gunathilake, Akesh, et al.
Published: (2025)
by: Gunathilake, Akesh, et al.
Published: (2025)
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
by: Rathnayake, Charitha, et al.
Published: (2024)
by: Rathnayake, Charitha, et al.
Published: (2024)
Cross-lingual Named Entity Corpus for Slavic Languages
by: Piskorski, Jakub, et al.
Published: (2024)
by: Piskorski, Jakub, et al.
Published: (2024)
Beyond Vanilla Fine-Tuning: Leveraging Multistage, Multilingual, and Domain-Specific Methods for Low-Resource Machine Translation
by: Thillainathan, Sarubi, et al.
Published: (2025)
by: Thillainathan, Sarubi, et al.
Published: (2025)
Generative Annotation for ASR Named Entity Correction
by: Luo, Yuanchang, et al.
Published: (2025)
by: Luo, Yuanchang, et al.
Published: (2025)
Korean Bio-Medical Corpus (KBMC) for Medical Named Entity Recognition
by: Byun, Sungjoo, et al.
Published: (2024)
by: Byun, Sungjoo, et al.
Published: (2024)
Different Tastes of Entities: Investigating Human Label Variation in Named Entity Annotations
by: Peng, Siyao, et al.
Published: (2024)
by: Peng, Siyao, et al.
Published: (2024)
ParaNames 1.0: Creating an Entity Name Corpus for 400+ Languages using Wikidata
by: Sälevä, Jonne, et al.
Published: (2024)
by: Sälevä, Jonne, et al.
Published: (2024)
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models
by: Hameed, Sameeah Noreen, et al.
Published: (2025)
by: Hameed, Sameeah Noreen, et al.
Published: (2025)
Learning Nested Named Entity Recognition from Flat Annotations
by: Rozhkov, Igor, et al.
Published: (2026)
by: Rozhkov, Igor, et al.
Published: (2026)
Do "English" Named Entity Recognizers Work Well on Global Englishes?
by: Shan, Alexander, et al.
Published: (2024)
by: Shan, Alexander, et al.
Published: (2024)
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
by: Lasandi, Minduli, et al.
Published: (2026)
by: Lasandi, Minduli, et al.
Published: (2026)
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)
by: Sofalas, Johan, et al.
Published: (2026)
Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation
by: Su, Tong, et al.
Published: (2024)
by: Su, Tong, et al.
Published: (2024)
A Framework to Assess Multilingual Vulnerabilities of LLMs
by: Tang, Likai, et al.
Published: (2025)
by: Tang, Likai, et al.
Published: (2025)
OasisSimp: An Open-source Asian-English Sentence Simplification Dataset
by: Liu, Hannah, et al.
Published: (2026)
by: Liu, Hannah, et al.
Published: (2026)
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
by: Gurusinghe, Ranidu, et al.
Published: (2026)
by: Gurusinghe, Ranidu, et al.
Published: (2026)
Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala
by: Faumi, Nabeelah, et al.
Published: (2025)
by: Faumi, Nabeelah, et al.
Published: (2025)
PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare
by: Al-Sabbagh, Rania
Published: (2025)
by: Al-Sabbagh, Rania
Published: (2025)
Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction
by: Chanthran, Mohan Raj, et al.
Published: (2024)
by: Chanthran, Mohan Raj, et al.
Published: (2024)
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026)
by: Jayatilleke, Nevidu, et al.
Published: (2026)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
by: Pramodya, Ashmari, et al.
Published: (2025)
by: Pramodya, Ashmari, et al.
Published: (2025)
PICLe: Pseudo-Annotations for In-Context Learning in Low-Resource Named Entity Detection
by: Mamooler, Sepideh, et al.
Published: (2024)
by: Mamooler, Sepideh, et al.
Published: (2024)
Similar Items
-
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026) -
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
by: Fernando, Aloka, et al.
Published: (2025) -
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025) -
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024) -
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
by: De Mel, Yomal, et al.
Published: (2024)