SiDiaC: Sinhala Diachronic Corpus
Fuente:
arXiv
Saved in:
| Main Authors: | Jayatilleke, Nevidu, de Silva, Nisansa |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026)
by: Jayatilleke, Nevidu, et al.
Published: (2026)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
by: Gurusinghe, Ranidu, et al.
Published: (2026)
by: Gurusinghe, Ranidu, et al.
Published: (2026)
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
by: Lasandi, Minduli, et al.
Published: (2026)
by: Lasandi, Minduli, et al.
Published: (2026)
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)
by: Sofalas, Johan, et al.
Published: (2026)
A Hybrid Architecture with Efficient Fine Tuning for Abstractive Patent Document Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
by: de Silva, Nisansa
Published: (2019)
by: de Silva, Nisansa
Published: (2019)
Advancements in Natural Language Processing for Automatic Text Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026)
by: de Silva, Nisansa, et al.
Published: (2026)
Linguistic Analysis of Sinhala YouTube Comments on Sinhala Music Videos: A Dataset Study
by: De Mel, W. M. Yomal, et al.
Published: (2025)
by: De Mel, W. M. Yomal, et al.
Published: (2025)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
by: Wickramasinghe, Kasun, et al.
Published: (2023)
by: Wickramasinghe, Kasun, et al.
Published: (2023)
GeeSanBhava: Sentiment Tagged Sinhala Music Video Comment Data Set
by: De Mel, Yomal, et al.
Published: (2025)
by: De Mel, Yomal, et al.
Published: (2025)
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025)
by: Aravinda, H. W. K., et al.
Published: (2025)
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
by: De Mel, Yomal, et al.
Published: (2024)
by: De Mel, Yomal, et al.
Published: (2024)
NSINA: A News Corpus for Sinhala
by: Hettiarachchi, Hansi, et al.
Published: (2024)
by: Hettiarachchi, Hansi, et al.
Published: (2024)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Selecting Seed Words for Wordle using Character Statistics
by: de Silva, Nisansa
Published: (2022)
by: de Silva, Nisansa
Published: (2022)
A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
How Good is BLI as an Alignment Measure: A Study in Word Embedding Paradigm
by: Wickramasinghe, Kasun, et al.
Published: (2025)
by: Wickramasinghe, Kasun, et al.
Published: (2025)
Fine Tuning Named Entity Extraction Models for the Fantasy Domain
by: Sivaganeshan, Aravinth, et al.
Published: (2024)
by: Sivaganeshan, Aravinth, et al.
Published: (2024)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
by: Pramodya, Ashmari, et al.
Published: (2025)
by: Pramodya, Ashmari, et al.
Published: (2025)
SHADE: Semantic Hypernym Annotator for Domain-specific Entities -- DnD Domain Use Case
by: Peiris, Akila, et al.
Published: (2024)
by: Peiris, Akila, et al.
Published: (2024)
Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts
by: Song, Seyoung, et al.
Published: (2025)
by: Song, Seyoung, et al.
Published: (2025)
Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources
by: Sumanathilaka, Deshan, et al.
Published: (2025)
by: Sumanathilaka, Deshan, et al.
Published: (2025)
DESS: DeBERTa Enhanced Syntactic-Semantic Aspect Sentiment Triplet Extraction
by: Thenuwara, Vishal, et al.
Published: (2025)
by: Thenuwara, Vishal, et al.
Published: (2025)
M2DS: Multilingual Dataset for Multi-document Summarisation
by: Hewapathirana, Kushan, et al.
Published: (2024)
by: Hewapathirana, Kushan, et al.
Published: (2024)
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Swa Bhasha: Message-Based Singlish to Sinhala Transliteration
by: Athukorala, Maneesha U., et al.
Published: (2024)
by: Athukorala, Maneesha U., et al.
Published: (2024)
Two Approaches to Diachronic Normalization of Polish Texts
by: Dudzic, Kacper, et al.
Published: (2024)
by: Dudzic, Kacper, et al.
Published: (2024)
Modelling the Diachronic Emergence of Phoneme Frequency Distributions
by: Martín, Fermín Moscoso del Prado, et al.
Published: (2026)
by: Martín, Fermín Moscoso del Prado, et al.
Published: (2026)
SOLD: Sinhala Offensive Language Dataset
by: Ranasinghe, Tharindu, et al.
Published: (2022)
by: Ranasinghe, Tharindu, et al.
Published: (2022)
Pretraining Language Models for Diachronic Linguistic Change Discovery
by: Fittschen, Elisabeth, et al.
Published: (2025)
by: Fittschen, Elisabeth, et al.
Published: (2025)
Turkronicles: Diachronic Resources for the Fast Evolving Turkish Language
by: Yazar, Togay, et al.
Published: (2024)
by: Yazar, Togay, et al.
Published: (2024)
Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala
by: Faumi, Nabeelah, et al.
Published: (2025)
by: Faumi, Nabeelah, et al.
Published: (2025)
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
by: Fernando, Aloka, et al.
Published: (2025)
by: Fernando, Aloka, et al.
Published: (2025)
LMSpell: Neural Spell Checking for Low-Resource Languages
by: Gunathilake, Akesh, et al.
Published: (2025)
by: Gunathilake, Akesh, et al.
Published: (2025)
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Analyzing Continuous Semantic Shifts with Diachronic Word Similarity Matrices
by: Kiyama, Hajime, et al.
Published: (2025)
by: Kiyama, Hajime, et al.
Published: (2025)
DELICATE: Diachronic Entity LInking using Classes And Temporal Evidence
by: Santini, Cristian, et al.
Published: (2025)
by: Santini, Cristian, et al.
Published: (2025)
Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala
by: Haturusinghe, Shanilka, et al.
Published: (2025)
by: Haturusinghe, Shanilka, et al.
Published: (2025)
Similar Items
-
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026) -
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025) -
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
by: Gurusinghe, Ranidu, et al.
Published: (2026) -
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
by: Lasandi, Minduli, et al.
Published: (2026) -
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)