SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
Fuente:
arXiv
Saved in:
| Main Authors: | Gurusinghe, Ranidu, Jayatilleke, Nevidu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
by: Lasandi, Minduli, et al.
Published: (2026)
by: Lasandi, Minduli, et al.
Published: (2026)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026)
by: Jayatilleke, Nevidu, et al.
Published: (2026)
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)
by: Sofalas, Johan, et al.
Published: (2026)
A Hybrid Architecture with Efficient Fine Tuning for Abstractive Patent Document Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Advancements in Natural Language Processing for Automatic Text Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
by: Nehrdich, Sebastian, et al.
Published: (2026)
by: Nehrdich, Sebastian, et al.
Published: (2026)
The Philosophy of Desire in the Buddhist Pali Canon
by: Webster, David
Published: (2025)
by: Webster, David
Published: (2025)
NSINA: A News Corpus for Sinhala
by: Hettiarachchi, Hansi, et al.
Published: (2024)
by: Hettiarachchi, Hansi, et al.
Published: (2024)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
by: Pramodya, Ashmari, et al.
Published: (2025)
by: Pramodya, Ashmari, et al.
Published: (2025)
A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks
by: Metzger, Máté, et al.
Published: (2026)
by: Metzger, Máté, et al.
Published: (2026)
Theorem Provers: One Size Fits All?
by: Oates, Harrison, et al.
Published: (2025)
by: Oates, Harrison, et al.
Published: (2025)
Linguistic Analysis of Sinhala YouTube Comments on Sinhala Music Videos: A Dataset Study
by: De Mel, W. M. Yomal, et al.
Published: (2025)
by: De Mel, W. M. Yomal, et al.
Published: (2025)
Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources
by: Sumanathilaka, Deshan, et al.
Published: (2025)
by: Sumanathilaka, Deshan, et al.
Published: (2025)
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025)
by: Aravinda, H. W. K., et al.
Published: (2025)
Swa Bhasha: Message-Based Singlish to Sinhala Transliteration
by: Athukorala, Maneesha U., et al.
Published: (2024)
by: Athukorala, Maneesha U., et al.
Published: (2024)
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026)
by: de Silva, Nisansa, et al.
Published: (2026)
Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala
by: Faumi, Nabeelah, et al.
Published: (2025)
by: Faumi, Nabeelah, et al.
Published: (2025)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
by: de Silva, Nisansa
Published: (2019)
by: de Silva, Nisansa
Published: (2019)
Creating an Aligned Corpus of Sound and Text: The Multimodal Corpus of Shakespeare and Milton
by: Agirrezabal, Manex
Published: (2024)
by: Agirrezabal, Manex
Published: (2024)
The SAMER Arabic Text Simplification Corpus
by: Alhafni, Bashar, et al.
Published: (2024)
by: Alhafni, Bashar, et al.
Published: (2024)
Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala
by: Haturusinghe, Shanilka, et al.
Published: (2025)
by: Haturusinghe, Shanilka, et al.
Published: (2025)
MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus
by: Du, Yexing, et al.
Published: (2026)
by: Du, Yexing, et al.
Published: (2026)
SOLD: Sinhala Offensive Language Dataset
by: Ranasinghe, Tharindu, et al.
Published: (2022)
by: Ranasinghe, Tharindu, et al.
Published: (2022)
From Outliers to Errors: Auditing Pali-to-English LLM Translations with Multi-Reference Adjudication
by: Metzger, Máté, et al.
Published: (2026)
by: Metzger, Máté, et al.
Published: (2026)
A Low-Resource Speech-Driven NLP Pipeline for Sinhala Dyslexia Assistance
by: Perera, Peshala, et al.
Published: (2025)
by: Perera, Peshala, et al.
Published: (2025)
EmoScan: Automatic Screening of Depression Symptoms in Romanized Sinhala Tweets
by: Hewapathirana, Jayathi, et al.
Published: (2024)
by: Hewapathirana, Jayathi, et al.
Published: (2024)
GeeSanBhava: Sentiment Tagged Sinhala Music Video Comment Data Set
by: De Mel, Yomal, et al.
Published: (2025)
by: De Mel, Yomal, et al.
Published: (2025)
PaliGemma: A versatile 3B VLM for transfer
by: Beyer, Lucas, et al.
Published: (2024)
by: Beyer, Lucas, et al.
Published: (2024)
ColPali: Efficient Document Retrieval with Vision Language Models
by: Faysse, Manuel, et al.
Published: (2024)
by: Faysse, Manuel, et al.
Published: (2024)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
by: Wickramasinghe, Kasun, et al.
Published: (2023)
by: Wickramasinghe, Kasun, et al.
Published: (2023)
PsihoRo: Depression and Anxiety Romanian Text Corpus
by: Ciobotaru, Alexandra, et al.
Published: (2026)
by: Ciobotaru, Alexandra, et al.
Published: (2026)
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
by: Rajapakse, Minuri, et al.
Published: (2026)
by: Rajapakse, Minuri, et al.
Published: (2026)
Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development
by: Asgari-Bidhendi, Majid, et al.
Published: (2025)
by: Asgari-Bidhendi, Majid, et al.
Published: (2025)
EMTeC: A Corpus of Eye Movements on Machine-Generated Texts
by: Bolliger, Lena Sophia, et al.
Published: (2024)
by: Bolliger, Lena Sophia, et al.
Published: (2024)
Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil
by: Kishanthan, Sukumar, et al.
Published: (2026)
by: Kishanthan, Sukumar, et al.
Published: (2026)
Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content
by: Rizvi, F. A., et al.
Published: (2025)
by: Rizvi, F. A., et al.
Published: (2025)
Similar Items
-
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025) -
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
by: Lasandi, Minduli, et al.
Published: (2026) -
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025) -
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026) -
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)