SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
Fuente:
arXiv
Saved in:
| Main Authors: | Lasandi, Minduli, Jayatilleke, Nevidu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
by: Gurusinghe, Ranidu, et al.
Published: (2026)
by: Gurusinghe, Ranidu, et al.
Published: (2026)
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026)
by: Sofalas, Johan, et al.
Published: (2026)
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026)
by: Jayatilleke, Nevidu, et al.
Published: (2026)
A Hybrid Architecture with Efficient Fine Tuning for Abstractive Patent Document Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
Advancements in Natural Language Processing for Automatic Text Summarization
by: Jayatilleke, Nevidu, et al.
Published: (2025)
by: Jayatilleke, Nevidu, et al.
Published: (2025)
NSINA: A News Corpus for Sinhala
by: Hettiarachchi, Hansi, et al.
Published: (2024)
by: Hettiarachchi, Hansi, et al.
Published: (2024)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
by: Pramodya, Ashmari, et al.
Published: (2025)
by: Pramodya, Ashmari, et al.
Published: (2025)
The Russian Legislative Corpus
by: Saveliev, Denis, et al.
Published: (2024)
by: Saveliev, Denis, et al.
Published: (2024)
A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Linguistic Analysis of Sinhala YouTube Comments on Sinhala Music Videos: A Dataset Study
by: De Mel, W. M. Yomal, et al.
Published: (2025)
by: De Mel, W. M. Yomal, et al.
Published: (2025)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources
by: Sumanathilaka, Deshan, et al.
Published: (2025)
by: Sumanathilaka, Deshan, et al.
Published: (2025)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
by: Xu, Xinzhe, et al.
Published: (2025)
by: Xu, Xinzhe, et al.
Published: (2025)
Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content
by: Rizvi, F. A., et al.
Published: (2025)
by: Rizvi, F. A., et al.
Published: (2025)
JUÁ -- A Benchmark for Information Retrieval in Brazilian Legal Text Collections
by: Pereira, Jayr, et al.
Published: (2026)
by: Pereira, Jayr, et al.
Published: (2026)
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
by: Rajapakse, Minuri, et al.
Published: (2026)
by: Rajapakse, Minuri, et al.
Published: (2026)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
by: Wickramasinghe, Kasun, et al.
Published: (2023)
by: Wickramasinghe, Kasun, et al.
Published: (2023)
SinLlama -- A Large Language Model for Sinhala
by: Aravinda, H. W. K., et al.
Published: (2025)
by: Aravinda, H. W. K., et al.
Published: (2025)
Low-resource Information Extraction with the European Clinical Case Corpus
by: Ghosh, Soumitra, et al.
Published: (2025)
by: Ghosh, Soumitra, et al.
Published: (2025)
CHisIEC: An Information Extraction Corpus for Ancient Chinese History
by: Tang, Xuemei, et al.
Published: (2024)
by: Tang, Xuemei, et al.
Published: (2024)
LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases
by: Cai, Yida, et al.
Published: (2025)
by: Cai, Yida, et al.
Published: (2025)
NESTLE: a No-Code Tool for Statistical Analysis of Legal Corpus
by: Cho, Kyoungyeon, et al.
Published: (2023)
by: Cho, Kyoungyeon, et al.
Published: (2023)
Data Augmented Pipeline for Legal Information Extraction and Reasoning
by: Phuong, Nguyen Minh, et al.
Published: (2026)
by: Phuong, Nguyen Minh, et al.
Published: (2026)
Algorithm for Automatic Legislative Text Consolidation
by: Etcheverry, Matias, et al.
Published: (2025)
by: Etcheverry, Matias, et al.
Published: (2025)
Swa Bhasha: Message-Based Singlish to Sinhala Transliteration
by: Athukorala, Maneesha U., et al.
Published: (2024)
by: Athukorala, Maneesha U., et al.
Published: (2024)
PubMedCausal: A Span-Level Annotated Corpus for Causal Relation Extraction in Biomedical Text
by: Kunle-John, Ifeoluwa, et al.
Published: (2026)
by: Kunle-John, Ifeoluwa, et al.
Published: (2026)
LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text
by: yunhan, Li, et al.
Published: (2025)
by: yunhan, Li, et al.
Published: (2025)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
by: Lu, Zhiyuan, et al.
Published: (2026)
by: Lu, Zhiyuan, et al.
Published: (2026)
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
by: de Silva, Nisansa, et al.
Published: (2026)
by: de Silva, Nisansa, et al.
Published: (2026)
The Cambridge Law Corpus: A Dataset for Legal AI Research
by: Östling, Andreas, et al.
Published: (2023)
by: Östling, Andreas, et al.
Published: (2023)
A Benchmark Corpus and Neural Approach for Sanskrit Derivative Nouns Analysis
by: Singh, Arun Kumar, et al.
Published: (2020)
by: Singh, Arun Kumar, et al.
Published: (2020)
LegalViz: Legal Text Visualization by Text To Diagram Generation
by: Onami, Eri, et al.
Published: (2025)
by: Onami, Eri, et al.
Published: (2025)
GreekBarBench: A Challenging Benchmark for Free-Text Legal Reasoning and Citations
by: Chlapanis, Odysseas S., et al.
Published: (2025)
by: Chlapanis, Odysseas S., et al.
Published: (2025)
HLDC: Hindi Legal Documents Corpus
by: Kapoor, Arnav, et al.
Published: (2022)
by: Kapoor, Arnav, et al.
Published: (2022)
Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala
by: Faumi, Nabeelah, et al.
Published: (2025)
by: Faumi, Nabeelah, et al.
Published: (2025)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
by: de Silva, Nisansa
Published: (2019)
by: de Silva, Nisansa
Published: (2019)
Creating an Aligned Corpus of Sound and Text: The Multimodal Corpus of Shakespeare and Milton
by: Agirrezabal, Manex
Published: (2024)
by: Agirrezabal, Manex
Published: (2024)
Enhancing Multilingual Sentiment Analysis with Explainability for Sinhala, English, and Code-Mixed Content
by: Rizvi, Azmarah, et al.
Published: (2025)
by: Rizvi, Azmarah, et al.
Published: (2025)
Similar Items
-
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
by: Gurusinghe, Ranidu, et al.
Published: (2026) -
SiDiaC: Sinhala Diachronic Corpus
by: Jayatilleke, Nevidu, et al.
Published: (2025) -
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
by: Jayatilleke, Nevidu, et al.
Published: (2025) -
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
by: Sofalas, Johan, et al.
Published: (2026) -
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
by: Jayatilleke, Nevidu, et al.
Published: (2026)