A Multi-way Parallel Named Entity Annotated Corpus for English, Tamil and Sinhala
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ranathunga, Surangika, Ranasinghea, Asanka, Shamala, Janaka, Dandeniyaa, Ayodya, Galappaththia, Rashmi, Samaraweeraa, Malithi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
von: de Silva, Nisansa, et al.
Veröffentlicht: (2026)
von: de Silva, Nisansa, et al.
Veröffentlicht: (2026)
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
von: Fernando, Aloka, et al.
Veröffentlicht: (2025)
von: Fernando, Aloka, et al.
Veröffentlicht: (2025)
SinLlama -- A Large Language Model for Sinhala
von: Aravinda, H. W. K., et al.
Veröffentlicht: (2025)
von: Aravinda, H. W. K., et al.
Veröffentlicht: (2025)
SiTSE: Sinhala Text Simplification Dataset and Evaluation
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
von: De Mel, Yomal, et al.
Veröffentlicht: (2024)
von: De Mel, Yomal, et al.
Veröffentlicht: (2024)
Annotation Guidelines for Corpus Novelties: Part 1 -- Named Entity Recognition
von: Amalvy, Arthur, et al.
Veröffentlicht: (2024)
von: Amalvy, Arthur, et al.
Veröffentlicht: (2024)
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
von: Fernando, Aloka, et al.
Veröffentlicht: (2025)
von: Fernando, Aloka, et al.
Veröffentlicht: (2025)
A Corpus for Named Entity Recognition in Chinese Novels with Multi-genres
von: Zhao, Hanjie, et al.
Veröffentlicht: (2023)
von: Zhao, Hanjie, et al.
Veröffentlicht: (2023)
Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition
von: Hamad, Nagham, et al.
Veröffentlicht: (2025)
von: Hamad, Nagham, et al.
Veröffentlicht: (2025)
Shoulders of Giants: A Look at the Degree and Utility of Openness in NLP Research
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024)
SiDiaC: Sinhala Diachronic Corpus
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2025)
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2025)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
von: Puranegedara, Imalsha, et al.
Veröffentlicht: (2025)
von: Puranegedara, Imalsha, et al.
Veröffentlicht: (2025)
NSINA: A News Corpus for Sinhala
von: Hettiarachchi, Hansi, et al.
Veröffentlicht: (2024)
von: Hettiarachchi, Hansi, et al.
Veröffentlicht: (2024)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2025)
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2025)
Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil
von: Kishanthan, Sukumar, et al.
Veröffentlicht: (2026)
von: Kishanthan, Sukumar, et al.
Veröffentlicht: (2026)
Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization
von: Senath, Thevin, et al.
Veröffentlicht: (2024)
von: Senath, Thevin, et al.
Veröffentlicht: (2024)
Different Tastes of Entities: Investigating Human Label Variation in Named Entity Annotations
von: Peng, Siyao, et al.
Veröffentlicht: (2024)
von: Peng, Siyao, et al.
Veröffentlicht: (2024)
Generative Annotation for ASR Named Entity Correction
von: Luo, Yuanchang, et al.
Veröffentlicht: (2025)
von: Luo, Yuanchang, et al.
Veröffentlicht: (2025)
Korean Bio-Medical Corpus (KBMC) for Medical Named Entity Recognition
von: Byun, Sungjoo, et al.
Veröffentlicht: (2024)
von: Byun, Sungjoo, et al.
Veröffentlicht: (2024)
Cross-lingual Named Entity Corpus for Slavic Languages
von: Piskorski, Jakub, et al.
Veröffentlicht: (2024)
von: Piskorski, Jakub, et al.
Veröffentlicht: (2024)
Learning Nested Named Entity Recognition from Flat Annotations
von: Rozhkov, Igor, et al.
Veröffentlicht: (2026)
von: Rozhkov, Igor, et al.
Veröffentlicht: (2026)
LMSpell: Neural Spell Checking for Low-Resource Languages
von: Gunathilake, Akesh, et al.
Veröffentlicht: (2025)
von: Gunathilake, Akesh, et al.
Veröffentlicht: (2025)
Unsupervised Bilingual Lexicon Induction for Low Resource Languages
von: Rathnayake, Charitha, et al.
Veröffentlicht: (2024)
von: Rathnayake, Charitha, et al.
Veröffentlicht: (2024)
ParaNames 1.0: Creating an Entity Name Corpus for 400+ Languages using Wikidata
von: Sälevä, Jonne, et al.
Veröffentlicht: (2024)
von: Sälevä, Jonne, et al.
Veröffentlicht: (2024)
SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts
von: Lasandi, Minduli, et al.
Veröffentlicht: (2026)
von: Lasandi, Minduli, et al.
Veröffentlicht: (2026)
SinFoS: A Parallel Dataset for Translating Sinhala Figures of Speech
von: Sofalas, Johan, et al.
Veröffentlicht: (2026)
von: Sofalas, Johan, et al.
Veröffentlicht: (2026)
Do "English" Named Entity Recognizers Work Well on Global Englishes?
von: Shan, Alexander, et al.
Veröffentlicht: (2024)
von: Shan, Alexander, et al.
Veröffentlicht: (2024)
Beyond Vanilla Fine-Tuning: Leveraging Multistage, Multilingual, and Domain-Specific Methods for Low-Resource Machine Translation
von: Thillainathan, Sarubi, et al.
Veröffentlicht: (2025)
von: Thillainathan, Sarubi, et al.
Veröffentlicht: (2025)
SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali
von: Gurusinghe, Ranidu, et al.
Veröffentlicht: (2026)
von: Gurusinghe, Ranidu, et al.
Veröffentlicht: (2026)
Stylomech: Unveiling Authorship via Computational Stylometry in English and Romanized Sinhala
von: Faumi, Nabeelah, et al.
Veröffentlicht: (2025)
von: Faumi, Nabeelah, et al.
Veröffentlicht: (2025)
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models
von: Hameed, Sameeah Noreen, et al.
Veröffentlicht: (2025)
von: Hameed, Sameeah Noreen, et al.
Veröffentlicht: (2025)
Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction
von: Chanthran, Mohan Raj, et al.
Veröffentlicht: (2024)
von: Chanthran, Mohan Raj, et al.
Veröffentlicht: (2024)
SiDiaC-v.2.0: Sinhala Diachronic Corpus Version 2.0
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2026)
von: Jayatilleke, Nevidu, et al.
Veröffentlicht: (2026)
PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare
von: Al-Sabbagh, Rania
Veröffentlicht: (2025)
von: Al-Sabbagh, Rania
Veröffentlicht: (2025)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
von: Pramodya, Ashmari, et al.
Veröffentlicht: (2025)
von: Pramodya, Ashmari, et al.
Veröffentlicht: (2025)
Unlocking Parameter-Efficient Fine-Tuning for Low-Resource Language Translation
von: Su, Tong, et al.
Veröffentlicht: (2024)
von: Su, Tong, et al.
Veröffentlicht: (2024)
OasisSimp: An Open-source Asian-English Sentence Simplification Dataset
von: Liu, Hannah, et al.
Veröffentlicht: (2026)
von: Liu, Hannah, et al.
Veröffentlicht: (2026)
PICLe: Pseudo-Annotations for In-Context Learning in Low-Resource Named Entity Detection
von: Mamooler, Sepideh, et al.
Veröffentlicht: (2024)
von: Mamooler, Sepideh, et al.
Veröffentlicht: (2024)
A Framework to Assess Multilingual Vulnerabilities of LLMs
von: Tang, Likai, et al.
Veröffentlicht: (2025)
von: Tang, Likai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Sinhala Physical Common Sense Reasoning Dataset for Global PIQA
von: de Silva, Nisansa, et al.
Veröffentlicht: (2026) -
Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages
von: Fernando, Aloka, et al.
Veröffentlicht: (2025) -
SinLlama -- A Large Language Model for Sinhala
von: Aravinda, H. W. K., et al.
Veröffentlicht: (2025) -
SiTSE: Sinhala Text Simplification Dataset and Evaluation
von: Ranathunga, Surangika, et al.
Veröffentlicht: (2024) -
Sinhala Transliteration: A Comparative Analysis Between Rule-based and Seq2Seq Approaches
von: De Mel, Yomal, et al.
Veröffentlicht: (2024)