Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Haturusinghe, Shanilka, Weerasooriya, Tharindu Cyril, Zampieri, Marcos, Homan, Christopher M., Liyanage, S. R. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive
par: Weerasooriya, Tharindu Cyril, et autres
Publié: (2023)
par: Weerasooriya, Tharindu Cyril, et autres
Publié: (2023)
SOLD: Sinhala Offensive Language Dataset
par: Ranasinghe, Tharindu, et autres
Publié: (2022)
par: Ranasinghe, Tharindu, et autres
Publié: (2022)
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)
par: Dmonte, Alphaeus, et autres
Publié: (2024)
A Federated Learning Approach to Privacy Preserving Offensive Language Identification
par: Zampieri, Marcos, et autres
Publié: (2024)
par: Zampieri, Marcos, et autres
Publié: (2024)
ARTICLE: Annotator Reliability Through In-Context Learning
par: Dutta, Sujan, et autres
Publié: (2024)
par: Dutta, Sujan, et autres
Publié: (2024)
Rater Cohesion and Quality from a Vicarious Perspective
par: Pandita, Deepak, et autres
Publié: (2024)
par: Pandita, Deepak, et autres
Publié: (2024)
Learning Who Disagrees: Demographic Importance Weighting for Modeling Annotator Distributions with DiADEM
par: Shetty, Samay U., et autres
Publié: (2026)
par: Shetty, Samay U., et autres
Publié: (2026)
LPI-RIT at LeWiDi-2025: Improving Distributional Predictions via Metadata and Loss Reweighting with DisCo
par: Sawkar, Mandira, et autres
Publié: (2025)
par: Sawkar, Mandira, et autres
Publié: (2025)
SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala
par: Pramodya, Ashmari, et autres
Publié: (2025)
par: Pramodya, Ashmari, et autres
Publié: (2025)
Grammatical Error Correction for Low-Resource Languages: The Case of Zarma
par: Keita, Mamadou K., et autres
Publié: (2024)
par: Keita, Mamadou K., et autres
Publié: (2024)
Blind Spot Navigation in Large Language Model Reasoning with Thought Space Explorer
par: Zhang, Jinghan, et autres
Publié: (2024)
par: Zhang, Jinghan, et autres
Publié: (2024)
Exploring the Performance of Large Language Models on Subjective Span Identification Tasks
par: Dmonte, Alphaeus, et autres
Publié: (2026)
par: Dmonte, Alphaeus, et autres
Publié: (2026)
ProRefine: Inference-Time Prompt Refinement with Textual Feedback
par: Pandita, Deepak, et autres
Publié: (2025)
par: Pandita, Deepak, et autres
Publié: (2025)
ALEXSIS-PT: A New Resource for Portuguese Lexical Simplification
par: North, Kai, et autres
Publié: (2022)
par: North, Kai, et autres
Publié: (2022)
A Survey on Multilingual Mental Disorders Detection from Social Media Data
par: Bucur, Ana-Maria, et autres
Publié: (2025)
par: Bucur, Ana-Maria, et autres
Publié: (2025)
Temporal Text Classification with Large Language Models
par: Raihan, Nishat, et autres
Publié: (2026)
par: Raihan, Nishat, et autres
Publié: (2026)
A Survey of Multimodal Sarcasm Detection
par: Farabi, Shafkat, et autres
Publié: (2024)
par: Farabi, Shafkat, et autres
Publié: (2024)
NSINA: A News Corpus for Sinhala
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
TigerLLM - A Family of Bangla Large Language Models
par: Raihan, Nishat, et autres
Publié: (2025)
par: Raihan, Nishat, et autres
Publié: (2025)
MultiLS: A Multi-task Lexical Simplification Framework
par: North, Kai, et autres
Publié: (2024)
par: North, Kai, et autres
Publié: (2024)
SinLlama -- A Large Language Model for Sinhala
par: Aravinda, H. W. K., et autres
Publié: (2025)
par: Aravinda, H. W. K., et autres
Publié: (2025)
Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil
par: Kishanthan, Sukumar, et autres
Publié: (2026)
par: Kishanthan, Sukumar, et autres
Publié: (2026)
MojoBench: Language Modeling and Benchmarks for Mojo
par: Raihan, Nishat, et autres
Publié: (2024)
par: Raihan, Nishat, et autres
Publié: (2024)
Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification
par: D, Anusha M, et autres
Publié: (2025)
par: D, Anusha M, et autres
Publié: (2025)
Detection and Analysis of Offensive Online Content in Hausa Language
par: Adam, Fatima Muhammad, et autres
Publié: (2023)
par: Adam, Fatima Muhammad, et autres
Publié: (2023)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
par: Raihan, Nishat, et autres
Publié: (2024)
par: Raihan, Nishat, et autres
Publié: (2024)
Guided Distant Supervision for Multilingual Relation Extraction Data: Adapting to a New Language
par: Plum, Alistair, et autres
Publié: (2024)
par: Plum, Alistair, et autres
Publié: (2024)
A Taxonomy of Programming Languages for Code Generation
par: Raihan, Nishat, et autres
Publié: (2026)
par: Raihan, Nishat, et autres
Publié: (2026)
OffensiveLang: A Community Based Implicit Offensive Language Dataset
par: Das, Amit, et autres
Publié: (2024)
par: Das, Amit, et autres
Publié: (2024)
Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection
par: He, Jianfei, et autres
Publié: (2024)
par: He, Jianfei, et autres
Publié: (2024)
Zero-shot OCR Accuracy of Low-Resourced Languages: A Comparative Analysis on Sinhala and Tamil
par: Jayatilleke, Nevidu, et autres
Publié: (2025)
par: Jayatilleke, Nevidu, et autres
Publié: (2025)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
par: Wickramasinghe, Kasun, et autres
Publié: (2023)
par: Wickramasinghe, Kasun, et autres
Publié: (2023)
AdaptBPE: From General Purpose to Specialized Tokenizers
par: Liyanage, Vijini, et autres
Publié: (2026)
par: Liyanage, Vijini, et autres
Publié: (2026)
Offensive Language Detection on Social Media Using XLNet
par: Alothman, Reem, et autres
Publié: (2025)
par: Alothman, Reem, et autres
Publié: (2025)
Systematic Offensive Stereotyping (SOS) Bias in Language Models
par: Elsafoury, Fatma
Publié: (2023)
par: Elsafoury, Fatma
Publié: (2023)
Investigating the Impact of Semi-Supervised Methods with Data Augmentation on Offensive Language Detection in Romanian Language
par: Nicola, Elena-Beatrice, et autres
Publié: (2024)
par: Nicola, Elena-Beatrice, et autres
Publié: (2024)
Chinese Offensive Language Detection:Current Status and Future Directions
par: Xiao, Yunze, et autres
Publié: (2024)
par: Xiao, Yunze, et autres
Publié: (2024)
Survey on Publicly Available Sinhala Natural Language Processing Tools and Research
par: de Silva, Nisansa
Publié: (2019)
par: de Silva, Nisansa
Publié: (2019)
Lost in Pronunciation: Detecting Chinese Offensive Language Disguised by Phonetic Cloaking Replacement
par: Guo, Haotan, et autres
Publié: (2025)
par: Guo, Haotan, et autres
Publié: (2025)
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
par: Rajapakse, Minuri, et autres
Publié: (2026)
par: Rajapakse, Minuri, et autres
Publié: (2026)
Documents similaires
-
Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive
par: Weerasooriya, Tharindu Cyril, et autres
Publié: (2023) -
SOLD: Sinhala Offensive Language Dataset
par: Ranasinghe, Tharindu, et autres
Publié: (2022) -
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024) -
A Federated Learning Approach to Privacy Preserving Offensive Language Identification
par: Zampieri, Marcos, et autres
Publié: (2024) -
ARTICLE: Annotator Reliability Through In-Context Learning
par: Dutta, Sujan, et autres
Publié: (2024)