Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | D, Anusha M, Vikram, Deepthi, Chakravarthi, Bharathi Raja, Hegde, Parameshwar R |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language
par: Devadiga, Prathamesh, et autres
Publié: (2026)
par: Devadiga, Prathamesh, et autres
Publié: (2026)
A Tulu Resource for Machine Translation
par: Narayanan, Manu, et autres
Publié: (2024)
par: Narayanan, Manu, et autres
Publié: (2024)
Tulu 3: Pushing Frontiers in Open Language Model Post-Training
par: Lambert, Nathan, et autres
Publié: (2024)
par: Lambert, Nathan, et autres
Publié: (2024)
Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala
par: Haturusinghe, Shanilka, et autres
Publié: (2025)
par: Haturusinghe, Shanilka, et autres
Publié: (2025)
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)
par: Dmonte, Alphaeus, et autres
Publié: (2024)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
par: Joshi, Raviraj, et autres
Publié: (2024)
par: Joshi, Raviraj, et autres
Publié: (2024)
Overcoming Copyright Barriers in Corpus Distribution Through Non-Reversible Hashing
par: Amalvy, Arthur, et autres
Publié: (2026)
par: Amalvy, Arthur, et autres
Publié: (2026)
Tulu 3: Pushing Frontiers in Open Language Model Post-Training
par: Lambert, N., et autres
Publié: (2025)
par: Lambert, N., et autres
Publié: (2025)
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
par: Krsteski, Stefan, et autres
Publié: (2025)
par: Krsteski, Stefan, et autres
Publié: (2025)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
par: Yadav, Sumit, et autres
Publié: (2025)
par: Yadav, Sumit, et autres
Publié: (2025)
OffensiveLang: A Community Based Implicit Offensive Language Dataset
par: Das, Amit, et autres
Publié: (2024)
par: Das, Amit, et autres
Publié: (2024)
A Federated Learning Approach to Privacy Preserving Offensive Language Identification
par: Zampieri, Marcos, et autres
Publié: (2024)
par: Zampieri, Marcos, et autres
Publié: (2024)
Overcoming Data Scarcity in Generative Language Modelling for Low-Resource Languages: A Systematic Review
par: McGiff, Josh, et autres
Publié: (2025)
par: McGiff, Josh, et autres
Publié: (2025)
Systematic Offensive Stereotyping (SOS) Bias in Language Models
par: Elsafoury, Fatma
Publié: (2023)
par: Elsafoury, Fatma
Publié: (2023)
GlotLID: Language Identification for Low-Resource Languages
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
Enhancing Neural Machine Translation of Low-Resource Languages: Corpus Development, Human Evaluation and Explainable AI Architectures
par: Lankford, Séamus
Publié: (2024)
par: Lankford, Séamus
Publié: (2024)
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Is Semi-Automatic Transcription Useful in Corpus Creation? Preliminary Considerations on the KIParla Corpus
par: Simonotti, Martina, et autres
Publié: (2026)
par: Simonotti, Martina, et autres
Publié: (2026)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
par: Shao, Rulin, et autres
Publié: (2025)
par: Shao, Rulin, et autres
Publié: (2025)
DarijaBanking: A New Resource for Overcoming Language Barriers in Banking Intent Detection for Moroccan Arabic Speakers
par: Skiredj, Abderrahman, et autres
Publié: (2024)
par: Skiredj, Abderrahman, et autres
Publié: (2024)
Bridge-Coder: Unlocking LLMs' Potential to Overcome Language Gaps in Low-Resource Code
par: Zhang, Jipeng, et autres
Publié: (2024)
par: Zhang, Jipeng, et autres
Publié: (2024)
Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation: A Systematic Study
par: Paul, Rakesh, et autres
Publié: (2025)
par: Paul, Rakesh, et autres
Publié: (2025)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
par: Monir, Nasser-Eddine, et autres
Publié: (2026)
par: Monir, Nasser-Eddine, et autres
Publié: (2026)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Multi-Hypothesis Distillation of Multilingual Neural Translation Models for Low-Resource Languages
par: Galiano-Jiménez, Aarón, et autres
Publié: (2025)
par: Galiano-Jiménez, Aarón, et autres
Publié: (2025)
Arabic Offensive Language Detection with Attention-based Deep Neural Networks
par: Bushr Haddad, et autres
Publié: (2020)
par: Bushr Haddad, et autres
Publié: (2020)
Detection and Analysis of Offensive Online Content in Hausa Language
par: Adam, Fatima Muhammad, et autres
Publié: (2023)
par: Adam, Fatima Muhammad, et autres
Publié: (2023)
Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus
par: Arabov, Mullosharaf K.
Publié: (2026)
par: Arabov, Mullosharaf K.
Publié: (2026)
WOLI at SemEval-2020 Task 12: Arabic Offensive Language Identification on Different Twitter Datasets
par: Otiefy, Yasser, et autres
Publié: (2020)
par: Otiefy, Yasser, et autres
Publié: (2020)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
par: Merx, Raphaël, et autres
Publié: (2025)
par: Merx, Raphaël, et autres
Publié: (2025)
LMSpell: Neural Spell Checking for Low-Resource Languages
par: Gunathilake, Akesh, et autres
Publié: (2025)
par: Gunathilake, Akesh, et autres
Publié: (2025)
Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection
par: He, Jianfei, et autres
Publié: (2024)
par: He, Jianfei, et autres
Publié: (2024)
Enabling ASR for Low-Resource Languages: A Comprehensive Dataset Creation Approach
par: Yeroyan, Ara, et autres
Publié: (2024)
par: Yeroyan, Ara, et autres
Publié: (2024)
Offensive Language Detection on Social Media Using XLNet
par: Alothman, Reem, et autres
Publié: (2025)
par: Alothman, Reem, et autres
Publié: (2025)
Zero-shot Cross-lingual Stance Detection via Adversarial Language Adaptation
par: A, Bharathi, et autres
Publié: (2024)
par: A, Bharathi, et autres
Publié: (2024)
SOLD: Sinhala Offensive Language Dataset
par: Ranasinghe, Tharindu, et autres
Publié: (2022)
par: Ranasinghe, Tharindu, et autres
Publié: (2022)
Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive
par: Weerasooriya, Tharindu Cyril, et autres
Publié: (2023)
par: Weerasooriya, Tharindu Cyril, et autres
Publié: (2023)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
par: Morabito, Robert, et autres
Publié: (2024)
par: Morabito, Robert, et autres
Publié: (2024)
Pashto Common Voice: Building the First Open Speech Corpus for a 60-Million-Speaker Low-Resource Language
par: Rahman, Hanif, et autres
Publié: (2026)
par: Rahman, Hanif, et autres
Publié: (2026)
SmolTulu: Higher Learning Rate to Batch Size Ratios Can Lead to Better Reasoning in SLMs
par: Alrashed, Sultan
Publié: (2024)
par: Alrashed, Sultan
Publié: (2024)
Documents similaires
-
Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language
par: Devadiga, Prathamesh, et autres
Publié: (2026) -
A Tulu Resource for Machine Translation
par: Narayanan, Manu, et autres
Publié: (2024) -
Tulu 3: Pushing Frontiers in Open Language Model Post-Training
par: Lambert, Nathan, et autres
Publié: (2024) -
Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala
par: Haturusinghe, Shanilka, et autres
Publié: (2025) -
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)