Constructing and Expanding Low-Resource and Underrepresented Parallel Datasets for Indonesian Local Languages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lopo, Joanito Agili, Tanone, Radius |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CIKMar: A Dual-Encoder Approach to Prompt-Based Reranking in Educational Dialogue Systems
par: Lopo, Joanito Agili, et autres
Publié: (2024)
par: Lopo, Joanito Agili, et autres
Publié: (2024)
ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026)
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026)
Improving Lexical Difficulty Prediction with Context-Aligned Contrastive Learning and Ridge Ensembling
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026)
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026)
Language Surgery in Multilingual Large Language Models
par: Lopo, Joanito Agili, et autres
Publié: (2025)
par: Lopo, Joanito Agili, et autres
Publié: (2025)
NusaMT-7B: Machine Translation for Low-Resource Indonesian Languages with Large Language Models
par: Tan, William, et autres
Publié: (2024)
par: Tan, William, et autres
Publié: (2024)
DriveThru: a Document Extraction Platform and Benchmark Datasets for Indonesian Local Language Archives
par: Farhansyah, Mohammad Rifqi, et autres
Publié: (2024)
par: Farhansyah, Mohammad Rifqi, et autres
Publié: (2024)
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR
par: Hasan, Md. Najib, et autres
Publié: (2026)
par: Hasan, Md. Najib, et autres
Publié: (2026)
LLM for Everyone: Representing the Underrepresented in Large Language Models
par: Cahyawijaya, Samuel
Publié: (2024)
par: Cahyawijaya, Samuel
Publié: (2024)
GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages
par: Gyamfi, Lawrence Adu, et autres
Publié: (2026)
par: Gyamfi, Lawrence Adu, et autres
Publié: (2026)
TULIP: Adapting Open-Source Large Language Models for Underrepresented Languages and Specialized Financial Tasks
par: Demirtaş, İrem, et autres
Publié: (2025)
par: Demirtaş, İrem, et autres
Publié: (2025)
Improving the quality of Web-mined Parallel Corpora of Low-Resource Languages using Debiasing Heuristics
par: Fernando, Aloka, et autres
Publié: (2025)
par: Fernando, Aloka, et autres
Publié: (2025)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
par: Monir, Nasser-Eddine, et autres
Publié: (2026)
par: Monir, Nasser-Eddine, et autres
Publié: (2026)
COPAL-ID: Indonesian Language Reasoning with Local Culture and Nuances
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2023)
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2023)
Building Dialogue Understanding Models for Low-resource Language Indonesian from Scratch
par: Di, Donglin, et autres
Publié: (2024)
par: Di, Donglin, et autres
Publié: (2024)
Adapting Language Models to Indonesian Local Languages: An Empirical Study of Language Transferability on Zero-Shot Settings
par: Putri, Rifki Afina
Publié: (2025)
par: Putri, Rifki Afina
Publié: (2025)
Automated Collection of Evaluation Dataset for Semantic Search in Low-Resource Domain Language
par: Zhukova, Anastasia, et autres
Publié: (2024)
par: Zhukova, Anastasia, et autres
Publié: (2024)
The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource Languages
par: Rajab, Jenalea, et autres
Publié: (2025)
par: Rajab, Jenalea, et autres
Publié: (2025)
mRAKL: Multilingual Retrieval-Augmented Knowledge Graph Construction for Low-Resourced Languages
par: Nigatu, Hellina Hailu, et autres
Publié: (2025)
par: Nigatu, Hellina Hailu, et autres
Publié: (2025)
CORE-ReID V2: Advancing the Domain Adaptation for Object Re-Identification with Optimized Training and Ensemble Fusion
par: Nguyen, Trinh Quoc, et autres
Publié: (2025)
par: Nguyen, Trinh Quoc, et autres
Publié: (2025)
From English-Centric to Effective Bilingual: LLMs with Custom Tokenizers for Underrepresented Languages
par: Kiulian, Artur, et autres
Publié: (2024)
par: Kiulian, Artur, et autres
Publié: (2024)
A fully automated and scalable Parallel Data Augmentation for Low Resource Languages using Image and Text Analytics
par: Sharma, Prawaal, et autres
Publié: (2025)
par: Sharma, Prawaal, et autres
Publié: (2025)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
par: Arisaputra, Panji, et autres
Publié: (2024)
par: Arisaputra, Panji, et autres
Publié: (2024)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
par: Merx, Raphaël, et autres
Publié: (2025)
par: Merx, Raphaël, et autres
Publié: (2025)
Pretraining Strategies using Monolingual and Parallel Data for Low-Resource Machine Translation
par: Nguefack, Idriss Nguepi, et autres
Publié: (2025)
par: Nguefack, Idriss Nguepi, et autres
Publié: (2025)
Semi-Synthetic Parallel Data for Translation Quality Estimation: A Case Study of Dataset Building for an Under-Resourced Language Pair
par: Siani, Assaf, et autres
Publié: (2026)
par: Siani, Assaf, et autres
Publié: (2026)
Uddessho: An Extensive Benchmark Dataset for Multimodal Author Intent Classification in Low-Resource Bangla Language
par: Faria, Fatema Tuj Johora, et autres
Publié: (2024)
par: Faria, Fatema Tuj Johora, et autres
Publié: (2024)
CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages
par: Zhuang, Wenhao, et autres
Publié: (2025)
par: Zhuang, Wenhao, et autres
Publié: (2025)
Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language
par: Wickramasinghe, Kasun, et autres
Publié: (2023)
par: Wickramasinghe, Kasun, et autres
Publié: (2023)
Efficacy of ByT5 in Multilingual Translation of Biblical Texts for Underrepresented Languages
par: Aars, Corinne, et autres
Publié: (2024)
par: Aars, Corinne, et autres
Publié: (2024)
Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpus
par: Ouzerrout, Samy
Publié: (2025)
par: Ouzerrout, Samy
Publié: (2025)
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
par: Zebaze, Armel, et autres
Publié: (2025)
par: Zebaze, Armel, et autres
Publié: (2025)
An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)
par: Burchell, Laurie, et autres
Publié: (2025)
par: Burchell, Laurie, et autres
Publié: (2025)
SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages
par: Ghazaryan, Gayane, et autres
Publié: (2024)
par: Ghazaryan, Gayane, et autres
Publié: (2024)
The Zeno's Paradox of `Low-Resource' Languages
par: Nigatu, Hellina Hailu, et autres
Publié: (2024)
par: Nigatu, Hellina Hailu, et autres
Publié: (2024)
Bootstrapping Embeddings for Low Resource Languages
par: Basoz, Merve, et autres
Publié: (2026)
par: Basoz, Merve, et autres
Publié: (2026)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Evaluating the Quality of Benchmark Datasets for Low-Resource Languages: A Case Study on Turkish
par: Cengiz, Ayşe Aysu, et autres
Publié: (2025)
par: Cengiz, Ayşe Aysu, et autres
Publié: (2025)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
par: Tonja, Atnafu Lambebo, et autres
Publié: (2024)
par: Tonja, Atnafu Lambebo, et autres
Publié: (2024)
Cross-Lingual Transfer for Distantly Supervised and Low-resources Indonesian NER
par: Ikhwantri, Fariz
Publié: (2019)
par: Ikhwantri, Fariz
Publié: (2019)
Documents similaires
-
CIKMar: A Dual-Encoder Approach to Prompt-Based Reranking in Educational Dialogue Systems
par: Lopo, Joanito Agili, et autres
Publié: (2024) -
ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026) -
Improving Lexical Difficulty Prediction with Context-Aligned Contrastive Learning and Ridge Ensembling
par: Muhamad, Wicaksono Leksono, et autres
Publié: (2026) -
Language Surgery in Multilingual Large Language Models
par: Lopo, Joanito Agili, et autres
Publié: (2025) -
NusaMT-7B: Machine Translation for Low-Resource Indonesian Languages with Large Language Models
par: Tan, William, et autres
Publié: (2024)