Improving Indigenous Language Machine Translation with Synthetic Data and Language-Specific Preprocessing
Fuente:
arXiv
Saved in:
| Main Authors: | Dhawan, Aashish, Driggers-Ellis, Christopher, Grant, Christan, Wang, Daisy Zhe |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
by: Dhawan, Aashish, et al.
Published: (2026)
by: Dhawan, Aashish, et al.
Published: (2026)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
by: Driggers-Ellis, Christopher, et al.
Published: (2025)
by: Driggers-Ellis, Christopher, et al.
Published: (2025)
RAMQA: A Unified Framework for Retrieval-Augmented Multi-Modal Question Answering
by: Bai, Yang, et al.
Published: (2025)
by: Bai, Yang, et al.
Published: (2025)
M3: A Multi-Task Mixed-Objective Learning Framework for Open-Domain Multi-Hop Dense Sentence Retrieval
by: Bai, Yang, et al.
Published: (2024)
by: Bai, Yang, et al.
Published: (2024)
Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment
by: Driggers-Ellis, Christopher, et al.
Published: (2026)
by: Driggers-Ellis, Christopher, et al.
Published: (2026)
Non-Fluent Synthetic Target-Language Data Improve Neural Machine Translation
by: Sánchez-Cartagena, Víctor M., et al.
Published: (2024)
by: Sánchez-Cartagena, Víctor M., et al.
Published: (2024)
Improving LLMs for Machine Translation Using Synthetic Preference Data
by: Vajda, Dario, et al.
Published: (2025)
by: Vajda, Dario, et al.
Published: (2025)
Sheffield's Submission to the AmericasNLP Shared Task on Machine Translation into Indigenous Languages
by: Gow-Smith, Edward, et al.
Published: (2023)
by: Gow-Smith, Edward, et al.
Published: (2023)
Learning-From-Mistakes Prompting for Indigenous Language Translation
by: Liao, You-Cheng, et al.
Published: (2024)
by: Liao, You-Cheng, et al.
Published: (2024)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
by: Okocha, Chibuzor, et al.
Published: (2025)
by: Okocha, Chibuzor, et al.
Published: (2025)
Domain-Aware Speaker Diarization On African-Accented English
by: Okocha, Chibuzor, et al.
Published: (2025)
by: Okocha, Chibuzor, et al.
Published: (2025)
WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data
by: Zhang, Ziheng, et al.
Published: (2026)
by: Zhang, Ziheng, et al.
Published: (2026)
Improving Multilingual Neural Machine Translation System for Indic Languages
by: Das, Sudhansu Bala, et al.
Published: (2022)
by: Das, Sudhansu Bala, et al.
Published: (2022)
Exploiting Domain-Specific Parallel Data on Multilingual Language Models for Low-resource Language Translation
by: Ranathungaa, Surangika, et al.
Published: (2024)
by: Ranathungaa, Surangika, et al.
Published: (2024)
Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text
by: Xiao, Bushi, et al.
Published: (2026)
by: Xiao, Bushi, et al.
Published: (2026)
Redefining Machine Translation on Social Network Services with Large Language Models
by: Guo, Hongcheng, et al.
Published: (2025)
by: Guo, Hongcheng, et al.
Published: (2025)
Exploring Intrinsic Language-specific Subspaces in Fine-tuning Multilingual Neural Machine Translation
by: Cao, Zhe, et al.
Published: (2024)
by: Cao, Zhe, et al.
Published: (2024)
Bias in LLMs as Annotators: The Effect of Party Cues on Labelling Decision by Large Language Models
by: Vera, Sebastian Vallejo, et al.
Published: (2024)
by: Vera, Sebastian Vallejo, et al.
Published: (2024)
Improving Language Transfer Capability of Decoder-only Architecture in Multilingual Neural Machine Translation
by: Qu, Zhi, et al.
Published: (2024)
by: Qu, Zhi, et al.
Published: (2024)
Jellyfish: A Large Language Model for Data Preprocessing
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Defining Boundaries: The Impact of Domain Specification on Cross-Language and Cross-Domain Transfer in Machine Translation
by: Shahnazaryan, Lia, et al.
Published: (2024)
by: Shahnazaryan, Lia, et al.
Published: (2024)
Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation
by: Geng, Xiang, et al.
Published: (2025)
by: Geng, Xiang, et al.
Published: (2025)
Simultaneous Machine Translation with Large Language Models
by: Wang, Minghan, et al.
Published: (2023)
by: Wang, Minghan, et al.
Published: (2023)
Machine Translation for Ge'ez Language
by: Wassie, Aman Kassahun
Published: (2023)
by: Wassie, Aman Kassahun
Published: (2023)
Statistical Machine Translation for Indic Languages
by: Das, Sudhansu Bala, et al.
Published: (2023)
by: Das, Sudhansu Bala, et al.
Published: (2023)
Can Uniform Meaning Representation Help GPT-4 Translate from Indigenous Languages?
by: Wein, Shira
Published: (2025)
by: Wein, Shira
Published: (2025)
Diacritic Restoration for Low-Resource Indigenous Languages: Case Study with Bribri and Cook Islands Māori
by: Coto-Solano, Rolando, et al.
Published: (2025)
by: Coto-Solano, Rolando, et al.
Published: (2025)
Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative Decoding
by: Zeng, Jiali, et al.
Published: (2023)
by: Zeng, Jiali, et al.
Published: (2023)
LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
by: Zebaze, Armel, et al.
Published: (2025)
by: Zebaze, Armel, et al.
Published: (2025)
A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives
by: Rao, Hanshu, et al.
Published: (2025)
by: Rao, Hanshu, et al.
Published: (2025)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
by: Shang, Yuzhe, et al.
Published: (2026)
by: Shang, Yuzhe, et al.
Published: (2026)
Open Language Data Initiative: Advancing Low-Resource Machine Translation for Karakalpak
by: Mamasaidov, Mukhammadsaid, et al.
Published: (2024)
by: Mamasaidov, Mukhammadsaid, et al.
Published: (2024)
Generative-Adversarial Networks for Low-Resource Language Data Augmentation in Machine Translation
by: Zeng, Linda
Published: (2024)
by: Zeng, Linda
Published: (2024)
Novel Preprocessing Technique for Data Embedding in Engineering Code Generation Using Large Language Model
by: Lin, Yu-Chen, et al.
Published: (2023)
by: Lin, Yu-Chen, et al.
Published: (2023)
Large Language Models as Annotators for Machine Translation Quality Estimation
by: Wang, Sidi, et al.
Published: (2026)
by: Wang, Sidi, et al.
Published: (2026)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
Evaluating Language Models as Synthetic Data Generators
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
Improving Clinical NLP Performance through Language Model-Generated Synthetic Clinical Data
by: Chen, Shan, et al.
Published: (2024)
by: Chen, Shan, et al.
Published: (2024)
Aligning Translation-Specific Understanding to General Understanding in Large Language Models
by: Huang, Yichong, et al.
Published: (2024)
by: Huang, Yichong, et al.
Published: (2024)
Relay Decoding: Concatenating Large Language Models for Machine Translation
by: Fu, Chengpeng, et al.
Published: (2024)
by: Fu, Chengpeng, et al.
Published: (2024)
Similar Items
-
Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
by: Dhawan, Aashish, et al.
Published: (2026) -
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
by: Driggers-Ellis, Christopher, et al.
Published: (2025) -
RAMQA: A Unified Framework for Retrieval-Augmented Multi-Modal Question Answering
by: Bai, Yang, et al.
Published: (2025) -
M3: A Multi-Task Mixed-Objective Learning Framework for Open-Domain Multi-Hop Dense Sentence Retrieval
by: Bai, Yang, et al.
Published: (2024) -
Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment
by: Driggers-Ellis, Christopher, et al.
Published: (2026)