KazParC: Kazakh Parallel Corpus for Machine Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yeshpanov, Rustem, Polonskaya, Alina, Varol, Huseyin Atakan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KazSAnDRA: Kazakh Sentiment Analysis Dataset of Reviews and Attitudes
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
por: Abilbekov, Adal, et al.
Publicado: (2024)
por: Abilbekov, Adal, et al.
Publicado: (2024)
KazQAD: Kazakh Open-Domain Question Answering Dataset
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
100,000+ Movie Reviews from Kazakhstan: Russian, Kazakh, and Code-Switched Texts
por: Yeshpanov, Rustem
Publicado: (2026)
por: Yeshpanov, Rustem
Publicado: (2026)
Using Songs to Improve Kazakh Automatic Speech Recognition
por: Yeshpanov, Rustem
Publicado: (2026)
por: Yeshpanov, Rustem
Publicado: (2026)
KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan
por: Togmanov, Mukhammed, et al.
Publicado: (2025)
por: Togmanov, Mukhammed, et al.
Publicado: (2025)
KazByte: Adapting Qwen models to Kazakh via Byte-level Adapter
por: Akylzhanov, Rauan
Publicado: (2026)
por: Akylzhanov, Rauan
Publicado: (2026)
Low-resource Machine Translation for Code-switched Kazakh-Russian Language Pair
por: Borisov, Maksim, et al.
Publicado: (2025)
por: Borisov, Maksim, et al.
Publicado: (2025)
Feriji: A French-Zarma Parallel Corpus, Glossary & Translator
por: Keita, Mamadou K., et al.
Publicado: (2024)
por: Keita, Mamadou K., et al.
Publicado: (2024)
NepTam: A Nepali-Tamang Parallel Corpus and Baseline Machine Translation Experiments
por: Ghimire, Rupak Raj, et al.
Publicado: (2026)
por: Ghimire, Rupak Raj, et al.
Publicado: (2026)
Building a Functional Machine Translation Corpus for Kpelle
por: Yamoah, Kweku Andoh, et al.
Publicado: (2025)
por: Yamoah, Kweku Andoh, et al.
Publicado: (2025)
BanglaSTEM: A Parallel Corpus for Technical Domain Bangla-English Translation
por: Hasan, Kazi Reyazul, et al.
Publicado: (2025)
por: Hasan, Kazi Reyazul, et al.
Publicado: (2025)
DEPLAIN: A German Parallel Corpus with Intralingual Translations into Plain Language for Sentence and Document Simplification
por: Stodden, Regina, et al.
Publicado: (2023)
por: Stodden, Regina, et al.
Publicado: (2023)
MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical Language
por: Wang, Shun, et al.
Publicado: (2024)
por: Wang, Shun, et al.
Publicado: (2024)
Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion
por: Edet, Offiong Bassey, et al.
Publicado: (2026)
por: Edet, Offiong Bassey, et al.
Publicado: (2026)
Dialectal and Low-Resource Machine Translation for Aromanian
por: Jerpelea, Alexandru-Iulius, et al.
Publicado: (2024)
por: Jerpelea, Alexandru-Iulius, et al.
Publicado: (2024)
ACADATA: Parallel Dataset of Academic Data for Machine Translation
por: Lacunza, Iñaki, et al.
Publicado: (2025)
por: Lacunza, Iñaki, et al.
Publicado: (2025)
ParCzech4Speech: A New Speech Corpus Derived from Czech Parliamentary Data
por: Stankov, Vladislav, et al.
Publicado: (2025)
por: Stankov, Vladislav, et al.
Publicado: (2025)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
por: Nehrdich, Sebastian, et al.
Publicado: (2026)
por: Nehrdich, Sebastian, et al.
Publicado: (2026)
Creating Domain-Specific Translation Memories for Machine Translation Fine-tuning: The TRENCARD Bilingual Cardiology Corpus
por: Dogru, Gokhan
Publicado: (2024)
por: Dogru, Gokhan
Publicado: (2024)
VietMix: A Naturally-Occurring Parallel Corpus and Augmentation Framework for Vietnamese-English Code-Mixed Machine Translation
por: Tran, Hieu, et al.
Publicado: (2025)
por: Tran, Hieu, et al.
Publicado: (2025)
ViDia2Std: A Parallel Corpus and Methods for Low-Resource Vietnamese Dialect-to-Standard Translation
por: Ta, Khoa Anh, et al.
Publicado: (2026)
por: Ta, Khoa Anh, et al.
Publicado: (2026)
Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet
por: Bagci, Mevlüt, et al.
Publicado: (2025)
por: Bagci, Mevlüt, et al.
Publicado: (2025)
Samasāmayik: A Parallel Dataset for Hindi-Sanskrit Machine Translation
por: Karthika, N J, et al.
Publicado: (2026)
por: Karthika, N J, et al.
Publicado: (2026)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
por: Merx, Raphaël, et al.
Publicado: (2025)
por: Merx, Raphaël, et al.
Publicado: (2025)
Parallel Corpus Augmentation using Masked Language Models
por: Kumari, Vibhuti, et al.
Publicado: (2024)
por: Kumari, Vibhuti, et al.
Publicado: (2024)
FFSTC: Fongbe to French Speech Translation Corpus
por: Kponou, D. Fortune, et al.
Publicado: (2024)
por: Kponou, D. Fortune, et al.
Publicado: (2024)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
por: Gagnier, Henry, et al.
Publicado: (2026)
por: Gagnier, Henry, et al.
Publicado: (2026)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
por: Khalil, Mohammad Amer, et al.
Publicado: (2026)
por: Khalil, Mohammad Amer, et al.
Publicado: (2026)
Pretraining Strategies using Monolingual and Parallel Data for Low-Resource Machine Translation
por: Nguefack, Idriss Nguepi, et al.
Publicado: (2025)
por: Nguefack, Idriss Nguepi, et al.
Publicado: (2025)
Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language
por: Wang, Jiayi, et al.
Publicado: (2024)
por: Wang, Jiayi, et al.
Publicado: (2024)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
EMTeC: A Corpus of Eye Movements on Machine-Generated Texts
por: Bolliger, Lena Sophia, et al.
Publicado: (2024)
por: Bolliger, Lena Sophia, et al.
Publicado: (2024)
PETra: A Multilingual Corpus of Pragmatic Explicitation in Translation
por: Osmelak, Doreen, et al.
Publicado: (2025)
por: Osmelak, Doreen, et al.
Publicado: (2025)
Targum -- A Multilingual New Testament Translation Corpus
por: Rapacz, Maciej, et al.
Publicado: (2026)
por: Rapacz, Maciej, et al.
Publicado: (2026)
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
por: Zebaze, Armel, et al.
Publicado: (2025)
por: Zebaze, Armel, et al.
Publicado: (2025)
Is Textual Similarity Invariant under Machine Translation? Evidence Based on the Political Manifesto Corpus
por: Boratyn, Daria, et al.
Publicado: (2026)
por: Boratyn, Daria, et al.
Publicado: (2026)
A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
por: Nagata, Masaaki, et al.
Publicado: (2024)
por: Nagata, Masaaki, et al.
Publicado: (2024)
PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare
por: Al-Sabbagh, Rania
Publicado: (2025)
por: Al-Sabbagh, Rania
Publicado: (2025)
Qorgau: Evaluating LLM Safety in Kazakh-Russian Bilingual Contexts
por: Goloburda, Maiya, et al.
Publicado: (2025)
por: Goloburda, Maiya, et al.
Publicado: (2025)
Ejemplares similares
-
KazSAnDRA: Kazakh Sentiment Analysis Dataset of Reviews and Attitudes
por: Yeshpanov, Rustem, et al.
Publicado: (2024) -
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
por: Abilbekov, Adal, et al.
Publicado: (2024) -
KazQAD: Kazakh Open-Domain Question Answering Dataset
por: Yeshpanov, Rustem, et al.
Publicado: (2024) -
100,000+ Movie Reviews from Kazakhstan: Russian, Kazakh, and Code-Switched Texts
por: Yeshpanov, Rustem
Publicado: (2026) -
Using Songs to Improve Kazakh Automatic Speech Recognition
por: Yeshpanov, Rustem
Publicado: (2026)