Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Jiayi, Lu, Yao, Weber, Maurice, Ryabinin, Max, Chen, Yihong, Tang, Raphael, Stenetorp, Pontus |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multilingual Language Model Pretraining using Machine-translated Data
by: Wang, Jiayi, et al.
Published: (2025)
by: Wang, Jiayi, et al.
Published: (2025)
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
by: Shao, Jiandong, et al.
Published: (2026)
by: Shao, Jiandong, et al.
Published: (2026)
Strings from the Library of Babel: Random Sampling as a Strong Baseline for Prompt Optimisation
by: Lu, Yao, et al.
Published: (2023)
by: Lu, Yao, et al.
Published: (2023)
Quantifying Generative Media Bias with a Corpus of Real-world and Generated News Articles
by: Trhlik, Filip, et al.
Published: (2024)
by: Trhlik, Filip, et al.
Published: (2024)
Gender-specific Machine Translation with Large Language Models
by: Sánchez, Eduardo, et al.
Published: (2023)
by: Sánchez, Eduardo, et al.
Published: (2023)
Jet Expansions of Residual Computation
by: Chen, Yihong, et al.
Published: (2024)
by: Chen, Yihong, et al.
Published: (2024)
Improving Language Plasticity via Pretraining with Active Forgetting
by: Chen, Yihong, et al.
Published: (2023)
by: Chen, Yihong, et al.
Published: (2023)
Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
by: Tang, Raphael, et al.
Published: (2025)
by: Tang, Raphael, et al.
Published: (2025)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
by: Benkirane, Kenza, et al.
Published: (2024)
by: Benkirane, Kenza, et al.
Published: (2024)
Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
by: Bell, Samuel J., et al.
Published: (2025)
by: Bell, Samuel J., et al.
Published: (2025)
Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language Models
by: Madaan, Lovish, et al.
Published: (2024)
by: Madaan, Lovish, et al.
Published: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
by: Tang, Raphael, et al.
Published: (2024)
by: Tang, Raphael, et al.
Published: (2024)
Using Natural Language Explanations to Improve Robustness of In-context Learning
by: He, Xuanli, et al.
Published: (2023)
by: He, Xuanli, et al.
Published: (2023)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
by: Nehrdich, Sebastian, et al.
Published: (2026)
by: Nehrdich, Sebastian, et al.
Published: (2026)
LangSAMP: Language-Script Aware Multilingual Pretraining
by: Liu, Yihong, et al.
Published: (2024)
by: Liu, Yihong, et al.
Published: (2024)
ReFactor GNNs: Revisiting Factorisation-based Models from a Message-Passing Perspective
by: Chen, Yihong, et al.
Published: (2022)
by: Chen, Yihong, et al.
Published: (2022)
DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining
by: Yan, Yutong, et al.
Published: (2026)
by: Yan, Yutong, et al.
Published: (2026)
SignBank+: Preparing a Multilingual Sign Language Dataset for Machine Translation Using Large Language Models
by: Moryossef, Amit, et al.
Published: (2023)
by: Moryossef, Amit, et al.
Published: (2023)
A Comparison of Language Modeling and Translation as Multilingual Pretraining Objectives
by: Li, Zihao, et al.
Published: (2024)
by: Li, Zihao, et al.
Published: (2024)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
by: Zhu, Wenhao, et al.
Published: (2023)
by: Zhu, Wenhao, et al.
Published: (2023)
Registering Source Tokens to Target Language Spaces in Multilingual Neural Machine Translation
by: Qu, Zhi, et al.
Published: (2025)
by: Qu, Zhi, et al.
Published: (2025)
AfroBench: How Good are Large Language Models on African Languages?
by: Ojo, Jessica, et al.
Published: (2023)
by: Ojo, Jessica, et al.
Published: (2023)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
by: Liu, Yihong, et al.
Published: (2023)
by: Liu, Yihong, et al.
Published: (2023)
Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?
by: Ji, Shaoxiong, et al.
Published: (2024)
by: Ji, Shaoxiong, et al.
Published: (2024)
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
by: Liu, Yihong, et al.
Published: (2024)
by: Liu, Yihong, et al.
Published: (2024)
How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective
by: Qiu, Xinchi, et al.
Published: (2024)
by: Qiu, Xinchi, et al.
Published: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
by: Hu, Yuchen, et al.
Published: (2024)
by: Hu, Yuchen, et al.
Published: (2024)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
by: Liu, Yihong, et al.
Published: (2024)
by: Liu, Yihong, et al.
Published: (2024)
Multilingual Contextualization of Large Language Models for Document-Level Machine Translation
by: Ramos, Miguel Moura, et al.
Published: (2025)
by: Ramos, Miguel Moura, et al.
Published: (2025)
PETra: A Multilingual Corpus of Pragmatic Explicitation in Translation
by: Osmelak, Doreen, et al.
Published: (2025)
by: Osmelak, Doreen, et al.
Published: (2025)
Targum -- A Multilingual New Testament Translation Corpus
by: Rapacz, Maciej, et al.
Published: (2026)
by: Rapacz, Maciej, et al.
Published: (2026)
Using Machine Translation to Augment Multilingual Classification
by: King, Adam
Published: (2024)
by: King, Adam
Published: (2024)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
by: Liu, Yihong, et al.
Published: (2026)
by: Liu, Yihong, et al.
Published: (2026)
Mind Your Format: Towards Consistent Evaluation of In-Context Learning Improvements
by: Voronov, Anton, et al.
Published: (2024)
by: Voronov, Anton, et al.
Published: (2024)
Copy First, Translate Later: Interpreting Translation Dynamics in Multilingual Pretraining
by: Körner, Felicia, et al.
Published: (2026)
by: Körner, Felicia, et al.
Published: (2026)
Tracing Multilingual Factual Knowledge Acquisition in Pretraining
by: Liu, Yihong, et al.
Published: (2025)
by: Liu, Yihong, et al.
Published: (2025)
Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State Generation
by: Li, Senyu, et al.
Published: (2025)
by: Li, Senyu, et al.
Published: (2025)
Towards Boosting Many-to-Many Multilingual Machine Translation with Large Language Models
by: Gao, Pengzhi, et al.
Published: (2024)
by: Gao, Pengzhi, et al.
Published: (2024)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
by: Shang, Yuzhe, et al.
Published: (2026)
by: Shang, Yuzhe, et al.
Published: (2026)
Automatic Machine Translation Detection Using a Surrogate Multilingual Translation Model
by: García-Romero, Cristian, et al.
Published: (2025)
by: García-Romero, Cristian, et al.
Published: (2025)
Similar Items
-
Multilingual Language Model Pretraining using Machine-translated Data
by: Wang, Jiayi, et al.
Published: (2025) -
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
by: Shao, Jiandong, et al.
Published: (2026) -
Strings from the Library of Babel: Random Sampling as a Strong Baseline for Prompt Optimisation
by: Lu, Yao, et al.
Published: (2023) -
Quantifying Generative Media Bias with a Corpus of Real-world and Generated News Articles
by: Trhlik, Filip, et al.
Published: (2024) -
Gender-specific Machine Translation with Large Language Models
by: Sánchez, Eduardo, et al.
Published: (2023)