HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
Fuente:
arXiv
Saved in:
| Main Authors: | Oepen, Stephan, Arefev, Nikolay, Aulamo, Mikko, Bañón, Marta, Buljan, Maja, Burchell, Laurie, Charpentier, Lucas, Chen, Pinzhen, Fedorova, Mariya, de Gibert, Ona, Haddow, Barry, Hajič, Jan, Helcl, Jindřich, Kutuzov, Andrey, Laippala, Veronika, Li, Zihao, Luukkonen, Risto, Malik, Bhavitvya, Mikhailov, Vladislav, Myntti, Amanda, O'Brien, Dayyán, Poláková, Lucie, Pyysalo, Sampo, Sánchez, Gema Ramírez, Siewert, Janine, Stepachev, Pavel, Tiedemann, Jörg, Vahtola, Teemu, Variš, Dušan, Vitiugin, Fedor, Vojtěchová, Tea, Zaragoza, Jaume |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)
by: Burchell, Laurie, et al.
Published: (2025)
by: Burchell, Laurie, et al.
Published: (2025)
DocHPLT: A Massively Multilingual Document-Level Translation Dataset
by: O'Brien, Dayyán, et al.
Published: (2025)
by: O'Brien, Dayyán, et al.
Published: (2025)
Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation
by: Myntti, Amanda, et al.
Published: (2025)
by: Myntti, Amanda, et al.
Published: (2025)
Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation
by: Iyer, Vivek, et al.
Published: (2024)
by: Iyer, Vivek, et al.
Published: (2024)
Context and System Fusion in Post-ASR Emotion Recognition with Large Language Models
by: Stepachev, Pavel, et al.
Published: (2024)
by: Stepachev, Pavel, et al.
Published: (2024)
A New Massive Multilingual Dataset for High-Performance Language Technologies
by: de Gibert, Ona, et al.
Published: (2024)
by: de Gibert, Ona, et al.
Published: (2024)
Monolingual or Multilingual Instruction Tuning: Which Makes a Better Alpaca
by: Chen, Pinzhen, et al.
Published: (2023)
by: Chen, Pinzhen, et al.
Published: (2023)
Poro 34B and the Blessing of Multilinguality
by: Luukkonen, Risto, et al.
Published: (2024)
by: Luukkonen, Risto, et al.
Published: (2024)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
by: Chen, Pinzhen, et al.
Published: (2024)
by: Chen, Pinzhen, et al.
Published: (2024)
MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
by: O'Brien, Dayyán, et al.
Published: (2025)
by: O'Brien, Dayyán, et al.
Published: (2025)
EMMA-500: Enhancing Massively Multilingual Adaptation of Large Language Models
by: Ji, Shaoxiong, et al.
Published: (2024)
by: Ji, Shaoxiong, et al.
Published: (2024)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
by: Kytöniemi, Joona, et al.
Published: (2025)
by: Kytöniemi, Joona, et al.
Published: (2025)
A Survey of Large Language Models for European Languages
by: Ali, Wazir, et al.
Published: (2024)
by: Ali, Wazir, et al.
Published: (2024)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
by: Fedorova, Mariia, et al.
Published: (2026)
by: Fedorova, Mariia, et al.
Published: (2026)
Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance
by: Myntti, Amanda, et al.
Published: (2026)
by: Myntti, Amanda, et al.
Published: (2026)
Got Compute, but No Data: Lessons From Post-training a Finnish LLM
by: Zosa, Elaine, et al.
Published: (2025)
by: Zosa, Elaine, et al.
Published: (2025)
On the Limits of Model Merging for Multilinguality in Pre-Training
by: Aycock, Seth, et al.
Published: (2026)
by: Aycock, Seth, et al.
Published: (2026)
How Many Languages Make Good Multilingual Instruction Tuning? A Case Study on BLOOM
by: Ji, Shaoxiong, et al.
Published: (2024)
by: Ji, Shaoxiong, et al.
Published: (2024)
Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task
by: Ranaldi, Leonardo, et al.
Published: (2025)
by: Ranaldi, Leonardo, et al.
Published: (2025)
Pretraining Finnish ModernBERTs
by: Reunamo, Akseli, et al.
Published: (2025)
by: Reunamo, Akseli, et al.
Published: (2025)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
by: Wang, Weixuan, et al.
Published: (2025)
by: Wang, Weixuan, et al.
Published: (2025)
Iterative Translation Refinement with Large Language Models
by: Chen, Pinzhen, et al.
Published: (2023)
by: Chen, Pinzhen, et al.
Published: (2023)
The Ups and Downs of Large Language Model Inference with Vocabulary Trimming by Language Heuristics
by: Bogoychev, Nikolay, et al.
Published: (2023)
by: Bogoychev, Nikolay, et al.
Published: (2023)
Automatic register identification for the open web using multilingual deep learning
by: Henriksson, Erik, et al.
Published: (2024)
by: Henriksson, Erik, et al.
Published: (2024)
Mitigating Language Barriers in Education: Developing Multilingual Digital Learning Materials with Machine Translation
by: Poláková, Lucie, et al.
Published: (2025)
by: Poláková, Lucie, et al.
Published: (2025)
When Does Monolingual Data Help Multilingual Translation: The Role of Domain and Model Scale
by: Baziotis, Christos, et al.
Published: (2023)
by: Baziotis, Christos, et al.
Published: (2023)
AXOLOTL'24 Shared Task on Multilingual Explainable Semantic Change Modeling
by: Fedorova, Mariia, et al.
Published: (2024)
by: Fedorova, Mariia, et al.
Published: (2024)
Scaling Low-Resource MT via Synthetic Data Generation with LLMs
by: de Gibert, Ona, et al.
Published: (2025)
by: de Gibert, Ona, et al.
Published: (2025)
Improving Multilingual Retrieval-Augmented Language Models through Dialectic Reasoning Argumentations
by: Ranaldi, Leonardo, et al.
Published: (2025)
by: Ranaldi, Leonardo, et al.
Published: (2025)
SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes
by: Vázquez, Raúl, et al.
Published: (2025)
by: Vázquez, Raúl, et al.
Published: (2025)
Pitfalls and Outlooks in Using COMET
by: Zouhar, Vilém, et al.
Published: (2024)
by: Zouhar, Vilém, et al.
Published: (2024)
Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?
by: Zhu, Dawei, et al.
Published: (2024)
by: Zhu, Dawei, et al.
Published: (2024)
A social perspective of e-learning in the national education system
by: Tapio Varis
Published: (2004)
by: Tapio Varis
Published: (2004)
IT IN EDUCATION: FORESIGHT 2020: ICT COMPETENCY, ENHANCING CITIZENS’ MEDIA AND COMPUTER LITERACY
by: Tapio Varis
Published: (2019)
by: Tapio Varis
Published: (2019)
New technologies and innovation in higher education and regional development
by: Tapio Varis
Published: (2007)
by: Tapio Varis
Published: (2007)
Small Languages, Big Models: A Study of Continual Training on Languages of Norway
by: Samuel, David, et al.
Published: (2024)
by: Samuel, David, et al.
Published: (2024)
‘Gifted Children’ in Britain and the World: Elitism and Equality since 1945. By JenniferCrane. Oxford University Press, 2025. 240 pp. £84.00.
by: Andrew Burchell
Published: (2025)
by: Andrew Burchell
Published: (2025)
Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code
by: Nakamura, Taishi, et al.
Published: (2024)
by: Nakamura, Taishi, et al.
Published: (2024)
Atyaephyra at SemEval-2025 Task 4: Low-Rank Negative Preference Optimization
by: Bronec, Jan, et al.
Published: (2025)
by: Bronec, Jan, et al.
Published: (2025)
Lexically Grounded Subword Segmentation
by: Libovický, Jindřich, et al.
Published: (2024)
by: Libovický, Jindřich, et al.
Published: (2024)
Similar Items
-
An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)
by: Burchell, Laurie, et al.
Published: (2025) -
DocHPLT: A Massively Multilingual Document-Level Translation Dataset
by: O'Brien, Dayyán, et al.
Published: (2025) -
Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation
by: Myntti, Amanda, et al.
Published: (2025) -
Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation
by: Iyer, Vivek, et al.
Published: (2024) -
Context and System Fusion in Post-ASR Emotion Recognition with Large Language Models
by: Stepachev, Pavel, et al.
Published: (2024)