An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Burchell, Laurie, de Gibert, Ona, Arefyev, Nikolay, Aulamo, Mikko, Bañón, Marta, Chen, Pinzhen, Fedorova, Mariia, Guillou, Liane, Haddow, Barry, Hajič, Jan, Helcl, Jindřich, Henriksson, Erik, Klimaszewski, Mateusz, Komulainen, Ville, Kutuzov, Andrey, Kytöniemi, Joona, Laippala, Veronika, Mæhlum, Petter, Malik, Bhavitvya, Mehryary, Farrokh, Mikhailov, Vladislav, Moghe, Nikita, Myntti, Amanda, O'Brien, Dayyán, Oepen, Stephan, Pal, Proyag, Piha, Jousia, Pyysalo, Sampo, Ramírez-Sánchez, Gema, Samuel, David, Stepachev, Pavel, Tiedemann, Jörg, Variš, Dušan, Vojtěchová, Tereza, Zaragoza-Bernabeu, Jaume |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
par: Oepen, Stephan, et autres
Publié: (2025)
par: Oepen, Stephan, et autres
Publié: (2025)
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025)
par: Kytöniemi, Joona, et autres
Publié: (2025)
DocHPLT: A Massively Multilingual Document-Level Translation Dataset
par: O'Brien, Dayyán, et autres
Publié: (2025)
par: O'Brien, Dayyán, et autres
Publié: (2025)
Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation
par: Myntti, Amanda, et autres
Publié: (2025)
par: Myntti, Amanda, et autres
Publié: (2025)
Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation
par: Iyer, Vivek, et autres
Publié: (2024)
par: Iyer, Vivek, et autres
Publié: (2024)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
par: Fedorova, Mariia, et autres
Publié: (2026)
par: Fedorova, Mariia, et autres
Publié: (2026)
A New Massive Multilingual Dataset for High-Performance Language Technologies
par: de Gibert, Ona, et autres
Publié: (2024)
par: de Gibert, Ona, et autres
Publié: (2024)
Got Compute, but No Data: Lessons From Post-training a Finnish LLM
par: Zosa, Elaine, et autres
Publié: (2025)
par: Zosa, Elaine, et autres
Publié: (2025)
Context and System Fusion in Post-ASR Emotion Recognition with Large Language Models
par: Stepachev, Pavel, et autres
Publié: (2024)
par: Stepachev, Pavel, et autres
Publié: (2024)
Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance
par: Myntti, Amanda, et autres
Publié: (2026)
par: Myntti, Amanda, et autres
Publié: (2026)
Question Answering models for information extraction from perovskite materials science literature
par: Sipilä, M., et autres
Publié: (2024)
par: Sipilä, M., et autres
Publié: (2024)
MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
par: O'Brien, Dayyán, et autres
Publié: (2025)
par: O'Brien, Dayyán, et autres
Publié: (2025)
Enriching Word Usage Graphs with Cluster Definitions
par: Fedorova, Mariia, et autres
Publié: (2024)
par: Fedorova, Mariia, et autres
Publié: (2024)
Automatic register identification for the open web using multilingual deep learning
par: Henriksson, Erik, et autres
Publié: (2024)
par: Henriksson, Erik, et autres
Publié: (2024)
Pitfalls and Outlooks in Using COMET
par: Zouhar, Vilém, et autres
Publié: (2024)
par: Zouhar, Vilém, et autres
Publié: (2024)
Monolingual or Multilingual Instruction Tuning: Which Makes a Better Alpaca
par: Chen, Pinzhen, et autres
Publié: (2023)
par: Chen, Pinzhen, et autres
Publié: (2023)
University students in crisis: university dropout and professional re-selection
par: Yvette Piha Lehman
Publié: (2014)
par: Yvette Piha Lehman
Publié: (2014)
Poro 34B and the Blessing of Multilinguality
par: Luukkonen, Risto, et autres
Publié: (2024)
par: Luukkonen, Risto, et autres
Publié: (2024)
A social perspective of e-learning in the national education system
par: Tapio Varis
Publié: (2004)
par: Tapio Varis
Publié: (2004)
IT IN EDUCATION: FORESIGHT 2020: ICT COMPETENCY, ENHANCING CITIZENS’ MEDIA AND COMPUTER LITERACY
par: Tapio Varis
Publié: (2019)
par: Tapio Varis
Publié: (2019)
New technologies and innovation in higher education and regional development
par: Tapio Varis
Publié: (2007)
par: Tapio Varis
Publié: (2007)
Small Languages, Big Models: A Study of Continual Training on Languages of Norway
par: Samuel, David, et autres
Publié: (2024)
par: Samuel, David, et autres
Publié: (2024)
‘Gifted Children’ in Britain and the World: Elitism and Equality since 1945. By JenniferCrane. Oxford University Press, 2025. 240 pp. £84.00.
par: Andrew Burchell
Publié: (2025)
par: Andrew Burchell
Publié: (2025)
Atyaephyra at SemEval-2025 Task 4: Low-Rank Negative Preference Optimization
par: Bronec, Jan, et autres
Publié: (2025)
par: Bronec, Jan, et autres
Publié: (2025)
Lexically Grounded Subword Segmentation
par: Libovický, Jindřich, et autres
Publié: (2024)
par: Libovický, Jindřich, et autres
Publié: (2024)
Multilingual Substitution-based Word Sense Induction
par: Kokosinskii, Denis, et autres
Publié: (2024)
par: Kokosinskii, Denis, et autres
Publié: (2024)
A Survey of Large Language Models for European Languages
par: Ali, Wazir, et autres
Publié: (2024)
par: Ali, Wazir, et autres
Publié: (2024)
EMMA-500: Enhancing Massively Multilingual Adaptation of Large Language Models
par: Ji, Shaoxiong, et autres
Publié: (2024)
par: Ji, Shaoxiong, et autres
Publié: (2024)
Estimating Lexical Complexity from Document-Level Distributions
par: Wold, Sondre, et autres
Publié: (2024)
par: Wold, Sondre, et autres
Publié: (2024)
Endoscopic diagnosis of an obstructive fungal ball in the urethra of a dog
par: Sarah Langton, et autres
Publié: (2024)
par: Sarah Langton, et autres
Publié: (2024)
Gregorian melody, modality, and memory: Segmenting chant with Bayesian nonparametrics
par: Lanz, Vojtěch, et autres
Publié: (2025)
par: Lanz, Vojtěch, et autres
Publié: (2025)
Beyond Rules: Towards Basso Continuo Personal Style Identification
par: Štefunko, Adam, et autres
Publié: (2026)
par: Štefunko, Adam, et autres
Publié: (2026)
Knowing when to stop: insights from ecology for building catalogues, collections, and corpora
par: Hajič jr., Jan, et autres
Publié: (2025)
par: Hajič jr., Jan, et autres
Publié: (2025)
Modeling the Difficulty of Saxophone Music
par: Libřický, Šimon, et autres
Publié: (2025)
par: Libřický, Šimon, et autres
Publié: (2025)
How Many Languages Make Good Multilingual Instruction Tuning? A Case Study on BLOOM
par: Ji, Shaoxiong, et autres
Publié: (2024)
par: Ji, Shaoxiong, et autres
Publié: (2024)
Deep-change at AXOLOTL-24: Orchestrating WSD and WSI Models for Semantic Change Modeling
par: Kokosinskii, Denis, et autres
Publié: (2024)
par: Kokosinskii, Denis, et autres
Publié: (2024)
Back to Bytes: Revisiting Tokenization Through UTF-8
par: Moryossef, Amit, et autres
Publié: (2025)
par: Moryossef, Amit, et autres
Publié: (2025)
Different Time, Different Language: Revisiting the Bias Against Non-Native Speakers in GPT Detectors
par: Ali, Adnan Al, et autres
Publié: (2026)
par: Ali, Adnan Al, et autres
Publié: (2026)
Hopes and Fears -- Emotion Distribution in the Topic Landscape of Finnish Parliamentary Speech 2000-2020
par: Ristilä, Anna, et autres
Publié: (2026)
par: Ristilä, Anna, et autres
Publié: (2026)
Adversarial Testing as a Tool for Interpretability: Length-based Overfitting of Elementary Functions in Transformers
par: Zavoral, Patrik, et autres
Publié: (2024)
par: Zavoral, Patrik, et autres
Publié: (2024)
Documents similaires
-
HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
par: Oepen, Stephan, et autres
Publié: (2025) -
FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
par: Kytöniemi, Joona, et autres
Publié: (2025) -
DocHPLT: A Massively Multilingual Document-Level Translation Dataset
par: O'Brien, Dayyán, et autres
Publié: (2025) -
Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation
par: Myntti, Amanda, et autres
Publié: (2025) -
Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation
par: Iyer, Vivek, et autres
Publié: (2024)