Multilingual European Language Models: Benchmarking Approaches and Challenges
Fuente:
arXiv
Saved in:
| Main Authors: | Barth, Fabio, Rehm, Georg |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Are Multilingual Language Models an Off-ramp for Under-resourced Languages? Will we arrive at Digital Language Equality in Europe in 2030?
by: Rehm, Georg, et al.
Published: (2025)
by: Rehm, Georg, et al.
Published: (2025)
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
by: Haller, Patrick, et al.
Published: (2025)
by: Haller, Patrick, et al.
Published: (2025)
Investigating Gender Bias in Turkish Language Models
by: Caglidil, Orhun Mersin, et al.
Published: (2024)
by: Caglidil, Orhun Mersin, et al.
Published: (2024)
Reward Modeling with Weak Supervision for Language Models
by: Hauptvogel, Ben, et al.
Published: (2024)
by: Hauptvogel, Ben, et al.
Published: (2024)
Towards Multilingual LLM Evaluation for European Languages
by: Thellmann, Klaudia, et al.
Published: (2024)
by: Thellmann, Klaudia, et al.
Published: (2024)
Symmetric Dot-Product Attention for Efficient Training of BERT Language Models
by: Courtois, Martin, et al.
Published: (2024)
by: Courtois, Martin, et al.
Published: (2024)
SciLaD: A Large-Scale, Transparent, Reproducible Dataset for Natural Scientific Language Processing
by: Foppiano, Luca, et al.
Published: (2025)
by: Foppiano, Luca, et al.
Published: (2025)
Table Understanding and (Multimodal) LLMs: A Cross-Domain Case Study on Scientific vs. Non-Scientific Data
by: Borisova, Ekaterina, et al.
Published: (2025)
by: Borisova, Ekaterina, et al.
Published: (2025)
HiStruct+: Improving Extractive Text Summarization with Hierarchical Structure Information
by: Ruan, Qian, et al.
Published: (2022)
by: Ruan, Qian, et al.
Published: (2022)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
by: Piñeiro-Martín, Andrés, et al.
Published: (2024)
by: Piñeiro-Martín, Andrés, et al.
Published: (2024)
Multilingual Jailbreak Challenges in Large Language Models
by: Deng, Yue, et al.
Published: (2023)
by: Deng, Yue, et al.
Published: (2023)
MastermindEval: A Simple But Scalable Reasoning Benchmark
by: Golde, Jonas, et al.
Published: (2025)
by: Golde, Jonas, et al.
Published: (2025)
CEAID: Benchmark of Multilingual Machine-Generated Text Detection Methods for Central European Languages
by: Macko, Dominik, et al.
Published: (2025)
by: Macko, Dominik, et al.
Published: (2025)
Entity Linking using LLMs for Automated Product Carbon Footprint Estimation
by: Castle, Steffen, et al.
Published: (2025)
by: Castle, Steffen, et al.
Published: (2025)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models
by: Wei, Zihao, et al.
Published: (2024)
by: Wei, Zihao, et al.
Published: (2024)
How desirable is alignment between LLMs and linguistically diverse human users?
by: Knoeferle, Pia, et al.
Published: (2025)
by: Knoeferle, Pia, et al.
Published: (2025)
EuroBERT: Scaling Multilingual Encoders for European Languages
by: Boizard, Nicolas, et al.
Published: (2025)
by: Boizard, Nicolas, et al.
Published: (2025)
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
by: Wu, Xinwei, et al.
Published: (2025)
by: Wu, Xinwei, et al.
Published: (2025)
Multilingual Large Language Models and Curse of Multilinguality
by: Gurgurov, Daniil, et al.
Published: (2024)
by: Gurgurov, Daniil, et al.
Published: (2024)
An Efficient Approach for Studying Cross-Lingual Transfer in Multilingual Language Models
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
by: Peng, Xueqing, et al.
Published: (2025)
by: Peng, Xueqing, et al.
Published: (2025)
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
by: Xuan, Weihao, et al.
Published: (2025)
by: Xuan, Weihao, et al.
Published: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024)
by: Alonso, Iñigo, et al.
Published: (2024)
Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights
by: Karthika, N J, et al.
Published: (2025)
by: Karthika, N J, et al.
Published: (2025)
Pruning Multilingual Large Language Models for Multilingual Inference
by: Kim, Hwichan, et al.
Published: (2024)
by: Kim, Hwichan, et al.
Published: (2024)
ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claims
by: Ahmad, Raia Abu, et al.
Published: (2026)
by: Ahmad, Raia Abu, et al.
Published: (2026)
Improving Multilingual Retrieval-Augmented Language Models through Dialectic Reasoning Argumentations
by: Ranaldi, Leonardo, et al.
Published: (2025)
by: Ranaldi, Leonardo, et al.
Published: (2025)
Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models
by: Zhang, Hanzhi, et al.
Published: (2025)
by: Zhang, Hanzhi, et al.
Published: (2025)
Filipino Benchmarks for Measuring Sexist and Homophobic Bias in Multilingual Language Models from Southeast Asia
by: Gamboa, Lance Calvin Lim, et al.
Published: (2024)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2024)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
by: Raihan, Nishat, et al.
Published: (2024)
by: Raihan, Nishat, et al.
Published: (2024)
DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture
by: Maji, Arijit, et al.
Published: (2025)
by: Maji, Arijit, et al.
Published: (2025)
The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks
by: Pomerenke, David, et al.
Published: (2025)
by: Pomerenke, David, et al.
Published: (2025)
Contamination Report for Multilingual Benchmarks
by: Ahuja, Sanchit, et al.
Published: (2024)
by: Ahuja, Sanchit, et al.
Published: (2024)
Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
by: Altakrori, Malik H., et al.
Published: (2025)
by: Altakrori, Malik H., et al.
Published: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
by: Ning, Zhiyuan, et al.
Published: (2025)
by: Ning, Zhiyuan, et al.
Published: (2025)
META-NET Strategic Research Agenda for Multilingual Europe 2020
by: Georg Rehm
by: Georg Rehm
Language Surgery in Multilingual Large Language Models
by: Lopo, Joanito Agili, et al.
Published: (2025)
by: Lopo, Joanito Agili, et al.
Published: (2025)
Bielik 11B v3: Multilingual Large Language Model for European Languages
by: Ociepa, Krzysztof, et al.
Published: (2025)
by: Ociepa, Krzysztof, et al.
Published: (2025)
Similar Items
-
Are Multilingual Language Models an Off-ramp for Under-resourced Languages? Will we arrive at Digital Language Equality in Europe in 2030?
by: Rehm, Georg, et al.
Published: (2025) -
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
by: Haller, Patrick, et al.
Published: (2025) -
Investigating Gender Bias in Turkish Language Models
by: Caglidil, Orhun Mersin, et al.
Published: (2024) -
Reward Modeling with Weak Supervision for Language Models
by: Hauptvogel, Ben, et al.
Published: (2024) -
Towards Multilingual LLM Evaluation for European Languages
by: Thellmann, Klaudia, et al.
Published: (2024)