The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pomerenke, David, Nothnagel, Jonas, Ostermann, Simon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
par: Gurgurov, Daniil, et autres
Publié: (2024)
par: Gurgurov, Daniil, et autres
Publié: (2024)
On Multilingual Encoder Language Model Compression for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
GrEmLIn: A Repository of Green Baseline Embeddings for 87 Low-Resource Languages Injected with Multilingual Graph Knowledge
par: Gurgurov, Daniil, et autres
Publié: (2024)
par: Gurgurov, Daniil, et autres
Publié: (2024)
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Large Language Models for Multilingual Previously Fact-Checked Claim Detection
par: Vykopal, Ivan, et autres
Publié: (2025)
par: Vykopal, Ivan, et autres
Publié: (2025)
Multilingual Political Views of Large Language Models: Identification and Steering
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
UniversalCEFR: Enabling Open Multilingual Research on Language Proficiency Assessment
par: Imperial, Joseph Marvin, et autres
Publié: (2025)
par: Imperial, Joseph Marvin, et autres
Publié: (2025)
Soft Language Prompts for Language Transfer
par: Vykopal, Ivan, et autres
Publié: (2024)
par: Vykopal, Ivan, et autres
Publié: (2024)
Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection
par: Ghussin, Yusser Al, et autres
Publié: (2026)
par: Ghussin, Yusser Al, et autres
Publié: (2026)
The Lookahead Limitation: Why Multi-Operand Addition is Hard for LLMs
par: Baeumel, Tanja, et autres
Publié: (2025)
par: Baeumel, Tanja, et autres
Publié: (2025)
DiscoTrack: A Multilingual LLM Benchmark for Discourse Tracking
par: Bu, Lanni, et autres
Publié: (2025)
par: Bu, Lanni, et autres
Publié: (2025)
Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms
par: Baeumel, Tanja, et autres
Publié: (2026)
par: Baeumel, Tanja, et autres
Publié: (2026)
Disce aut Deficere: Evaluating LLMs Proficiency on the INVALSI Italian Benchmark
par: Mercorio, Fabio, et autres
Publié: (2024)
par: Mercorio, Fabio, et autres
Publié: (2024)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
par: Liu, Hongwei, et autres
Publié: (2024)
par: Liu, Hongwei, et autres
Publié: (2024)
ProLex: A Benchmark for Language Proficiency-oriented Lexical Substitution
par: Zhang, Xuanming, et autres
Publié: (2024)
par: Zhang, Xuanming, et autres
Publié: (2024)
MiLiC-Eval: Benchmarking Multilingual LLMs for China's Minority Languages
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Testing Low-Resource Language Support in LLMs Using Language Proficiency Exams: the Case of Luxembourgish
par: Lothritz, Cedric, et autres
Publié: (2025)
par: Lothritz, Cedric, et autres
Publié: (2025)
Probing Context Localization of Polysemous Words in Pre-trained Language Model Sub-Layers
par: Vijayakumar, Soniya, et autres
Publié: (2024)
par: Vijayakumar, Soniya, et autres
Publié: (2024)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Cross-Prompt Encoder for Low-Performing Languages
par: Mikaberidze, Beso, et autres
Publié: (2025)
par: Mikaberidze, Beso, et autres
Publié: (2025)
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Controlling Language Confusion in Multilingual LLMs
par: Lee, Nahyun, et autres
Publié: (2025)
par: Lee, Nahyun, et autres
Publié: (2025)
Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification
par: Jeong, Jinhong, et autres
Publié: (2026)
par: Jeong, Jinhong, et autres
Publié: (2026)
Generative Large Language Models in Automated Fact-Checking: A Survey
par: Vykopal, Ivan, et autres
Publié: (2024)
par: Vykopal, Ivan, et autres
Publié: (2024)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
par: Singh, Harman, et autres
Publié: (2024)
par: Singh, Harman, et autres
Publié: (2024)
A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages
par: Anikina, Tatiana, et autres
Publié: (2025)
par: Anikina, Tatiana, et autres
Publié: (2025)
From Tarzan to Tolkien: Controlling the Language Proficiency Level of LLMs for Content Generation
par: Malik, Ali, et autres
Publié: (2024)
par: Malik, Ali, et autres
Publié: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
par: He, Yun, et autres
Publié: (2024)
par: He, Yun, et autres
Publié: (2024)
SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis
par: Cai, Hengxing, et autres
Publié: (2024)
par: Cai, Hengxing, et autres
Publié: (2024)
PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
par: Zhang, Pei, et autres
Publié: (2025)
par: Zhang, Pei, et autres
Publié: (2025)
DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge
par: Ghussin, Yusser Al, et autres
Publié: (2026)
par: Ghussin, Yusser Al, et autres
Publié: (2026)
"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs
par: Van Doren, Madison, et autres
Publié: (2026)
par: Van Doren, Madison, et autres
Publié: (2026)
Let's Simplify Step by Step: Guiding LLM Towards Multilingual Unsupervised Proficiency-Controlled Sentence Simplification
par: Zhang, Jingshen, et autres
Publié: (2026)
par: Zhang, Jingshen, et autres
Publié: (2026)
Multilingual Datasets for Custom Input Extraction and Explanation Requests Parsing in Conversational XAI Systems
par: Wang, Qianli, et autres
Publié: (2025)
par: Wang, Qianli, et autres
Publié: (2025)
Language Bias under Conflicting Information in Multilingual LLMs
par: Östling, Robert, et autres
Publié: (2026)
par: Östling, Robert, et autres
Publié: (2026)
Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs
par: Aldahlawi, Bayan Abdullah, et autres
Publié: (2026)
par: Aldahlawi, Bayan Abdullah, et autres
Publié: (2026)
Information Loss in LLMs' Multilingual Translation: The Role of Training Data, Language Proximity, and Language Family
par: Lin, Yumeng, et autres
Publié: (2025)
par: Lin, Yumeng, et autres
Publié: (2025)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
par: Schmidt, Fabian David, et autres
Publié: (2025)
par: Schmidt, Fabian David, et autres
Publié: (2025)
Multilingual European Language Models: Benchmarking Approaches and Challenges
par: Barth, Fabio, et autres
Publié: (2025)
par: Barth, Fabio, et autres
Publié: (2025)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
par: Lage, Lucas Fonseca, et autres
Publié: (2025)
par: Lage, Lucas Fonseca, et autres
Publié: (2025)
Documents similaires
-
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
par: Gurgurov, Daniil, et autres
Publié: (2024) -
On Multilingual Encoder Language Model Compression for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025) -
GrEmLIn: A Repository of Green Baseline Embeddings for 87 Low-Resource Languages Injected with Multilingual Graph Knowledge
par: Gurgurov, Daniil, et autres
Publié: (2024) -
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025) -
Large Language Models for Multilingual Previously Fact-Checked Claim Detection
par: Vykopal, Ivan, et autres
Publié: (2025)