ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability Assessment
Fuente:
arXiv
Saved in:
| Main Authors: | Naous, Tarek, Ryan, Michael J., Lavrouk, Anton, Chandra, Mohit, Xu, Wei |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
What are Foundation Models Cooking in the Post-Soviet World?
by: Lavrouk, Anton, et al.
Published: (2025)
by: Lavrouk, Anton, et al.
Published: (2025)
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
by: Naous, Tarek, et al.
Published: (2023)
by: Naous, Tarek, et al.
Published: (2023)
Stanceosaurus 2.0: Classifying Stance Towards Russian and Spanish Misinformation
by: Lavrouk, Anton, et al.
Published: (2024)
by: Lavrouk, Anton, et al.
Published: (2024)
On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic Phenomena
by: Naous, Tarek, et al.
Published: (2025)
by: Naous, Tarek, et al.
Published: (2025)
ReadMe
by: s
Published: (2025)
by: s
Published: (2025)
An Open Multilingual System for Scoring Readability of Wikipedia
by: Trokhymovych, Mykola, et al.
Published: (2024)
by: Trokhymovych, Mykola, et al.
Published: (2024)
Multilingual Multi-Aspect Explainability Analyses on Machine Reading Comprehension Models
by: Cui, Yiming, et al.
Published: (2021)
by: Cui, Yiming, et al.
Published: (2021)
Prompt-based Learning for Text Readability Assessment
by: Lee, Bruce W., et al.
Published: (2023)
by: Lee, Bruce W., et al.
Published: (2023)
Multilingual Transfer and Domain Adaptation for Low-Resource Languages of Spain
by: Luo, Yuanchang, et al.
Published: (2024)
by: Luo, Yuanchang, et al.
Published: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering
by: Xue, Siqiao, et al.
Published: (2024)
by: Xue, Siqiao, et al.
Published: (2024)
Flipping the Dialogue: Training and Evaluating User Language Models
by: Naous, Tarek, et al.
Published: (2025)
by: Naous, Tarek, et al.
Published: (2025)
Hierarchical Ranking Neural Network for Long Document Readability Assessment
by: Zheng, Yurui, et al.
Published: (2025)
by: Zheng, Yurui, et al.
Published: (2025)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
by: Ni, Shiwen, et al.
Published: (2024)
by: Ni, Shiwen, et al.
Published: (2024)
Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks
by: Yin, Jiaqi, et al.
Published: (2025)
by: Yin, Jiaqi, et al.
Published: (2025)
MultiTEND: A Multilingual Benchmark for Natural Language to NoSQL Query Translation
by: Qin, Zhiqian, et al.
Published: (2025)
by: Qin, Zhiqian, et al.
Published: (2025)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
by: Han, Wenhan, et al.
Published: (2025)
by: Han, Wenhan, et al.
Published: (2025)
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
by: Enevoldsen, Kenneth, et al.
Published: (2024)
by: Enevoldsen, Kenneth, et al.
Published: (2024)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
by: Altakrori, Malik H., et al.
Published: (2025)
by: Altakrori, Malik H., et al.
Published: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
by: Ning, Zhiyuan, et al.
Published: (2025)
by: Ning, Zhiyuan, et al.
Published: (2025)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
by: Ding, Jing, et al.
Published: (2025)
by: Ding, Jing, et al.
Published: (2025)
MedReadMe: A Systematic Study for Fine-grained Sentence Readability in Medical Domain
by: Jiang, Chao, et al.
Published: (2024)
by: Jiang, Chao, et al.
Published: (2024)
MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models
by: Agarwal, Vibhor, et al.
Published: (2024)
by: Agarwal, Vibhor, et al.
Published: (2024)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
by: Bruun, Sofie Helene, et al.
Published: (2025)
by: Bruun, Sofie Helene, et al.
Published: (2025)
Multilingual Collaborative Defense for Large Language Models
by: Li, Hongliang, et al.
Published: (2025)
by: Li, Hongliang, et al.
Published: (2025)
SUTRA: Scalable Multilingual Language Model Architecture
by: Bendale, Abhijit, et al.
Published: (2024)
by: Bendale, Abhijit, et al.
Published: (2024)
Pushing on Text Readability Assessment: A Transformer Meets Handcrafted Linguistic Features
by: Lee, Bruce W., et al.
Published: (2021)
by: Lee, Bruce W., et al.
Published: (2021)
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ
by: Holtermann, Carolin, et al.
Published: (2024)
by: Holtermann, Carolin, et al.
Published: (2024)
Investigating Large Language Models and Control Mechanisms to Improve Text Readability of Biomedical Abstracts
by: Li, Zihao, et al.
Published: (2023)
by: Li, Zihao, et al.
Published: (2023)
Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems
by: Cui, Tianyu, et al.
Published: (2024)
by: Cui, Tianyu, et al.
Published: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
by: Mastrokostas, Charalampos, et al.
Published: (2026)
by: Mastrokostas, Charalampos, et al.
Published: (2026)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
by: Schmidt, Fabian David, et al.
Published: (2025)
by: Schmidt, Fabian David, et al.
Published: (2025)
SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs
by: Ryan, Michael J, et al.
Published: (2025)
by: Ryan, Michael J, et al.
Published: (2025)
CALM : A Multi-task Benchmark for Comprehensive Assessment of Language Model Bias
by: Gupta, Vipul, et al.
Published: (2023)
by: Gupta, Vipul, et al.
Published: (2023)
Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving
by: Zan, Daoguang, et al.
Published: (2025)
by: Zan, Daoguang, et al.
Published: (2025)
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
by: Fabbri, Alexander R., et al.
Published: (2025)
by: Fabbri, Alexander R., et al.
Published: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
by: Shi, Weijie, et al.
Published: (2025)
by: Shi, Weijie, et al.
Published: (2025)
mucAI at BAREC Shared Task 2025: Towards Uncertainty Aware Arabic Readability Assessment
by: Abdou, Ahmed
Published: (2025)
by: Abdou, Ahmed
Published: (2025)
Multilingual Pretraining for Pixel Language Models
by: Kesen, Ilker, et al.
Published: (2025)
by: Kesen, Ilker, et al.
Published: (2025)
Similar Items
-
What are Foundation Models Cooking in the Post-Soviet World?
by: Lavrouk, Anton, et al.
Published: (2025) -
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
by: Naous, Tarek, et al.
Published: (2023) -
Stanceosaurus 2.0: Classifying Stance Towards Russian and Spanish Misinformation
by: Lavrouk, Anton, et al.
Published: (2024) -
On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic Phenomena
by: Naous, Tarek, et al.
Published: (2025) -
ReadMe
by: s
Published: (2025)