Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | AlQadi, Leen, Alzubaidi, Ahmed, Alyafeai, Mohammed, Alobeidli, Hamza, Alhammadi, Maitha, Alsuwaidi, Shaikha, Alkaabi, Omar, Boussaha, Basma El Amel, Hacid, Hakim |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps
par: Alzubaidi, Ahmed, et autres
Publié: (2025)
par: Alzubaidi, Ahmed, et autres
Publié: (2025)
3LM: Bridging Arabic, STEM, and Code through Benchmarking
par: Boussaha, Basma El Amel, et autres
Publié: (2025)
par: Boussaha, Basma El Amel, et autres
Publié: (2025)
Falcon2-11B Technical Report
par: Malartic, Quentin, et autres
Publié: (2024)
par: Malartic, Quentin, et autres
Publié: (2024)
Maximizing the Potential of Synthetic Data: Insights from Random Matrix Theory
par: Firdoussi, Aymane El, et autres
Publié: (2024)
par: Firdoussi, Aymane El, et autres
Publié: (2024)
New Variations and Structural Refinements of Discrete Weighted Jensen and Hermite–Hadamard Inequalities Using ( α , m)‐Convex Mappings
par: Shama Firdous, et autres
Publié: (2026)
par: Shama Firdous, et autres
Publié: (2026)
Adaptive CUSUM Control Chart With Variable Sample Size for Monitoring Under Measurement Error
par: Abdullah Ali H. Ahmadini, et autres
Publié: (2026)
par: Abdullah Ali H. Ahmadini, et autres
Publié: (2026)
Alignment with Preference Optimization Is All You Need for LLM Safety
par: Alami, Reda, et autres
Publié: (2024)
par: Alami, Reda, et autres
Publié: (2024)
Poem Meter Classification of Recited Arabic Poetry: Integrating High-Resource Systems for a Low-Resource Task
par: Al-Shaibani, Maged S., et autres
Publié: (2025)
par: Al-Shaibani, Maged S., et autres
Publié: (2025)
Re-thinking Human Activity Recognition with Hierarchy-aware Label Relationship Modeling
par: Zuo, Jingwei, et autres
Publié: (2024)
par: Zuo, Jingwei, et autres
Publié: (2024)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
par: Alhumud, Anas, et autres
Publié: (2026)
par: Alhumud, Anas, et autres
Publié: (2026)
NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models
par: Yagoubi, Mouadh, et autres
Publié: (2025)
par: Yagoubi, Mouadh, et autres
Publié: (2025)
PORT: Preference Optimization on Reasoning Traces
par: Lahlou, Salem, et autres
Publié: (2024)
par: Lahlou, Salem, et autres
Publié: (2024)
The Increasing Importance of Breast Cancer in the United Arab Emirates
par: Ruqaiyyah Siddiqui, et autres
Publié: (2025)
par: Ruqaiyyah Siddiqui, et autres
Publié: (2025)
Data Quality in Edge Machine Learning: A State-of-the-Art Survey
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2024)
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2024)
Perceptions of Nursing Faculty on Utilizing AI Tools in Academic Writing and Publication Productivity: A Cross‐Sectional Study
par: Maitha Al Salti, et autres
Publié: (2025)
par: Maitha Al Salti, et autres
Publié: (2025)
Arab Americans in the United States
par: Al-Kuwari, Shaikha H.
Publié: (2024)
par: Al-Kuwari, Shaikha H.
Publié: (2024)
Cutting-Edge Innovations in Teaching, Leadership, Technology, and Assessment
par: Abdallah, Asma Khaleel, et autres
Publié: (2024)
par: Abdallah, Asma Khaleel, et autres
Publié: (2024)
WavLink: Compact Audio-Text Embeddings with a Global Whisper Token
par: Kumar, Gokul Karthik, et autres
Publié: (2026)
par: Kumar, Gokul Karthik, et autres
Publié: (2026)
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
par: Abu-Daoud, Mouath, et autres
Publié: (2026)
par: Abu-Daoud, Mouath, et autres
Publié: (2026)
From Language to Action in Arabic: Reliable Structured Tool Calling via Data-Centric Fine-Tuning
par: Nacar, Omer, et autres
Publié: (2026)
par: Nacar, Omer, et autres
Publié: (2026)
Ionospheric Scintillation Forecasting Using Machine Learning
par: Halawa, Sultan, et autres
Publié: (2024)
par: Halawa, Sultan, et autres
Publié: (2024)
Evaluating the Effects of Arabic‐Medium Behavioral Skills Training on Parenting Program Facilitators in the United Arab Emirates
par: Amina Maliki, et autres
Publié: (2025)
par: Amina Maliki, et autres
Publié: (2025)
Chapter 7 Arabic mobile game localizations
par: Al‑Batineh, Mohammed
Publié: (2025)
par: Al‑Batineh, Mohammed
Publié: (2025)
MAGNETO: Edge AI for Human Activity Recognition -- Privacy and Personalization
par: Zuo, Jingwei, et autres
Publié: (2024)
par: Zuo, Jingwei, et autres
Publié: (2024)
ALRM: Agentic LLM for Robotic Manipulation
par: Santos, Vitor Gaboardi dos, et autres
Publié: (2026)
par: Santos, Vitor Gaboardi dos, et autres
Publié: (2026)
Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
par: Belgoumri, Mohammed Djameleddine, et autres
Publié: (2025)
Mapping the Landscape of Generative Language Models in Dental Education: A Comparison Between ChatGPT and Google Bard
par: Shaikha Aldukhail
Publié: (2024)
par: Shaikha Aldukhail
Publié: (2024)
Development of a full-Scale approach to predict overlay reflective crack
par: Zhu, Zehui, et autres
Publié: (2024)
par: Zhu, Zehui, et autres
Publié: (2024)
SIFT-Aided Rectified 2D-DIC for Displacement and Strain Measurements in Asphalt Concrete Testing
par: Zhu, Zehui, et autres
Publié: (2024)
par: Zhu, Zehui, et autres
Publié: (2024)
Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance
par: Zuo, Jingwei, et autres
Publié: (2025)
par: Zuo, Jingwei, et autres
Publié: (2025)
Reliability of 1D radiative-convective photochemical-equilibrium retrievals on transit spectra of WASP-107b
par: Konings, Thomas, et autres
Publié: (2025)
par: Konings, Thomas, et autres
Publié: (2025)
MeXtract: Light-Weight Metadata Extraction from Scientific Papers
par: Alyafeai, Zaid, et autres
Publié: (2025)
par: Alyafeai, Zaid, et autres
Publié: (2025)
MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs
par: Alyafeai, Zaid, et autres
Publié: (2025)
par: Alyafeai, Zaid, et autres
Publié: (2025)
AraHealthQA 2025: The First Shared Task on Arabic Health Question Answering
par: Alhuzali, Hassan, et autres
Publié: (2025)
par: Alhuzali, Hassan, et autres
Publié: (2025)
Falcon Mamba: The First Competitive Attention-free 7B Language Model
par: Zuo, Jingwei, et autres
Publié: (2024)
par: Zuo, Jingwei, et autres
Publié: (2024)
PSSF: Early osteoarthritis detection using physical synthetic knee X-ray scans and AI radiomics models
par: Alzubaidi, Abbas, et autres
Publié: (2026)
par: Alzubaidi, Abbas, et autres
Publié: (2026)
Stressors, Needs and Satisfaction of Families of Critically Ill Arabic Patients: A Systematic Review
par: Khaled Mohammed Al‐Sayaghi, et autres
Publié: (2025)
par: Khaled Mohammed Al‐Sayaghi, et autres
Publié: (2025)
Arabic Stable LM: Adapting Stable LM 2 1.6B to Arabic
par: Alyafeai, Zaid, et autres
Publié: (2024)
par: Alyafeai, Zaid, et autres
Publié: (2024)
Seismic Performance of Low‐Damage Prefabricated Segmental Post‐Tensioned Bridge Columns With Hybrid Connections
par: Tariq Al‐Qadi, et autres
Publié: (2026)
par: Tariq Al‐Qadi, et autres
Publié: (2026)
Comparative Efficacy of Photodynamic Therapy Versus Cryotherapy for Actinic Keratosis: A Systematic Review and Meta‐Analysis of Randomized Controlled Trials
par: Saleh Aldraibi, et autres
Publié: (2026)
par: Saleh Aldraibi, et autres
Publié: (2026)
Documents similaires
-
Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps
par: Alzubaidi, Ahmed, et autres
Publié: (2025) -
3LM: Bridging Arabic, STEM, and Code through Benchmarking
par: Boussaha, Basma El Amel, et autres
Publié: (2025) -
Falcon2-11B Technical Report
par: Malartic, Quentin, et autres
Publié: (2024) -
Maximizing the Potential of Synthetic Data: Insights from Random Matrix Theory
par: Firdoussi, Aymane El, et autres
Publié: (2024) -
New Variations and Structural Refinements of Discrete Weighted Jensen and Hermite–Hadamard Inequalities Using ( α , m)‐Convex Mappings
par: Shama Firdous, et autres
Publié: (2026)