CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Zhaozhi, Altam, Faroq, Alqurishi, Muhammad, Souissi, Riad |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Increasing the Thinking Budget is Not All You Need
par: Iacobacci, Ignacio, et autres
Publié: (2025)
par: Iacobacci, Ignacio, et autres
Publié: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
par: Hijazi, Faris, et autres
Publié: (2024)
par: Hijazi, Faris, et autres
Publié: (2024)
Sadeed: Advancing Arabic Diacritization Through Small Language Model
par: Aldallal, Zeina, et autres
Publié: (2025)
par: Aldallal, Zeina, et autres
Publié: (2025)
Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks
par: Alwajih, Fakhraddin, et autres
Publié: (2024)
par: Alwajih, Fakhraddin, et autres
Publié: (2024)
Open Universal Arabic ASR Leaderboard
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
par: Altakrori, Malik H., et autres
Publié: (2025)
par: Altakrori, Malik H., et autres
Publié: (2025)
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
par: Hennara, Khalil, et autres
Publié: (2025)
par: Hennara, Khalil, et autres
Publié: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
par: Alhumud, Anas, et autres
Publié: (2026)
par: Alhumud, Anas, et autres
Publié: (2026)
BALSAM: A Platform for Benchmarking Arabic Large Language Models
par: Al-Matham, Rawan, et autres
Publié: (2025)
par: Al-Matham, Rawan, et autres
Publié: (2025)
BUSTED at AraGenEval Shared Task: A Comparative Study of Transformer-Based Models for Arabic AI-Generated Text Detection
par: Zain, Ali, et autres
Publié: (2025)
par: Zain, Ali, et autres
Publié: (2025)
Arabic Automatic Story Generation with Large Language Models
par: El-Shangiti, Ahmed Oumar, et autres
Publié: (2024)
par: El-Shangiti, Ahmed Oumar, et autres
Publié: (2024)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2026)
Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic
par: Alwajih, Fakhraddin, et autres
Publié: (2024)
par: Alwajih, Fakhraddin, et autres
Publié: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
par: Pombal, José, et autres
Publié: (2025)
par: Pombal, José, et autres
Publié: (2025)
Jawaher: A Multidialectal Dataset of Arabic Proverbs for LLM Benchmarking
par: Magdy, Samar M., et autres
Publié: (2025)
par: Magdy, Samar M., et autres
Publié: (2025)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Optimizing Agricultural Research: A RAG-Based Approach to Mycorrhizal Fungi Information
par: Altam, Mohammad Usman, et autres
Publié: (2025)
par: Altam, Mohammad Usman, et autres
Publié: (2025)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
par: Al-Khalifa, Shahad, et autres
Publié: (2024)
par: Al-Khalifa, Shahad, et autres
Publié: (2024)
NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
par: Mikhailov, Vladislav, et autres
Publié: (2025)
par: Mikhailov, Vladislav, et autres
Publié: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
Advancing Complex Medical Communication in Arabic with Sporo AraSum: Surpassing Existing Large Language Models
par: Lee, Chanseo, et autres
Publié: (2024)
par: Lee, Chanseo, et autres
Publié: (2024)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
par: Mao, Kangkun, et autres
Publié: (2025)
par: Mao, Kangkun, et autres
Publié: (2025)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
par: Daoud, Mouath Abu, et autres
Publié: (2025)
par: Daoud, Mouath Abu, et autres
Publié: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
par: AlDahoul, Nouar, et autres
Publié: (2025)
par: AlDahoul, Nouar, et autres
Publié: (2025)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
par: Ouyang, Shuyin, et autres
Publié: (2026)
par: Ouyang, Shuyin, et autres
Publié: (2026)
ALLaM: Large Language Models for Arabic and English
par: Bari, M Saiful, et autres
Publié: (2024)
par: Bari, M Saiful, et autres
Publié: (2024)
Large Language Models and Arabic Content: A Review
par: Rhel, Haneh, et autres
Publié: (2025)
par: Rhel, Haneh, et autres
Publié: (2025)
Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs
par: Alwajih, Fakhraddin, et autres
Publié: (2025)
par: Alwajih, Fakhraddin, et autres
Publié: (2025)
A Survey of Large Language Models for Arabic Language and its Dialects
par: Mashaabi, Malak, et autres
Publié: (2024)
par: Mashaabi, Malak, et autres
Publié: (2024)
EpiK-Eval: Evaluation for Language Models as Epistemic Models
par: Prato, Gabriele, et autres
Publié: (2023)
par: Prato, Gabriele, et autres
Publié: (2023)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning
par: Wang, Bin, et autres
Publié: (2023)
par: Wang, Bin, et autres
Publié: (2023)
The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectness
par: Shaban, Sanad, et autres
Publié: (2025)
par: Shaban, Sanad, et autres
Publié: (2025)
SaudiCulture: A Benchmark for Evaluating Large Language Models Cultural Competence within Saudi Arabia
par: Ayash, Lama, et autres
Publié: (2025)
par: Ayash, Lama, et autres
Publié: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
CausalEval: Towards Better Causal Reasoning in Language Models
par: Yu, Longxuan, et autres
Publié: (2024)
par: Yu, Longxuan, et autres
Publié: (2024)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
Documents similaires
-
Increasing the Thinking Budget is Not All You Need
par: Iacobacci, Ignacio, et autres
Publié: (2025) -
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
par: Hijazi, Faris, et autres
Publié: (2024) -
Sadeed: Advancing Arabic Diacritization Through Small Language Model
par: Aldallal, Zeina, et autres
Publié: (2025) -
Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks
par: Alwajih, Fakhraddin, et autres
Publié: (2024) -
Open Universal Arabic ASR Leaderboard
par: Wang, Yingzhi, et autres
Publié: (2024)