CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Zhaozhi, Altam, Faroq, Alqurishi, Muhammad, Souissi, Riad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Increasing the Thinking Budget is Not All You Need
por: Iacobacci, Ignacio, et al.
Publicado: (2025)
por: Iacobacci, Ignacio, et al.
Publicado: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
por: Hijazi, Faris, et al.
Publicado: (2024)
por: Hijazi, Faris, et al.
Publicado: (2024)
Sadeed: Advancing Arabic Diacritization Through Small Language Model
por: Aldallal, Zeina, et al.
Publicado: (2025)
por: Aldallal, Zeina, et al.
Publicado: (2025)
Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks
por: Alwajih, Fakhraddin, et al.
Publicado: (2024)
por: Alwajih, Fakhraddin, et al.
Publicado: (2024)
Open Universal Arabic ASR Leaderboard
por: Wang, Yingzhi, et al.
Publicado: (2024)
por: Wang, Yingzhi, et al.
Publicado: (2024)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
por: Altakrori, Malik H., et al.
Publicado: (2025)
por: Altakrori, Malik H., et al.
Publicado: (2025)
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
por: Hennara, Khalil, et al.
Publicado: (2025)
por: Hennara, Khalil, et al.
Publicado: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
por: Alhumud, Anas, et al.
Publicado: (2026)
por: Alhumud, Anas, et al.
Publicado: (2026)
BALSAM: A Platform for Benchmarking Arabic Large Language Models
por: Al-Matham, Rawan, et al.
Publicado: (2025)
por: Al-Matham, Rawan, et al.
Publicado: (2025)
BUSTED at AraGenEval Shared Task: A Comparative Study of Transformer-Based Models for Arabic AI-Generated Text Detection
por: Zain, Ali, et al.
Publicado: (2025)
por: Zain, Ali, et al.
Publicado: (2025)
Arabic Automatic Story Generation with Large Language Models
por: El-Shangiti, Ahmed Oumar, et al.
Publicado: (2024)
por: El-Shangiti, Ahmed Oumar, et al.
Publicado: (2024)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2026)
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2026)
Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic
por: Alwajih, Fakhraddin, et al.
Publicado: (2024)
por: Alwajih, Fakhraddin, et al.
Publicado: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
por: Panda, Srikant, et al.
Publicado: (2025)
por: Panda, Srikant, et al.
Publicado: (2025)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
por: Yu, Linhao, et al.
Publicado: (2024)
por: Yu, Linhao, et al.
Publicado: (2024)
MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
por: Pombal, José, et al.
Publicado: (2025)
por: Pombal, José, et al.
Publicado: (2025)
Jawaher: A Multidialectal Dataset of Arabic Proverbs for LLM Benchmarking
por: Magdy, Samar M., et al.
Publicado: (2025)
por: Magdy, Samar M., et al.
Publicado: (2025)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Optimizing Agricultural Research: A RAG-Based Approach to Mycorrhizal Fungi Information
por: Altam, Mohammad Usman, et al.
Publicado: (2025)
por: Altam, Mohammad Usman, et al.
Publicado: (2025)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
por: Al-Khalifa, Shahad, et al.
Publicado: (2024)
por: Al-Khalifa, Shahad, et al.
Publicado: (2024)
NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
por: Mikhailov, Vladislav, et al.
Publicado: (2025)
por: Mikhailov, Vladislav, et al.
Publicado: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
por: Ma, Guoqing, et al.
Publicado: (2025)
por: Ma, Guoqing, et al.
Publicado: (2025)
Advancing Complex Medical Communication in Arabic with Sporo AraSum: Surpassing Existing Large Language Models
por: Lee, Chanseo, et al.
Publicado: (2024)
por: Lee, Chanseo, et al.
Publicado: (2024)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
por: Mao, Kangkun, et al.
Publicado: (2025)
por: Mao, Kangkun, et al.
Publicado: (2025)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
por: Daoud, Mouath Abu, et al.
Publicado: (2025)
por: Daoud, Mouath Abu, et al.
Publicado: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
por: AlDahoul, Nouar, et al.
Publicado: (2025)
por: AlDahoul, Nouar, et al.
Publicado: (2025)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
por: Ouyang, Shuyin, et al.
Publicado: (2026)
por: Ouyang, Shuyin, et al.
Publicado: (2026)
ALLaM: Large Language Models for Arabic and English
por: Bari, M Saiful, et al.
Publicado: (2024)
por: Bari, M Saiful, et al.
Publicado: (2024)
Large Language Models and Arabic Content: A Review
por: Rhel, Haneh, et al.
Publicado: (2025)
por: Rhel, Haneh, et al.
Publicado: (2025)
Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs
por: Alwajih, Fakhraddin, et al.
Publicado: (2025)
por: Alwajih, Fakhraddin, et al.
Publicado: (2025)
A Survey of Large Language Models for Arabic Language and its Dialects
por: Mashaabi, Malak, et al.
Publicado: (2024)
por: Mashaabi, Malak, et al.
Publicado: (2024)
EpiK-Eval: Evaluation for Language Models as Epistemic Models
por: Prato, Gabriele, et al.
Publicado: (2023)
por: Prato, Gabriele, et al.
Publicado: (2023)
CriticEval: Evaluating Large Language Model as Critic
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning
por: Wang, Bin, et al.
Publicado: (2023)
por: Wang, Bin, et al.
Publicado: (2023)
The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectness
por: Shaban, Sanad, et al.
Publicado: (2025)
por: Shaban, Sanad, et al.
Publicado: (2025)
SaudiCulture: A Benchmark for Evaluating Large Language Models Cultural Competence within Saudi Arabia
por: Ayash, Lama, et al.
Publicado: (2025)
por: Ayash, Lama, et al.
Publicado: (2025)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
CausalEval: Towards Better Causal Reasoning in Language Models
por: Yu, Longxuan, et al.
Publicado: (2024)
por: Yu, Longxuan, et al.
Publicado: (2024)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
Ejemplares similares
-
Increasing the Thinking Budget is Not All You Need
por: Iacobacci, Ignacio, et al.
Publicado: (2025) -
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
por: Hijazi, Faris, et al.
Publicado: (2024) -
Sadeed: Advancing Arabic Diacritization Through Small Language Model
por: Aldallal, Zeina, et al.
Publicado: (2025) -
Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks
por: Alwajih, Fakhraddin, et al.
Publicado: (2024) -
Open Universal Arabic ASR Leaderboard
por: Wang, Yingzhi, et al.
Publicado: (2024)