SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Abdelnasser, Omar, Alharbi, Fatemah, Khasawneh, Khaled, Alouani, Ihsen, Fouda, Mohammed E. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
by: Zahran, Noureldin, et al.
Published: (2025)
by: Zahran, Noureldin, et al.
Published: (2025)
A Comprehensive Evaluation of Large Language Models on Mental Illnesses in Arabic Context
by: Zahran, Noureldin, et al.
Published: (2025)
by: Zahran, Noureldin, et al.
Published: (2025)
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
by: Fouda, Aya E., et al.
Published: (2025)
by: Fouda, Aya E., et al.
Published: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
by: Alhumud, Anas, et al.
Published: (2026)
by: Alhumud, Anas, et al.
Published: (2026)
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
by: Mamun, Md Abdullah Al, et al.
Published: (2025)
by: Mamun, Md Abdullah Al, et al.
Published: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
by: Zong, Xuanjun, et al.
Published: (2025)
by: Zong, Xuanjun, et al.
Published: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
by: Tu, Shangqing, et al.
Published: (2023)
by: Tu, Shangqing, et al.
Published: (2023)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
by: Zhang, Yazhou, et al.
Published: (2024)
by: Zhang, Yazhou, et al.
Published: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
by: Liu, Zheyuan, et al.
Published: (2026)
by: Liu, Zheyuan, et al.
Published: (2026)
Towards Safety Evaluations of Theory of Mind in Large Language Models
by: Aoshima, Tatsuhiro, et al.
Published: (2025)
by: Aoshima, Tatsuhiro, et al.
Published: (2025)
AHaSIS: Shared Task on Sentiment Analysis for Arabic Dialects
by: Alharbi, Maram, et al.
Published: (2025)
by: Alharbi, Maram, et al.
Published: (2025)
Towards stable AI systems for Evaluating Arabic Pronunciations
by: Zaatiti, Hadi, et al.
Published: (2025)
by: Zaatiti, Hadi, et al.
Published: (2025)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
by: Zbeeb, Mohammad, et al.
Published: (2025)
by: Zbeeb, Mohammad, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
SinaTools: Open Source Toolkit for Arabic Natural Language Processing
by: Hammouda, Tymaa, et al.
Published: (2024)
by: Hammouda, Tymaa, et al.
Published: (2024)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
by: Zhang, Wenjing, et al.
Published: (2024)
by: Zhang, Wenjing, et al.
Published: (2024)
Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
by: Bellaouar, Slimane, et al.
Published: (2025)
by: Bellaouar, Slimane, et al.
Published: (2025)
Bypassing Prompt Injection Detectors through Evasive Injections
by: Rahman, Md Jahedur, et al.
Published: (2026)
by: Rahman, Md Jahedur, et al.
Published: (2026)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
by: Parmar, Mihir, et al.
Published: (2024)
by: Parmar, Mihir, et al.
Published: (2024)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
by: Ali, Abdelrahman A., et al.
Published: (2024)
by: Ali, Abdelrahman A., et al.
Published: (2024)
Evasive Hardware Trojan through Adversarial Power Trace
by: Omidi, Behnam, et al.
Published: (2024)
by: Omidi, Behnam, et al.
Published: (2024)
A Derivational ChainBank for Modern Standard Arabic
by: Marzouk, Reham, et al.
Published: (2024)
by: Marzouk, Reham, et al.
Published: (2024)
ATHAR: A High-Quality and Diverse Dataset for Classical Arabic to English Translation
by: Khalil, Mohammed, et al.
Published: (2024)
by: Khalil, Mohammed, et al.
Published: (2024)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
by: Altakrori, Malik H., et al.
Published: (2025)
by: Altakrori, Malik H., et al.
Published: (2025)
Arabic Dialect Classification using RNNs, Transformers, and Large Language Models: A Comparative Analysis
by: Essameldin, Omar A., et al.
Published: (2025)
by: Essameldin, Omar A., et al.
Published: (2025)
LM-Fix: Lightweight Bit-Flip Detection and Rapid Recovery Framework for Language Models
by: Tahmasivand, Ahmad, et al.
Published: (2025)
by: Tahmasivand, Ahmad, et al.
Published: (2025)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026)
by: Liu, Junyu, et al.
Published: (2026)
OLMES: A Standard for Language Model Evaluations
by: Gu, Yuling, et al.
Published: (2024)
by: Gu, Yuling, et al.
Published: (2024)
Liars' Bench: Evaluating Lie Detectors for Language Models
by: Kretschmar, Kieron, et al.
Published: (2025)
by: Kretschmar, Kieron, et al.
Published: (2025)
AI Text Detectors and the Misclassification of Slightly Polished Arabic Text
by: Almohaimeed, Saleh, et al.
Published: (2025)
by: Almohaimeed, Saleh, et al.
Published: (2025)
ArabianGPT: Native Arabic GPT-based Large Language Model
by: Koubaa, Anis, et al.
Published: (2024)
by: Koubaa, Anis, et al.
Published: (2024)
Towards More Standardized AI Evaluation: From Models to Agents
by: Filali, Ali El, et al.
Published: (2026)
by: Filali, Ali El, et al.
Published: (2026)
Kuwain 1.5B: An Arabic SLM via Language Injection
by: Hennara, Khalil, et al.
Published: (2025)
by: Hennara, Khalil, et al.
Published: (2025)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
by: Sabour, Sahand, et al.
Published: (2024)
by: Sabour, Sahand, et al.
Published: (2024)
Arabic Automatic Story Generation with Large Language Models
by: El-Shangiti, Ahmed Oumar, et al.
Published: (2024)
by: El-Shangiti, Ahmed Oumar, et al.
Published: (2024)
Large Language Models and Arabic Content: A Review
by: Rhel, Haneh, et al.
Published: (2025)
by: Rhel, Haneh, et al.
Published: (2025)
ALLaM: Large Language Models for Arabic and English
by: Bari, M Saiful, et al.
Published: (2024)
by: Bari, M Saiful, et al.
Published: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)
by: Lu, Yida, et al.
Published: (2025)
Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2026)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2026)
GATech at AbjadMed: Bidirectional Encoders vs. Causal Decoders: Insights from 82-Class Arabic Medical Classification
by: Khamis, Ahmed Khaled
Published: (2026)
by: Khamis, Ahmed Khaled
Published: (2026)
Similar Items
-
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
by: Zahran, Noureldin, et al.
Published: (2025) -
A Comprehensive Evaluation of Large Language Models on Mental Illnesses in Arabic Context
by: Zahran, Noureldin, et al.
Published: (2025) -
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
by: Fouda, Aya E., et al.
Published: (2025) -
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
by: Alhumud, Anas, et al.
Published: (2026) -
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
by: Mamun, Md Abdullah Al, et al.
Published: (2025)