Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zaghouani, Wajdi, Aldous, Kholoud K., Gao, Yicheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
par: Zaghouani, Wajdi, et autres
Publié: (2025)
par: Zaghouani, Wajdi, et autres
Publié: (2025)
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
Building Arabic NLP from the Ground Up: Twenty Years of Lessons, Failures, and Open Problems
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
Cultural Adaptation in Large Language Models for Political Discourse
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
An Annotated Corpus of Arabic Tweets for Hate Speech Analysis
par: Zaghouani, Wajdi, et autres
Publié: (2025)
par: Zaghouani, Wajdi, et autres
Publié: (2025)
AraHopeCorpus: Annotation Guidelines and Dataset for Hope Speech in Arabic Social Media Crisis Discourse
par: Sharqawi, Esra'a, et autres
Publié: (2026)
par: Sharqawi, Esra'a, et autres
Publié: (2026)
Chinese Offensive Language Detection:Current Status and Future Directions
par: Xiao, Yunze, et autres
Publié: (2024)
par: Xiao, Yunze, et autres
Publié: (2024)
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis
par: Biswas, Md. Rafiul, et autres
Publié: (2025)
par: Biswas, Md. Rafiul, et autres
Publié: (2025)
ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
Cohesion-6K: An Arabic Dataset for Analyzing Social Cohesion and Conflict in Online Discourse
par: Al-Athba, Aisha Ali, et autres
Publié: (2026)
par: Al-Athba, Aisha Ali, et autres
Publié: (2026)
MemeMind at ArAIEval Shared Task: Spotting Persuasive Spans in Arabic Text with Persuasion Techniques Identification
par: Biswas, Md Rafiul, et autres
Publié: (2024)
par: Biswas, Md Rafiul, et autres
Publié: (2024)
Nullpointer at CheckThat! 2024: Identifying Subjectivity from Multilingual Text Sequence
par: Biswas, Md. Rafiul, et autres
Publié: (2024)
par: Biswas, Md. Rafiul, et autres
Publié: (2024)
ArabDiscrim: A Decade-Long Arabic Facebook Corpus on Racism and Discrimination
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
JobArabi: An Arabic Corpus and Analysis of Job Announcements from Social Media
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
Audience Engagement with Arabic Women's Social Empowerment and Wellbeing: A Decadal Corpus
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
Propaganda to Hate: A Multimodal Analysis of Arabic Memes with Multi-Agent LLMs
par: Alam, Firoj, et autres
Publié: (2024)
par: Alam, Firoj, et autres
Publié: (2024)
Transformers and Ensemble methods: A solution for Hate Speech Detection in Arabic languages
par: de Paula, Angel Felipe Magnossão, et autres
Publié: (2023)
par: de Paula, Angel Felipe Magnossão, et autres
Publié: (2023)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domains
par: Ramesh, Krithika, et autres
Publié: (2024)
par: Ramesh, Krithika, et autres
Publié: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
par: Song, Jialin, et autres
Publié: (2026)
par: Song, Jialin, et autres
Publié: (2026)
How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains
par: Khanmohammadi, Reza, et autres
Publié: (2026)
par: Khanmohammadi, Reza, et autres
Publié: (2026)
Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression
par: Xu, Zhichao, et autres
Publié: (2024)
par: Xu, Zhichao, et autres
Publié: (2024)
Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domains
par: Chu, Xu, et autres
Publié: (2025)
par: Chu, Xu, et autres
Publié: (2025)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
par: Ramesh, Krithika, et autres
Publié: (2025)
par: Ramesh, Krithika, et autres
Publié: (2025)
ThatiAR: Subjectivity Detection in Arabic News Sentences
par: Suwaileh, Reem, et autres
Publié: (2024)
par: Suwaileh, Reem, et autres
Publié: (2024)
CORTEX: Collaborative LLM Agents for High-Stakes Alert Triage
par: Wei, Bowen, et autres
Publié: (2025)
par: Wei, Bowen, et autres
Publié: (2025)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
par: Zhang, Yunhao, et autres
Publié: (2024)
par: Zhang, Yunhao, et autres
Publié: (2024)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
par: Zhao, Haochen, et autres
Publié: (2024)
par: Zhao, Haochen, et autres
Publié: (2024)
A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains
par: Wang, Shirui, et autres
Publié: (2025)
par: Wang, Shirui, et autres
Publié: (2025)
Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking
par: Messing, Solomon
Publié: (2026)
par: Messing, Solomon
Publié: (2026)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented Generation
par: Wang, Shuting, et autres
Publié: (2024)
par: Wang, Shuting, et autres
Publié: (2024)
The FIGNEWS Shared Task on News Media Narratives
par: Zaghouani, Wajdi, et autres
Publié: (2024)
par: Zaghouani, Wajdi, et autres
Publié: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
par: Kong, Shufeng, et autres
Publié: (2025)
par: Kong, Shufeng, et autres
Publié: (2025)
FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain
par: Zeng, Lingfeng, et autres
Publié: (2025)
par: Zeng, Lingfeng, et autres
Publié: (2025)
PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech
par: Piskala, Deepak Babu
Publié: (2025)
par: Piskala, Deepak Babu
Publié: (2025)
From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise
par: Sharma, Nitin, et autres
Publié: (2025)
par: Sharma, Nitin, et autres
Publié: (2025)
Documents similaires
-
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
par: Zaghouani, Wajdi, et autres
Publié: (2026) -
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
par: Zaghouani, Wajdi, et autres
Publié: (2025) -
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
par: Zaghouani, Wajdi
Publié: (2026) -
Building Arabic NLP from the Ground Up: Twenty Years of Lessons, Failures, and Open Problems
par: Zaghouani, Wajdi
Publié: (2026) -
Cultural Adaptation in Large Language Models for Political Discourse
par: Zaghouani, Wajdi
Publié: (2026)