Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
Fuente:
arXiv
Guardado en:
| Autores principales: | Zaghouani, Wajdi, Aldous, Kholoud K., Gao, Yicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
por: Zaghouani, Wajdi, et al.
Publicado: (2025)
por: Zaghouani, Wajdi, et al.
Publicado: (2025)
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
por: Zaghouani, Wajdi
Publicado: (2026)
por: Zaghouani, Wajdi
Publicado: (2026)
Building Arabic NLP from the Ground Up: Twenty Years of Lessons, Failures, and Open Problems
por: Zaghouani, Wajdi
Publicado: (2026)
por: Zaghouani, Wajdi
Publicado: (2026)
Cultural Adaptation in Large Language Models for Political Discourse
por: Zaghouani, Wajdi
Publicado: (2026)
por: Zaghouani, Wajdi
Publicado: (2026)
An Annotated Corpus of Arabic Tweets for Hate Speech Analysis
por: Zaghouani, Wajdi, et al.
Publicado: (2025)
por: Zaghouani, Wajdi, et al.
Publicado: (2025)
AraHopeCorpus: Annotation Guidelines and Dataset for Hope Speech in Arabic Social Media Crisis Discourse
por: Sharqawi, Esra'a, et al.
Publicado: (2026)
por: Sharqawi, Esra'a, et al.
Publicado: (2026)
Chinese Offensive Language Detection:Current Status and Future Directions
por: Xiao, Yunze, et al.
Publicado: (2024)
por: Xiao, Yunze, et al.
Publicado: (2024)
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis
por: Biswas, Md. Rafiul, et al.
Publicado: (2025)
por: Biswas, Md. Rafiul, et al.
Publicado: (2025)
ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
Cohesion-6K: An Arabic Dataset for Analyzing Social Cohesion and Conflict in Online Discourse
por: Al-Athba, Aisha Ali, et al.
Publicado: (2026)
por: Al-Athba, Aisha Ali, et al.
Publicado: (2026)
MemeMind at ArAIEval Shared Task: Spotting Persuasive Spans in Arabic Text with Persuasion Techniques Identification
por: Biswas, Md Rafiul, et al.
Publicado: (2024)
por: Biswas, Md Rafiul, et al.
Publicado: (2024)
Nullpointer at CheckThat! 2024: Identifying Subjectivity from Multilingual Text Sequence
por: Biswas, Md. Rafiul, et al.
Publicado: (2024)
por: Biswas, Md. Rafiul, et al.
Publicado: (2024)
ArabDiscrim: A Decade-Long Arabic Facebook Corpus on Racism and Discrimination
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
JobArabi: An Arabic Corpus and Analysis of Job Announcements from Social Media
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
Audience Engagement with Arabic Women's Social Empowerment and Wellbeing: A Decadal Corpus
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
por: Zaghouani, Wajdi, et al.
Publicado: (2026)
Propaganda to Hate: A Multimodal Analysis of Arabic Memes with Multi-Agent LLMs
por: Alam, Firoj, et al.
Publicado: (2024)
por: Alam, Firoj, et al.
Publicado: (2024)
Transformers and Ensemble methods: A solution for Hate Speech Detection in Arabic languages
por: de Paula, Angel Felipe Magnossão, et al.
Publicado: (2023)
por: de Paula, Angel Felipe Magnossão, et al.
Publicado: (2023)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
por: Zhang, Hengxiang, et al.
Publicado: (2024)
por: Zhang, Hengxiang, et al.
Publicado: (2024)
Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domains
por: Ramesh, Krithika, et al.
Publicado: (2024)
por: Ramesh, Krithika, et al.
Publicado: (2024)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
por: Song, Jialin, et al.
Publicado: (2026)
por: Song, Jialin, et al.
Publicado: (2026)
How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
por: Khanmohammadi, Reza, et al.
Publicado: (2026)
Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression
por: Xu, Zhichao, et al.
Publicado: (2024)
por: Xu, Zhichao, et al.
Publicado: (2024)
Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domains
por: Chu, Xu, et al.
Publicado: (2025)
por: Chu, Xu, et al.
Publicado: (2025)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
por: Ramesh, Krithika, et al.
Publicado: (2025)
por: Ramesh, Krithika, et al.
Publicado: (2025)
ThatiAR: Subjectivity Detection in Arabic News Sentences
por: Suwaileh, Reem, et al.
Publicado: (2024)
por: Suwaileh, Reem, et al.
Publicado: (2024)
CORTEX: Collaborative LLM Agents for High-Stakes Alert Triage
por: Wei, Bowen, et al.
Publicado: (2025)
por: Wei, Bowen, et al.
Publicado: (2025)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
por: Zhang, Yunhao, et al.
Publicado: (2024)
por: Zhang, Yunhao, et al.
Publicado: (2024)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
por: Zhao, Haochen, et al.
Publicado: (2024)
por: Zhao, Haochen, et al.
Publicado: (2024)
A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains
por: Wang, Shirui, et al.
Publicado: (2025)
por: Wang, Shirui, et al.
Publicado: (2025)
Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking
por: Messing, Solomon
Publicado: (2026)
por: Messing, Solomon
Publicado: (2026)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented Generation
por: Wang, Shuting, et al.
Publicado: (2024)
por: Wang, Shuting, et al.
Publicado: (2024)
The FIGNEWS Shared Task on News Media Narratives
por: Zaghouani, Wajdi, et al.
Publicado: (2024)
por: Zaghouani, Wajdi, et al.
Publicado: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
por: Kong, Shufeng, et al.
Publicado: (2025)
por: Kong, Shufeng, et al.
Publicado: (2025)
FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain
por: Zeng, Lingfeng, et al.
Publicado: (2025)
por: Zeng, Lingfeng, et al.
Publicado: (2025)
From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise
por: Sharma, Nitin, et al.
Publicado: (2025)
por: Sharma, Nitin, et al.
Publicado: (2025)
PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech
por: Piskala, Deepak Babu
Publicado: (2025)
por: Piskala, Deepak Babu
Publicado: (2025)
Ejemplares similares
-
AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian
por: Zaghouani, Wajdi, et al.
Publicado: (2026) -
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
por: Zaghouani, Wajdi, et al.
Publicado: (2025) -
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
por: Zaghouani, Wajdi
Publicado: (2026) -
Building Arabic NLP from the Ground Up: Twenty Years of Lessons, Failures, and Open Problems
por: Zaghouani, Wajdi
Publicado: (2026) -
Cultural Adaptation in Large Language Models for Political Discourse
por: Zaghouani, Wajdi
Publicado: (2026)