A Comparative Benchmark of a Moroccan Darija Toxicity Detection Model (Typica.ai) and Major LLM-Based Moderation APIs (OpenAI, Mistral, Anthropic)
Fuente:
arXiv
Salvato in:
| Autore principale: | Assoudi, Hicham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DarijaBanking: A New Resource for Overcoming Language Barriers in Banking Intent Detection for Moroccan Arabic Speakers
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2024)
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2024)
On Sarcasm Detection with OpenAI GPT-based Models
di: Gole, Montgomery, et al.
Pubblicazione: (2023)
di: Gole, Montgomery, et al.
Pubblicazione: (2023)
A Comparative Study on Reasoning Patterns of OpenAI's o1 Model
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
The Evolution of Darija Open Dataset: Introducing Version 2
di: Outchakoucht, Aissam, et al.
Pubblicazione: (2024)
di: Outchakoucht, Aissam, et al.
Pubblicazione: (2024)
Dialect2SQL: A Novel Text-to-SQL Dataset for Arabic Dialects with a Focus on Moroccan Darija
di: Chafik, Salmane, et al.
Pubblicazione: (2025)
di: Chafik, Salmane, et al.
Pubblicazione: (2025)
Implementing Systemic Thinking for Automatic Schema Matching: An Agent-Based Modeling Approach
di: Assoudi, Hicham, et al.
Pubblicazione: (2025)
di: Assoudi, Hicham, et al.
Pubblicazione: (2025)
A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models
di: Brokman, Aviv, et al.
Pubblicazione: (2025)
di: Brokman, Aviv, et al.
Pubblicazione: (2025)
OpenAI GPT-5 System Card
di: Singh, Aaditya, et al.
Pubblicazione: (2025)
di: Singh, Aaditya, et al.
Pubblicazione: (2025)
Benchmarking Llama2, Mistral, Gemma and GPT for Factuality, Toxicity, Bias and Propensity for Hallucinations
di: Nadeau, David, et al.
Pubblicazione: (2024)
di: Nadeau, David, et al.
Pubblicazione: (2024)
Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
di: Bi, Ziqian, et al.
Pubblicazione: (2025)
di: Bi, Ziqian, et al.
Pubblicazione: (2025)
Evaluation of OpenAI o1: Opportunities and Challenges of AGI
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
di: Zhong, Tianyang, et al.
Pubblicazione: (2024)
Benchmarking Floworks against OpenAI & Anthropic: A Novel Framework for Enhanced LLM Function Calling
di: Bhan, Nirav, et al.
Pubblicazione: (2024)
di: Bhan, Nirav, et al.
Pubblicazione: (2024)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
di: Andreyev, Allison
Pubblicazione: (2025)
di: Andreyev, Allison
Pubblicazione: (2025)
AI Governance and Accountability: An Analysis of Anthropic's Claude
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
A Case Study of Web App Coding with OpenAI Reasoning Models
di: Cui, Yi
Pubblicazione: (2024)
di: Cui, Yi
Pubblicazione: (2024)
LLM Platform Security: Applying a Systematic Evaluation Framework to OpenAI's ChatGPT Plugins
di: Iqbal, Umar, et al.
Pubblicazione: (2023)
di: Iqbal, Umar, et al.
Pubblicazione: (2023)
GemMaroc: Unlocking Darija Proficiency in LLMs with Minimal Data
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2025)
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2025)
Evaluating Text Summaries Generated by Large Language Models Using OpenAI's GPT
di: Shakil, Hassan, et al.
Pubblicazione: (2024)
di: Shakil, Hassan, et al.
Pubblicazione: (2024)
OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language
di: Inuwa-Dutse, Isa
Pubblicazione: (2025)
di: Inuwa-Dutse, Isa
Pubblicazione: (2025)
Lost in Moderation: How Commercial Content Moderation APIs Over- and Under-Moderate Group-Targeted Hate Speech and Linguistic Variations
di: Hartmann, David, et al.
Pubblicazione: (2025)
di: Hartmann, David, et al.
Pubblicazione: (2025)
Evaluating OpenAI GPT Models for Translation of Endangered Uralic Languages: A Comparison of Reasoning and Non-Reasoning Architectures
di: Tereshchenko, Yehor, et al.
Pubblicazione: (2025)
di: Tereshchenko, Yehor, et al.
Pubblicazione: (2025)
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
di: Berezin, Sergey, et al.
Pubblicazione: (2024)
di: Berezin, Sergey, et al.
Pubblicazione: (2024)
The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies
di: Wang, Chenxu, et al.
Pubblicazione: (2026)
di: Wang, Chenxu, et al.
Pubblicazione: (2026)
Benchmarking LLM for Code Smells Detection: OpenAI GPT-4.0 vs DeepSeek-V3
di: Sadik, Ahmed R., et al.
Pubblicazione: (2025)
di: Sadik, Ahmed R., et al.
Pubblicazione: (2025)
Benchmarking LLM Guardrails in Handling Multilingual Toxicity
di: Yang, Yahan, et al.
Pubblicazione: (2024)
di: Yang, Yahan, et al.
Pubblicazione: (2024)
Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?
di: Sun, Albert Yu, et al.
Pubblicazione: (2023)
di: Sun, Albert Yu, et al.
Pubblicazione: (2023)
Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content
di: Furniturewala, Shaz, et al.
Pubblicazione: (2025)
di: Furniturewala, Shaz, et al.
Pubblicazione: (2025)
Comparative Analysis of OpenAI GPT-4o and DeepSeek R1 for Scientific Text Categorization Using Prompt Engineering
di: Maiti, Aniruddha, et al.
Pubblicazione: (2025)
di: Maiti, Aniruddha, et al.
Pubblicazione: (2025)
Analysing the Public Discourse around OpenAI's Text-To-Video Model 'Sora' using Topic Modeling
di: Parikh, Vatsal Vinay
Pubblicazione: (2024)
di: Parikh, Vatsal Vinay
Pubblicazione: (2024)
MTUncertainty: Assessing the Need for Post-editing of Machine Translation Outputs by Fine-tuning OpenAI LLMs
di: Gladkoff, Serge, et al.
Pubblicazione: (2023)
di: Gladkoff, Serge, et al.
Pubblicazione: (2023)
How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)
di: Himmelreich, Johannes
Pubblicazione: (2026)
di: Himmelreich, Johannes
Pubblicazione: (2026)
System 2 thinking in OpenAI's o1-preview model: Near-perfect performance on a mathematics exam
di: de Winter, Joost, et al.
Pubblicazione: (2024)
di: de Winter, Joost, et al.
Pubblicazione: (2024)
Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods
di: Shendabadi, Ali, et al.
Pubblicazione: (2026)
di: Shendabadi, Ali, et al.
Pubblicazione: (2026)
Evaluating Test-Time Scaling LLMs for Legal Reasoning: OpenAI o1, DeepSeek-R1, and Beyond
di: Hu, Yinghao, et al.
Pubblicazione: (2025)
di: Hu, Yinghao, et al.
Pubblicazione: (2025)
In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b
di: Durner, Nils
Pubblicazione: (2025)
di: Durner, Nils
Pubblicazione: (2025)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
A Large-Scale Empirical Analysis of Custom GPTs' Vulnerabilities in the OpenAI Ecosystem
di: Ogundoyin, Sunday Oyinlola, et al.
Pubblicazione: (2025)
di: Ogundoyin, Sunday Oyinlola, et al.
Pubblicazione: (2025)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
di: Ou, Jiefu, et al.
Pubblicazione: (2024)
di: Ou, Jiefu, et al.
Pubblicazione: (2024)
Large Malaysian Language Model Based on Mistral for Enhanced Local Language Understanding
di: Zolkepli, Husein, et al.
Pubblicazione: (2024)
di: Zolkepli, Husein, et al.
Pubblicazione: (2024)
When a language model is optimized for reasoning, does it still show embers of autoregression? An analysis of OpenAI o1
di: McCoy, R. Thomas, et al.
Pubblicazione: (2024)
di: McCoy, R. Thomas, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DarijaBanking: A New Resource for Overcoming Language Barriers in Banking Intent Detection for Moroccan Arabic Speakers
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2024) -
On Sarcasm Detection with OpenAI GPT-based Models
di: Gole, Montgomery, et al.
Pubblicazione: (2023) -
A Comparative Study on Reasoning Patterns of OpenAI's o1 Model
di: Wu, Siwei, et al.
Pubblicazione: (2024) -
The Evolution of Darija Open Dataset: Introducing Version 2
di: Outchakoucht, Aissam, et al.
Pubblicazione: (2024) -
Dialect2SQL: A Novel Text-to-SQL Dataset for Arabic Dialects with a Focus on Moroccan Darija
di: Chafik, Salmane, et al.
Pubblicazione: (2025)