Exploring Multimodal Challenges in Toxic Chinese Detection: Taxonomy, Benchmark, and Findings
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Shujian, Cui, Shiyao, Hu, Chuanrui, Wang, Haicheng, Zhang, Tianwei, Huang, Minlie, Lu, Jialiang, Qiu, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection
di: Delaval, Axel, et al.
Pubblicazione: (2025)
di: Delaval, Axel, et al.
Pubblicazione: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Benchmark on Peer Review Toxic Detection: A Challenging Task with a New Dataset
di: Luo, Man, et al.
Pubblicazione: (2025)
di: Luo, Man, et al.
Pubblicazione: (2025)
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
TIM: A Large-Scale Dataset and large Timeline Intelligence Model for Open-domain Timeline Summarization
di: Hu, Chuanrui, et al.
Pubblicazione: (2025)
di: Hu, Chuanrui, et al.
Pubblicazione: (2025)
Benchmarking Sociolinguistic Diversity in Swahili NLP: A Taxonomy-Guided Approach
di: Oketch, Kezia, et al.
Pubblicazione: (2025)
di: Oketch, Kezia, et al.
Pubblicazione: (2025)
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
ToXCL: A Unified Framework for Toxic Speech Detection and Explanation
di: Hoang, Nhat M., et al.
Pubblicazione: (2024)
di: Hoang, Nhat M., et al.
Pubblicazione: (2024)
Explore the Potential of LLMs in Misinformation Detection: An Empirical Study
di: Chen, Mengyang, et al.
Pubblicazione: (2023)
di: Chen, Mengyang, et al.
Pubblicazione: (2023)
Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure
di: Lu, Yida, et al.
Pubblicazione: (2026)
di: Lu, Yida, et al.
Pubblicazione: (2026)
ToxiCloakCN: Evaluating Robustness of Offensive Language Detection in Chinese with Cloaking Perturbations
di: Xiao, Yunze, et al.
Pubblicazione: (2024)
di: Xiao, Yunze, et al.
Pubblicazione: (2024)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
di: Lyu, Hanjia, et al.
Pubblicazione: (2025)
di: Lyu, Hanjia, et al.
Pubblicazione: (2025)
Speculating LLMs' Chinese Training Data Pollution from Their Tokens
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
di: Cai, Yunna, et al.
Pubblicazione: (2025)
di: Cai, Yunna, et al.
Pubblicazione: (2025)
Challenges and Innovations in LLM-Powered Fake News Detection: A Synthesis of Approaches and Future Directions
di: Yi, Jingyuan, et al.
Pubblicazione: (2025)
di: Yi, Jingyuan, et al.
Pubblicazione: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
Toxic comments reduce the activity of volunteer editors on Wikipedia
di: Smirnov, Ivan, et al.
Pubblicazione: (2023)
di: Smirnov, Ivan, et al.
Pubblicazione: (2023)
Tackling Social Bias against the Poor: A Dataset and Taxonomy on Aporophobia
di: Curto, Georgina, et al.
Pubblicazione: (2025)
di: Curto, Georgina, et al.
Pubblicazione: (2025)
Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework
di: Jain, Shomik, et al.
Pubblicazione: (2025)
di: Jain, Shomik, et al.
Pubblicazione: (2025)
Polarized Patterns of Language Toxicity and Sentiment of Debunking Posts on Social Media
di: Xu, Wentao, et al.
Pubblicazione: (2025)
di: Xu, Wentao, et al.
Pubblicazione: (2025)
iNews: A Multimodal Dataset for Modeling Personalized Affective Responses to News
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
di: Yang, Yan, et al.
Pubblicazione: (2025)
di: Yang, Yan, et al.
Pubblicazione: (2025)
The Monetisation of Toxicity: Analysing YouTube Content Creators and Controversy-Driven Engagement
di: Bertaglia, Thales, et al.
Pubblicazione: (2024)
di: Bertaglia, Thales, et al.
Pubblicazione: (2024)
SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations
di: Berriche, Manon, et al.
Pubblicazione: (2025)
di: Berriche, Manon, et al.
Pubblicazione: (2025)
A Modular Taxonomy for Hate Speech Definitions and Its Impact on Zero-Shot LLM Classification Performance
di: Melis, Matteo, et al.
Pubblicazione: (2025)
di: Melis, Matteo, et al.
Pubblicazione: (2025)
Human Decision-making is Susceptible to AI-driven Manipulation
di: Sabour, Sahand, et al.
Pubblicazione: (2025)
di: Sabour, Sahand, et al.
Pubblicazione: (2025)
Mapping Toxic Comments Across Demographics: A Dataset from German Public Broadcasting
di: Fillies, Jan, et al.
Pubblicazione: (2025)
di: Fillies, Jan, et al.
Pubblicazione: (2025)
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
di: Dutta, Arka, et al.
Pubblicazione: (2023)
di: Dutta, Arka, et al.
Pubblicazione: (2023)
When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools
di: Li, Xingming, et al.
Pubblicazione: (2026)
di: Li, Xingming, et al.
Pubblicazione: (2026)
Training in translation tools and technologies: Findings of the EMT survey 2023
di: Rothwell, Andrew, et al.
Pubblicazione: (2025)
di: Rothwell, Andrew, et al.
Pubblicazione: (2025)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
The Superalignment of Superhuman Intelligence with Large Language Models
di: Huang, Minlie, et al.
Pubblicazione: (2024)
di: Huang, Minlie, et al.
Pubblicazione: (2024)
Bad Actor, Good Advisor: Exploring the Role of Large Language Models in Fake News Detection
di: Hu, Beizhe, et al.
Pubblicazione: (2023)
di: Hu, Beizhe, et al.
Pubblicazione: (2023)
Domain-Independent Deception: A New Taxonomy and Linguistic Analysis
di: Verma, Rakesh M., et al.
Pubblicazione: (2024)
di: Verma, Rakesh M., et al.
Pubblicazione: (2024)
MALIBU Benchmark: Multi-Agent LLM Implicit Bias Uncovered
di: Mirza, Imran, et al.
Pubblicazione: (2025)
di: Mirza, Imran, et al.
Pubblicazione: (2025)
Safety Evaluation and Enhancement of DeepSeek Models in Chinese Contexts
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
di: Zhang, Wenjing, et al.
Pubblicazione: (2025)
AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains
di: Szelestey, Adam, et al.
Pubblicazione: (2026)
di: Szelestey, Adam, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection
di: Delaval, Axel, et al.
Pubblicazione: (2025) -
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025) -
Benchmark on Peer Review Toxic Detection: A Challenging Task with a New Dataset
di: Luo, Man, et al.
Pubblicazione: (2025) -
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025) -
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
di: Xu, Rongwu, et al.
Pubblicazione: (2024)