Saved in:
| Main Authors: | Akben, Mustafa, Satko, Aaron |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2506.16575 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
by: Bianchi, Federico, et al.
Published: (2024)
by: Bianchi, Federico, et al.
Published: (2024)
Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment
by: Zhao, Jing, et al.
Published: (2026)
by: Zhao, Jing, et al.
Published: (2026)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
Self-HarmLLM: Can Large Language Model Harm Itself?
by: Kim, Heehwan, et al.
Published: (2025)
by: Kim, Heehwan, et al.
Published: (2025)
Harmful Suicide Content Detection
by: Park, Kyumin, et al.
Published: (2024)
by: Park, Kyumin, et al.
Published: (2024)
Beyond Accuracy: An Explainability-Driven Analysis of Harmful Content Detection
by: Dhara, Trishita, et al.
Published: (2026)
by: Dhara, Trishita, et al.
Published: (2026)
Moderating Harm: Benchmarking Large Language Models for Cyberbullying Detection in YouTube Comments
by: Muminovic, Amel
Published: (2025)
by: Muminovic, Amel
Published: (2025)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
by: Huang, Tiansheng, et al.
Published: (2024)
by: Huang, Tiansheng, et al.
Published: (2024)
Towards Explainable Harmful Meme Detection through Multimodal Debate between Large Language Models
by: Lin, Hongzhan, et al.
Published: (2024)
by: Lin, Hongzhan, et al.
Published: (2024)
Silicon Minds versus Human Hearts: The Wisdom of Crowds Beats the Wisdom of AI in Emotion Recognition
by: Akben, Mustafa, et al.
Published: (2025)
by: Akben, Mustafa, et al.
Published: (2025)
OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst
by: Cao, Jingtao, et al.
Published: (2024)
by: Cao, Jingtao, et al.
Published: (2024)
Detection of Illicit Content on Online Marketplaces using Large Language Models
by: Tran, Quoc Khoa, et al.
Published: (2026)
by: Tran, Quoc Khoa, et al.
Published: (2026)
AI Content Self-Detection for Transformer-based Large Language Models
by: Caiado, Antônio Junior Alves, et al.
Published: (2023)
by: Caiado, Antônio Junior Alves, et al.
Published: (2023)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
by: Orgad, Hadas, et al.
Published: (2026)
by: Orgad, Hadas, et al.
Published: (2026)
Re-ranking Using Large Language Models for Mitigating Exposure to Harmful Content on Social Media Platforms
by: Oak, Rajvardhan, et al.
Published: (2025)
by: Oak, Rajvardhan, et al.
Published: (2025)
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples
by: Sun, Qixin, et al.
Published: (2025)
by: Sun, Qixin, et al.
Published: (2025)
Are LLMs Enough for Hyperpartisan, Fake, Polarized and Harmful Content Detection? Evaluating In-Context Learning vs. Fine-Tuning
by: Maggini, Michele Joshua, et al.
Published: (2025)
by: Maggini, Michele Joshua, et al.
Published: (2025)
FairBelief -- Assessing Harmful Beliefs in Language Models
by: Setzu, Mattia, et al.
Published: (2024)
by: Setzu, Mattia, et al.
Published: (2024)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
by: Liu, Junjie, et al.
Published: (2023)
by: Liu, Junjie, et al.
Published: (2023)
Large Language Models and Arabic Content: A Review
by: Rhel, Haneh, et al.
Published: (2025)
by: Rhel, Haneh, et al.
Published: (2025)
Integrating Randomness in Large Language Models: A Linear Congruential Generator Approach for Generating Clinically Relevant Content
by: Bouras, Andrew
Published: (2024)
by: Bouras, Andrew
Published: (2024)
Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models
by: Bonagiri, Akash, et al.
Published: (2025)
by: Bonagiri, Akash, et al.
Published: (2025)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
by: Kang, Hao, et al.
Published: (2024)
by: Kang, Hao, et al.
Published: (2024)
Helpful or Harmful? Exploring the Efficacy of Large Language Models for Online Grooming Prevention
by: Prosser, Ellie, et al.
Published: (2024)
by: Prosser, Ellie, et al.
Published: (2024)
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
by: Zhang, Zhibo, et al.
Published: (2024)
by: Zhang, Zhibo, et al.
Published: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
by: Chi, Zewen, et al.
Published: (2025)
by: Chi, Zewen, et al.
Published: (2025)
Deep Learning Detection Method for Large Language Models-Generated Scientific Content
by: Alhijawi, Bushra, et al.
Published: (2024)
by: Alhijawi, Bushra, et al.
Published: (2024)
Evaluating and Optimizing Educational Content with Large Language Model Judgments
by: He-Yueya, Joy, et al.
Published: (2024)
by: He-Yueya, Joy, et al.
Published: (2024)
Towards Comprehensive Detection of Chinese Harmful Memes
by: Lu, Junyu, et al.
Published: (2024)
by: Lu, Junyu, et al.
Published: (2024)
Integrating Large Language Models with Human Expertise for Disease Detection in Electronic Health Records
by: Pan, Jie, et al.
Published: (2025)
by: Pan, Jie, et al.
Published: (2025)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
by: Stranges, Nicholas, et al.
Published: (2026)
by: Stranges, Nicholas, et al.
Published: (2026)
Emergence of Hierarchical Emotion Organization in Large Language Models
by: Zhao, Bo, et al.
Published: (2025)
by: Zhao, Bo, et al.
Published: (2025)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
by: Li, Yige, et al.
Published: (2025)
by: Li, Yige, et al.
Published: (2025)
Do Large Language Models Need a Content Delivery Network?
by: Cheng, Yihua, et al.
Published: (2024)
by: Cheng, Yihua, et al.
Published: (2024)
Abstract Activation Spaces for Content-Invariant Reasoning in Large Language Models
by: Maraia, Gabriele, et al.
Published: (2026)
by: Maraia, Gabriele, et al.
Published: (2026)
Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation
by: Lee, Huije, et al.
Published: (2026)
by: Lee, Huije, et al.
Published: (2026)
Similar Items
-
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
by: Bianchi, Federico, et al.
Published: (2024) -
Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment
by: Zhao, Jing, et al.
Published: (2026) -
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
by: Huang, Hsiang-Wei, et al.
Published: (2026) -
Self-HarmLLM: Can Large Language Model Harm Itself?
by: Kim, Heehwan, et al.
Published: (2025) -
Harmful Suicide Content Detection
by: Park, Kyumin, et al.
Published: (2024)