SLM-Mod: Small Language Models Surpass LLMs at Content Moderation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhan, Xianyang, Goyal, Agam, Chen, Yilun, Chandrasekharan, Eshwar, Saha, Koustuv |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoMoE: Mixture of Moderation Experts Framework for AI-Assisted Online Governance
par: Goyal, Agam, et autres
Publié: (2025)
par: Goyal, Agam, et autres
Publié: (2025)
VASTU: Value-Aligned Social Toolkit for Online Content Curation
par: Goyal, Agam, et autres
Publié: (2026)
par: Goyal, Agam, et autres
Publié: (2026)
Algorithmic Cultivation: How Social Media Feeds Shape User Language
par: Pal, Olivia, et autres
Publié: (2026)
par: Pal, Olivia, et autres
Publié: (2026)
Answer Bubbles: Information Exposure in AI-Mediated Search
par: Huang, Michelle, et autres
Publié: (2026)
par: Huang, Michelle, et autres
Publié: (2026)
The Hidden Toll of Social Media News: Causal Effects on Psychosocial Wellbeing
par: Pal, Olivia, et autres
Publié: (2026)
par: Pal, Olivia, et autres
Publié: (2026)
Social Simulacra in the Wild: AI Agent Communities on Moltbook
par: Goyal, Agam, et autres
Publié: (2026)
par: Goyal, Agam, et autres
Publié: (2026)
ArgCMV: An Argument Summarization Benchmark for the LLM-era
par: Gurjar, Omkar, et autres
Publié: (2025)
par: Gurjar, Omkar, et autres
Publié: (2025)
From Plausible to Causal: Counterfactual Semantics for Policy Evaluation in Simulated Online Communities
par: Goyal, Agam, et autres
Publié: (2026)
par: Goyal, Agam, et autres
Publié: (2026)
The Language of Approval: Identifying the Drivers of Positive Feedback Online
par: Goyal, Agam, et autres
Publié: (2025)
par: Goyal, Agam, et autres
Publié: (2025)
Mind Your Ps and Qs: Supporting Positive Reinforcement in Moderation Through a Positive Queue
par: Lambert, Charlotte, et autres
Publié: (2025)
par: Lambert, Charlotte, et autres
Publié: (2025)
Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits
par: Shimgekar, Soorya Ram, et autres
Publié: (2026)
par: Shimgekar, Soorya Ram, et autres
Publié: (2026)
Uncovering the Internet's Hidden Values: An Empirical Study of Desirable Behavior Using Highly-Upvoted Content on Reddit
par: Goyal, Agam, et autres
Publié: (2024)
par: Goyal, Agam, et autres
Publié: (2024)
Does Positive Reinforcement Work?: A Quasi-Experimental Study of the Effects of Positive Feedback on Reddit
par: Lambert, Charlotte, et autres
Publié: (2024)
par: Lambert, Charlotte, et autres
Publié: (2024)
PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support
par: Kim, Jiwon, et autres
Publié: (2026)
par: Kim, Jiwon, et autres
Publié: (2026)
The Ranking Effect: How Algorithmic Rank Influences Attention on Social Media
par: Chan, Jackie, et autres
Publié: (2025)
par: Chan, Jackie, et autres
Publié: (2025)
Examining Algorithmic Curation on Social Media: An Empirical Audit of Reddit's r/popular Feed
par: Chan, Jackie, et autres
Publié: (2025)
par: Chan, Jackie, et autres
Publié: (2025)
AI Content Moderation in Therapy Conversations
par: Kim, Jiwon, et autres
Publié: (2026)
par: Kim, Jiwon, et autres
Publié: (2026)
LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback
par: Kim, Jiwon, et autres
Publié: (2026)
par: Kim, Jiwon, et autres
Publié: (2026)
Towards a Better Modqueue: Designing for Diversity Across Moderator Objectives and Workflows
par: Bajpai, Tanvi, et autres
Publié: (2024)
par: Bajpai, Tanvi, et autres
Publié: (2024)
"Think about it like you're a firefighter": Understanding How Reddit Moderators Use the Modqueue
par: Bajpai, Tanvi, et autres
Publié: (2025)
par: Bajpai, Tanvi, et autres
Publié: (2025)
SLM-SQL: An Exploration of Small Language Models for Text-to-SQL
par: Sheng, Lei, et autres
Publié: (2025)
par: Sheng, Lei, et autres
Publié: (2025)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
par: Wang, Yian, et autres
Publié: (2026)
par: Wang, Yian, et autres
Publié: (2026)
SLM as Guardian: Pioneering AI Safety with Small Language Models
par: Kwon, Ohjoon, et autres
Publié: (2024)
par: Kwon, Ohjoon, et autres
Publié: (2024)
Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders
par: Goyal, Agam, et autres
Publié: (2025)
par: Goyal, Agam, et autres
Publié: (2025)
Do We Know What They Know We Know? Calibrating Student Trust in AI and Human Responses Through Mutual Theory of Mind
par: Pal, Olivia, et autres
Publié: (2026)
par: Pal, Olivia, et autres
Publié: (2026)
Ideology-Based LLMs for Content Moderation
par: Civelli, Stefano, et autres
Publié: (2025)
par: Civelli, Stefano, et autres
Publié: (2025)
Detecting Early and Implicit Suicidal Ideation via Longitudinal and Information Environment Signals on Social Media
par: Shimgekar, Soorya Ram, et autres
Publié: (2025)
par: Shimgekar, Soorya Ram, et autres
Publié: (2025)
Do LLMs Surpass Encoders for Biomedical NER?
par: Obeidat, Motasem S, et autres
Publié: (2025)
par: Obeidat, Motasem S, et autres
Publié: (2025)
SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version
par: Pham, Nghiem Thanh, et autres
Publié: (2025)
par: Pham, Nghiem Thanh, et autres
Publié: (2025)
STAND-Guard: A Small Task-Adaptive Content Moderation Model
par: Wang, Minjia, et autres
Publié: (2024)
par: Wang, Minjia, et autres
Publié: (2024)
GmSLM : Generative Marmoset Spoken Language Modeling
par: Sternberg, Talia, et autres
Publié: (2025)
par: Sternberg, Talia, et autres
Publié: (2025)
Designing Usable Controls for Customizable Social Media Feeds
par: Choi, Frederick, et autres
Publié: (2025)
par: Choi, Frederick, et autres
Publié: (2025)
Agentic AI framework for End-to-End Medical Data Inference
par: Shimgekar, Soorya Ram, et autres
Publié: (2025)
par: Shimgekar, Soorya Ram, et autres
Publié: (2025)
SMART SLM: Structured Memory and Reasoning Transformer, A Small Language Model for Accurate Document Assistance
par: Dudeja, Divij, et autres
Publié: (2025)
par: Dudeja, Divij, et autres
Publié: (2025)
Legilimens: Practical and Unified Content Moderation for Large Language Model Services
par: Wu, Jialin, et autres
Publié: (2024)
par: Wu, Jialin, et autres
Publié: (2024)
Venire: A Machine Learning-Guided Panel Review System for Community Content Moderation
par: Koshy, Vinay, et autres
Publié: (2024)
par: Koshy, Vinay, et autres
Publié: (2024)
Are Large Language Models Truly Smarter Than Humans?
par: M, Eshwar Reddy, et autres
Publié: (2026)
par: M, Eshwar Reddy, et autres
Publié: (2026)
BingoGuard: LLM Content Moderation Tools with Risk Levels
par: Yin, Fan, et autres
Publié: (2025)
par: Yin, Fan, et autres
Publié: (2025)
Masking or Mitigating? Deconstructing the Impact of Query Rewriting on Retriever Biases in RAG
par: Goyal, Agam, et autres
Publié: (2026)
par: Goyal, Agam, et autres
Publié: (2026)
Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
par: Chou, Ju-Chieh, et autres
Publié: (2025)
par: Chou, Ju-Chieh, et autres
Publié: (2025)
Documents similaires
-
MoMoE: Mixture of Moderation Experts Framework for AI-Assisted Online Governance
par: Goyal, Agam, et autres
Publié: (2025) -
VASTU: Value-Aligned Social Toolkit for Online Content Curation
par: Goyal, Agam, et autres
Publié: (2026) -
Algorithmic Cultivation: How Social Media Feeds Shape User Language
par: Pal, Olivia, et autres
Publié: (2026) -
Answer Bubbles: Information Exposure in AI-Mediated Search
par: Huang, Michelle, et autres
Publié: (2026) -
The Hidden Toll of Social Media News: Causal Effects on Psychosocial Wellbeing
par: Pal, Olivia, et autres
Publié: (2026)