ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Bates, Luke, Glockner, Max, Nakov, Preslav, Gurevych, Iryna
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866912557677150208
author Bates, Luke
Glockner, Max
Nakov, Preslav
Gurevych, Iryna
author_facet Bates, Luke
Glockner, Max
Nakov, Preslav
Gurevych, Iryna
contents Conspiracy theories erode public trust in science and institutions while resisting debunking by evolving and absorbing counter-evidence. As AI-generated misinformation becomes increasingly sophisticated, understanding rhetorical patterns in conspiratorial content is important for developing interventions such as targeted prebunking and assessing AI vulnerabilities. We introduce ConspirED (CONSPIR Evaluation Dataset), which captures the cognitive traits of conspiratorial ideation in multi-sentence excerpts (80--120 words) from online conspiracy articles, annotated using the CONSPIR cognitive framework (Lewandowsky and Cook, 2020). ConspirED is the first dataset of conspiratorial content annotated for general cognitive traits. Using ConspirED, we (i) develop computational models that identify conspiratorial traits and determine dominant traits in text excerpts, and (ii) evaluate large language/reasoning model (LLM/LRM) robustness to conspiratorial inputs. We find that both are misaligned by conspiratorial content, producing output that mirrors input reasoning patterns, even when successfully deflecting comparable fact-checked misinformation.
format Preprint
id arxiv_https___arxiv_org_abs_2508_20468
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
Bates, Luke
Glockner, Max
Nakov, Preslav
Gurevych, Iryna
Computation and Language
Conspiracy theories erode public trust in science and institutions while resisting debunking by evolving and absorbing counter-evidence. As AI-generated misinformation becomes increasingly sophisticated, understanding rhetorical patterns in conspiratorial content is important for developing interventions such as targeted prebunking and assessing AI vulnerabilities. We introduce ConspirED (CONSPIR Evaluation Dataset), which captures the cognitive traits of conspiratorial ideation in multi-sentence excerpts (80--120 words) from online conspiracy articles, annotated using the CONSPIR cognitive framework (Lewandowsky and Cook, 2020). ConspirED is the first dataset of conspiratorial content annotated for general cognitive traits. Using ConspirED, we (i) develop computational models that identify conspiratorial traits and determine dominant traits in text excerpts, and (ii) evaluate large language/reasoning model (LLM/LRM) robustness to conspiratorial inputs. We find that both are misaligned by conspiratorial content, producing output that mirrors input reasoning patterns, even when successfully deflecting comparable fact-checked misinformation.
title ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
topic Computation and Language
url https://arxiv.org/abs/2508.20468