Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Tomašević, Aleksandar, Cvetković, Darja, Major, Sara, Maletić, Slobodan, Anđelković, Miroslav, Vranić, Ana, Stupovski, Boris, Vudragović, Dušan, Bogojević, Aleksandar, Dankulov, Marija Mitrović
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911620448387072
author Tomašević, Aleksandar
Cvetković, Darja
Major, Sara
Maletić, Slobodan
Anđelković, Miroslav
Vranić, Ana
Stupovski, Boris
Vudragović, Dušan
Bogojević, Aleksandar
Dankulov, Marija Mitrović
author_facet Tomašević, Aleksandar
Cvetković, Darja
Major, Sara
Maletić, Slobodan
Anđelković, Miroslav
Vranić, Ana
Stupovski, Boris
Vudragović, Dušan
Bogojević, Aleksandar
Dankulov, Marija Mitrović
contents Validation of LLM-agent social simulations remains underdeveloped, with most studies relying on subjective assessments or single runs. We address this gap by running 30 independent 30-day simulations of a technology forum modeled on Voat's v/technology, using stateless Dolphin Mistral 24B agents on the Y Social platform, and evaluating operational validity across five dimensions: activity patterns, network structure, toxicity, topical coverage, and stylistic convergence. Against 30 matched, non-overlapping 30-day Voat comparison windows, results show overlapping 99% confidence intervals for unique users, root posts, and daily active users, while comments, average thread length, and mean toxicity remain higher in simulation. Both simulated and empirical networks exhibit core-periphery structure, though simulated cores are larger and more diffuse and repeated interactions are less frequent. Topic alignment is near-complete, but toxicity is misallocated across content layers: simulated root posts are substantially more toxic than real submissions, while simulated comments are less toxic than Voat comments. These findings demonstrate that LLM agents in platform-faithful environments can reproduce familiar online regularities, while systematic divergences, particularly those linked to stateless agent design and content-layer calibration, point to concrete directions for future improvement.
format Preprint
id arxiv_https___arxiv_org_abs_2508_21740
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum
Tomašević, Aleksandar
Cvetković, Darja
Major, Sara
Maletić, Slobodan
Anđelković, Miroslav
Vranić, Ana
Stupovski, Boris
Vudragović, Dušan
Bogojević, Aleksandar
Dankulov, Marija Mitrović
Computers and Society
Social and Information Networks
Physics and Society
Validation of LLM-agent social simulations remains underdeveloped, with most studies relying on subjective assessments or single runs. We address this gap by running 30 independent 30-day simulations of a technology forum modeled on Voat's v/technology, using stateless Dolphin Mistral 24B agents on the Y Social platform, and evaluating operational validity across five dimensions: activity patterns, network structure, toxicity, topical coverage, and stylistic convergence. Against 30 matched, non-overlapping 30-day Voat comparison windows, results show overlapping 99% confidence intervals for unique users, root posts, and daily active users, while comments, average thread length, and mean toxicity remain higher in simulation. Both simulated and empirical networks exhibit core-periphery structure, though simulated cores are larger and more diffuse and repeated interactions are less frequent. Topic alignment is near-complete, but toxicity is misallocated across content layers: simulated root posts are substantially more toxic than real submissions, while simulated comments are less toxic than Voat comments. These findings demonstrate that LLM agents in platform-faithful environments can reproduce familiar online regularities, while systematic divergences, particularly those linked to stateless agent design and content-layer calibration, point to concrete directions for future improvement.
title Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum
topic Computers and Society
Social and Information Networks
Physics and Society
url https://arxiv.org/abs/2508.21740