The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chenxu, Li, Chaozhuo, Liu, Songyang, Chen, Zejian, Hou, Jinyu, Qi, Ji, Li, Rui, Zhang, Litian, Ye, Qiwei, Liu, Zheng, Chen, Xu, Zhang, Xi, Yu, Philip S. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
par: Liu, Songyang, et autres
Publié: (2026)
par: Liu, Songyang, et autres
Publié: (2026)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
par: Liu, Songyang, et autres
Publié: (2026)
par: Liu, Songyang, et autres
Publié: (2026)
Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
par: Liu, Songyang, et autres
Publié: (2025)
par: Liu, Songyang, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
One SPACE to Rule Them All: Jointly Mitigating Factuality and Faithfulness Hallucinations in LLMs
par: Wang, Pengbo, et autres
Publié: (2025)
par: Wang, Pengbo, et autres
Publié: (2025)
Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models
par: Li, Chaozhuo, et autres
Publié: (2025)
par: Li, Chaozhuo, et autres
Publié: (2025)
LANCET: Neural Intervention via Structural Entropy for Mitigating Faithfulness Hallucinations in LLMs
par: Wang, Chenxu, et autres
Publié: (2026)
par: Wang, Chenxu, et autres
Publié: (2026)
Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction
par: Tang, Zhihao, et autres
Publié: (2025)
par: Tang, Zhihao, et autres
Publié: (2025)
Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
par: Pu, Rui, et autres
Publié: (2025)
par: Pu, Rui, et autres
Publié: (2025)
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
par: Pu, Rui, et autres
Publié: (2025)
par: Pu, Rui, et autres
Publié: (2025)
PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation
par: Yan, Bingyu, et autres
Publié: (2026)
par: Yan, Bingyu, et autres
Publié: (2026)
Agents in the Wild: Safety, Society, and the Illusion of Sociality on Moltbook
par: Zhang, Yunbei, et autres
Publié: (2026)
par: Zhang, Yunbei, et autres
Publié: (2026)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2024)
par: Zhou, Ziyi, et autres
Publié: (2024)
Collaborative Evolution: Multi-Round Learning Between Large and Small Language Models for Emergent Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2025)
par: Zhou, Ziyi, et autres
Publié: (2025)
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
par: Zhang, Xiaozhe, et autres
Publié: (2026)
par: Zhang, Xiaozhe, et autres
Publié: (2026)
Devil's Hand: Data Poisoning Attacks to Locally Private Graph Learning Protocols
par: He, Longzhu, et autres
Publié: (2025)
par: He, Longzhu, et autres
Publié: (2025)
Lifelong Evolution: Collaborative Learning between Large and Small Language Models for Continuous Emergent Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2025)
par: Zhou, Ziyi, et autres
Publié: (2025)
LLMs are Introvert
par: Zhang, Litian, et autres
Publié: (2025)
par: Zhang, Litian, et autres
Publié: (2025)
Structural Divergence Between AI-Agent and Human Social Networks in Moltbook
par: Hou, Wenpin, et autres
Publié: (2026)
par: Hou, Wenpin, et autres
Publié: (2026)
Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
Beyond Entity Alignment: Towards Complete Knowledge Graph Alignment via Entity-Relation Synergy
par: Fang, Xiaohan, et autres
Publié: (2024)
par: Fang, Xiaohan, et autres
Publié: (2024)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
par: Liu, Wenxiao, et autres
Publié: (2024)
par: Liu, Wenxiao, et autres
Publié: (2024)
The Moltbook Illusion: Separating Human Influence from Emergent Behavior in AI Agent Societies
par: Li, Ning
Publié: (2026)
par: Li, Ning
Publié: (2026)
The Rise of AI Agent Communities: Large-Scale Analysis of Discourse and Interaction on Moltbook
par: Li, Lingyao, et autres
Publié: (2026)
par: Li, Lingyao, et autres
Publié: (2026)
The Devil Behind the Mirror: Tracking the Campaigns of Cryptocurrency Abuses on the Dark Web
par: Xia, Pengcheng, et autres
Publié: (2024)
par: Xia, Pengcheng, et autres
Publié: (2024)
Map-Agnostic And Interactive Safety-Critical Scenario Generation via Multi-Objective Tree Search
par: Li, Wenyun, et autres
Publié: (2026)
par: Li, Wenyun, et autres
Publié: (2026)
Navigating the Black Box: Leveraging LLMs for Effective Text-Level Graph Injection Attacks
par: Lyu, Yuefei, et autres
Publié: (2025)
par: Lyu, Yuefei, et autres
Publié: (2025)
T3MAL: Test-Time Fast Adaptation for Robust Multi-Scale Information Diffusion Prediction
par: Zhu, Wenting, et autres
Publié: (2025)
par: Zhu, Wenting, et autres
Publié: (2025)
Generalizing Knowledge Graph Embedding with Universal Orthogonal Parameterization
par: Li, Rui, et autres
Publié: (2024)
par: Li, Rui, et autres
Publié: (2024)
Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems
par: Yan, Bingyu, et autres
Publié: (2025)
par: Yan, Bingyu, et autres
Publié: (2025)
Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS
par: Yan, Bingyu, et autres
Publié: (2025)
par: Yan, Bingyu, et autres
Publié: (2025)
Exploring Silicon-Based Societies: An Early Study of the Moltbook Agent Community
par: Lin, Yu-Zheng, et autres
Publié: (2026)
par: Lin, Yu-Zheng, et autres
Publié: (2026)
Falsifying Anthropics
par: Kaloper, Nemanja, et autres
Publié: (2024)
par: Kaloper, Nemanja, et autres
Publié: (2024)
Reasoning Paths as Signals: Augmenting Multi-hop Fact Verification through Structural Reasoning Progression
par: Zheng, Liwen, et autres
Publié: (2025)
par: Zheng, Liwen, et autres
Publié: (2025)
Optimal plug-in Gaussian processes for modeling derivatives
par: Liu, Zejian, et autres
Publié: (2022)
par: Liu, Zejian, et autres
Publié: (2022)
Mapping the Vanishing and Transformation of Urban Villages in China
par: Zhang, Wenyu, et autres
Publié: (2025)
par: Zhang, Wenyu, et autres
Publié: (2025)
How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity
par: Ma, Zihan, et autres
Publié: (2025)
par: Ma, Zihan, et autres
Publié: (2025)
A Universal Electronic Structure Modulation Strategy: Is Strong Adsorption Always Correlated with High Catalysis?
par: Mengyu Liu, et autres
Publié: (2024)
par: Mengyu Liu, et autres
Publié: (2024)
Documents similaires
-
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
par: Liu, Songyang, et autres
Publié: (2026) -
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
par: Liu, Songyang, et autres
Publié: (2026) -
Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
par: Chen, Zejian, et autres
Publié: (2026) -
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026) -
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
par: Liu, Songyang, et autres
Publié: (2025)