Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Kaituo, Jiang, Zhimeng, Zou, Na |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection
by: Yang, Bo, et al.
Published: (2025)
by: Yang, Bo, et al.
Published: (2025)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
by: Tian, Yuanhe, et al.
Published: (2025)
by: Tian, Yuanhe, et al.
Published: (2025)
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
by: Nickel, Christian, et al.
Published: (2026)
by: Nickel, Christian, et al.
Published: (2026)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
by: Wang, Hongbo, et al.
Published: (2025)
by: Wang, Hongbo, et al.
Published: (2025)
Theory of Mind in Large Language Models: Assessment and Enhancement
by: Chen, Ruirui, et al.
Published: (2025)
by: Chen, Ruirui, et al.
Published: (2025)
Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning
by: Luo, Zhimeng, et al.
Published: (2025)
by: Luo, Zhimeng, et al.
Published: (2025)
DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
by: Li, Yu, et al.
Published: (2024)
by: Li, Yu, et al.
Published: (2024)
TasTe: Teaching Large Language Models to Translate through Self-Reflection
by: Wang, Yutong, et al.
Published: (2024)
by: Wang, Yutong, et al.
Published: (2024)
Psychomatics -- A Multidisciplinary Framework for Understanding Artificial Minds
by: Riva, Giuseppe, et al.
Published: (2024)
by: Riva, Giuseppe, et al.
Published: (2024)
A Novel Self-Evolution Framework for Large Language Models
by: Sun, Haoran, et al.
Published: (2025)
by: Sun, Haoran, et al.
Published: (2025)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
by: Wang, Yian, et al.
Published: (2026)
by: Wang, Yian, et al.
Published: (2026)
ToMBench: Benchmarking Theory of Mind in Large Language Models
by: Chen, Zhuang, et al.
Published: (2024)
by: Chen, Zhuang, et al.
Published: (2024)
Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study
by: Hu, Zhengyu, et al.
Published: (2025)
by: Hu, Zhengyu, et al.
Published: (2025)
Probing the Robustness of Theory of Mind in Large Language Models
by: Nickel, Christian, et al.
Published: (2024)
by: Nickel, Christian, et al.
Published: (2024)
DynamicMind: A Tri-Mode Thinking System for Large Language Models
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
LiveMind: Low-latency Large Language Models with Simultaneous Inference
by: Chen, Chuangtao, et al.
Published: (2024)
by: Chen, Chuangtao, et al.
Published: (2024)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
by: Kim, Hyunwoo, et al.
Published: (2025)
by: Kim, Hyunwoo, et al.
Published: (2025)
Towards Safety Evaluations of Theory of Mind in Large Language Models
by: Aoshima, Tatsuhiro, et al.
Published: (2025)
by: Aoshima, Tatsuhiro, et al.
Published: (2025)
Parameter-Efficient Detoxification with Contrastive Decoding
by: Niu, Tong, et al.
Published: (2024)
by: Niu, Tong, et al.
Published: (2024)
Cleanse: Uncertainty Estimation Approach Using Clustering-based Semantic Consistency in LLMs
by: Joo, Minsuh, et al.
Published: (2025)
by: Joo, Minsuh, et al.
Published: (2025)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
by: Qin, Kai, et al.
Published: (2026)
by: Qin, Kai, et al.
Published: (2026)
From LLM to Conversational Agent: A Memory Enhanced Architecture with Fine-Tuning of Large Language Models
by: Liu, Na, et al.
Published: (2024)
by: Liu, Na, et al.
Published: (2024)
Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
by: Liu, Kaiyuan, et al.
Published: (2025)
by: Liu, Kaiyuan, et al.
Published: (2025)
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
by: Lin, Fei, et al.
Published: (2025)
by: Lin, Fei, et al.
Published: (2025)
PersianMind: A Cross-Lingual Persian-English Large Language Model
by: Rostami, Pedram, et al.
Published: (2024)
by: Rostami, Pedram, et al.
Published: (2024)
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
by: Ma, Ziqiao, et al.
Published: (2023)
by: Ma, Ziqiao, et al.
Published: (2023)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
by: Bai, Yuzhuo, et al.
Published: (2025)
by: Bai, Yuzhuo, et al.
Published: (2025)
Theory of Mind for Multi-Agent Collaboration via Large Language Models
by: Li, Huao, et al.
Published: (2023)
by: Li, Huao, et al.
Published: (2023)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Multilingual and Explainable Text Detoxification with Parallel Corpora
by: Dementieva, Daryna, et al.
Published: (2024)
by: Dementieva, Daryna, et al.
Published: (2024)
BanglaNirTox: A Large-scale Parallel Corpus for Explainable AI in Bengali Text Detoxification
by: Mohsin, Ayesha Afroza, et al.
Published: (2025)
by: Mohsin, Ayesha Afroza, et al.
Published: (2025)
A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks
by: Nguyen, Hieu Minh "Jord"
Published: (2025)
by: Nguyen, Hieu Minh "Jord"
Published: (2025)
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
by: Zhu, Xudong, et al.
Published: (2025)
by: Zhu, Xudong, et al.
Published: (2025)
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
by: Xu, Fangzhi, et al.
Published: (2024)
by: Xu, Fangzhi, et al.
Published: (2024)
Less is More: Selective Reflection for Compatible and Efficient Knowledge Distillation in Large Language Models
by: Liu, Lingyuan, et al.
Published: (2025)
by: Liu, Lingyuan, et al.
Published: (2025)
MyGO Multiplex CoT: A Method for Self-Reflection in Large Language Models via Double Chain of Thought Thinking
by: Ji, Shihao, et al.
Published: (2025)
by: Ji, Shihao, et al.
Published: (2025)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
by: Zhang, Xiaoying, et al.
Published: (2025)
by: Zhang, Xiaoying, et al.
Published: (2025)
Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models
by: Chhikara, Prateek
Published: (2025)
by: Chhikara, Prateek
Published: (2025)
Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning
by: Yu, Yahan, et al.
Published: (2026)
by: Yu, Yahan, et al.
Published: (2026)
Similar Items
-
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection
by: Yang, Bo, et al.
Published: (2025) -
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
by: Tian, Yuanhe, et al.
Published: (2025) -
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
by: Nickel, Christian, et al.
Published: (2026) -
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
by: Wang, Hongbo, et al.
Published: (2025) -
Theory of Mind in Large Language Models: Assessment and Enhancement
by: Chen, Ruirui, et al.
Published: (2025)