Towards Safety Evaluations of Theory of Mind in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Aoshima, Tatsuhiro, Akiyama, Mitsuaki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks
por: Nguyen, Hieu Minh "Jord"
Publicado: (2025)
por: Nguyen, Hieu Minh "Jord"
Publicado: (2025)
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
Theory of Mind in Large Language Models: Assessment and Enhancement
por: Chen, Ruirui, et al.
Publicado: (2025)
por: Chen, Ruirui, et al.
Publicado: (2025)
Probing the Robustness of Theory of Mind in Large Language Models
por: Nickel, Christian, et al.
Publicado: (2024)
por: Nickel, Christian, et al.
Publicado: (2024)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
por: Kim, Hyunwoo, et al.
Publicado: (2025)
por: Kim, Hyunwoo, et al.
Publicado: (2025)
ToMBench: Benchmarking Theory of Mind in Large Language Models
por: Chen, Zhuang, et al.
Publicado: (2024)
por: Chen, Zhuang, et al.
Publicado: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
por: Xu, Hainiu, et al.
Publicado: (2024)
por: Xu, Hainiu, et al.
Publicado: (2024)
Theory of Mind for Multi-Agent Collaboration via Large Language Models
por: Li, Huao, et al.
Publicado: (2023)
por: Li, Huao, et al.
Publicado: (2023)
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection
por: Yang, Bo, et al.
Publicado: (2025)
por: Yang, Bo, et al.
Publicado: (2025)
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
por: Nickel, Christian, et al.
Publicado: (2026)
por: Nickel, Christian, et al.
Publicado: (2026)
Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm
por: Babarczy, Anna, et al.
Publicado: (2026)
por: Babarczy, Anna, et al.
Publicado: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
por: Lu, Yida, et al.
Publicado: (2025)
por: Lu, Yida, et al.
Publicado: (2025)
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
por: Getachew, Nathaniel, et al.
Publicado: (2025)
por: Getachew, Nathaniel, et al.
Publicado: (2025)
Zero, Finite, and Infinite Belief History of Theory of Mind Reasoning in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
por: Wang, Yixu, et al.
Publicado: (2026)
por: Wang, Yixu, et al.
Publicado: (2026)
Evaluating Psychological Safety of Large Language Models
por: Li, Xingxuan, et al.
Publicado: (2022)
por: Li, Xingxuan, et al.
Publicado: (2022)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models
por: Abdelnasser, Omar, et al.
Publicado: (2026)
por: Abdelnasser, Omar, et al.
Publicado: (2026)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
por: Wu, Yuheng, et al.
Publicado: (2025)
por: Wu, Yuheng, et al.
Publicado: (2025)
CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models
por: Li, Mengfan, et al.
Publicado: (2026)
por: Li, Mengfan, et al.
Publicado: (2026)
ToM-LM: Delegating Theory of Mind Reasoning to External Symbolic Executors in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks
por: Gong, Nanxu, et al.
Publicado: (2026)
por: Gong, Nanxu, et al.
Publicado: (2026)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
por: Torres-Fonseca, Josue, et al.
Publicado: (2026)
por: Torres-Fonseca, Josue, et al.
Publicado: (2026)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
por: Tuan, Yi-Lin, et al.
Publicado: (2024)
por: Tuan, Yi-Lin, et al.
Publicado: (2024)
Towards Inference-time Category-wise Safety Steering for Large Language Models
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
por: Hu, Xucong, et al.
Publicado: (2026)
por: Hu, Xucong, et al.
Publicado: (2026)
Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models
por: Shinoda, Kazutoshi, et al.
Publicado: (2025)
por: Shinoda, Kazutoshi, et al.
Publicado: (2025)
Decompose-ToM: Enhancing Theory of Mind Reasoning in Large Language Models through Simulation and Task Decomposition
por: Sarangi, Sneheel, et al.
Publicado: (2025)
por: Sarangi, Sneheel, et al.
Publicado: (2025)
SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
por: Röttger, Paul, et al.
Publicado: (2024)
por: Röttger, Paul, et al.
Publicado: (2024)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
por: Gupta, Prannaya, et al.
Publicado: (2024)
por: Gupta, Prannaya, et al.
Publicado: (2024)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
por: Yang, Haotong, et al.
Publicado: (2023)
por: Yang, Haotong, et al.
Publicado: (2023)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
por: Zong, Xuanjun, et al.
Publicado: (2025)
por: Zong, Xuanjun, et al.
Publicado: (2025)
Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning
por: Wagner, Eitan, et al.
Publicado: (2024)
por: Wagner, Eitan, et al.
Publicado: (2024)
Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind
por: Ying, Lance, et al.
Publicado: (2024)
por: Ying, Lance, et al.
Publicado: (2024)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
por: Yu, Erxin, et al.
Publicado: (2024)
por: Yu, Erxin, et al.
Publicado: (2024)
LiveMind: Low-latency Large Language Models with Simultaneous Inference
por: Chen, Chuangtao, et al.
Publicado: (2024)
por: Chen, Chuangtao, et al.
Publicado: (2024)
Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?
por: Lu, Yi-Long, et al.
Publicado: (2025)
por: Lu, Yi-Long, et al.
Publicado: (2025)
Language-Informed Synthesis of Rational Agent Models for Grounded Theory-of-Mind Reasoning On-The-Fly
por: Ying, Lance, et al.
Publicado: (2025)
por: Ying, Lance, et al.
Publicado: (2025)
Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models
por: Choi, Younwoo, et al.
Publicado: (2025)
por: Choi, Younwoo, et al.
Publicado: (2025)
Grounding Language about Belief in a Bayesian Theory-of-Mind
por: Ying, Lance, et al.
Publicado: (2024)
por: Ying, Lance, et al.
Publicado: (2024)
Ejemplares similares
-
A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks
por: Nguyen, Hieu Minh "Jord"
Publicado: (2025) -
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023) -
Theory of Mind in Large Language Models: Assessment and Enhancement
por: Chen, Ruirui, et al.
Publicado: (2025) -
Probing the Robustness of Theory of Mind in Large Language Models
por: Nickel, Christian, et al.
Publicado: (2024) -
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
por: Kim, Hyunwoo, et al.
Publicado: (2025)