OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Hainiu, Zhao, Runcong, Zhu, Lixing, Du, Jinhua, He, Yulan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SymbolicThought: Integrating Language Models and Symbolic Reasoning for Consistent and Interpretable Human Relationship Understanding
por: Zhao, Runcong, et al.
Publicado: (2025)
por: Zhao, Runcong, et al.
Publicado: (2025)
EnigmaToM: Improve LLMs' Theory-of-Mind Reasoning Capabilities with Neural Knowledge Base of Entity States
por: Xu, Hainiu, et al.
Publicado: (2025)
por: Xu, Hainiu, et al.
Publicado: (2025)
Large Language Models Fall Short: Understanding Complex Relationships in Detective Narratives
por: Zhao, Runcong, et al.
Publicado: (2024)
por: Zhao, Runcong, et al.
Publicado: (2024)
EvolvTrip: Enhancing Literary Character Understanding with Temporal Theory-of-Mind Graphs
por: Yang, Bohao, et al.
Publicado: (2025)
por: Yang, Bohao, et al.
Publicado: (2025)
Are NLP Models Good at Tracing Thoughts: An Overview of Narrative Understanding
por: Zhu, Lixing, et al.
Publicado: (2023)
por: Zhu, Lixing, et al.
Publicado: (2023)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
por: Li, Ce, et al.
Publicado: (2025)
por: Li, Ce, et al.
Publicado: (2025)
Soft Reasoning: Navigating Solution Spaces in Large Language Models through Controlled Embedding Exploration
por: Zhu, Qinglin, et al.
Publicado: (2025)
por: Zhu, Qinglin, et al.
Publicado: (2025)
Towards Unified Task Embeddings Across Multiple Models: Bridging the Gap for Prompt-Based Large Language Models and Beyond
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
PLAYER*: Enhancing LLM-based Multi-Agent Communication and Interaction in Murder Mystery Games
por: Zhu, Qinglin, et al.
Publicado: (2024)
por: Zhu, Qinglin, et al.
Publicado: (2024)
SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models
por: Zhang, Bin, et al.
Publicado: (2024)
por: Zhang, Bin, et al.
Publicado: (2024)
PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking
por: Zhu, Wang Bill, et al.
Publicado: (2026)
por: Zhu, Wang Bill, et al.
Publicado: (2026)
Dissecting Failure Dynamics in Large Language Model Reasoning
por: Zhu, Wei, et al.
Publicado: (2026)
por: Zhu, Wei, et al.
Publicado: (2026)
ToMBench: Benchmarking Theory of Mind in Large Language Models
por: Chen, Zhuang, et al.
Publicado: (2024)
por: Chen, Zhuang, et al.
Publicado: (2024)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
por: Kim, Hyunwoo, et al.
Publicado: (2025)
por: Kim, Hyunwoo, et al.
Publicado: (2025)
Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation
por: Hu, Zhanghao, et al.
Publicado: (2026)
por: Hu, Zhanghao, et al.
Publicado: (2026)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
por: Saxena, Yash, et al.
Publicado: (2024)
por: Saxena, Yash, et al.
Publicado: (2024)
When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
por: Amjad, Husnain, et al.
Publicado: (2026)
por: Amjad, Husnain, et al.
Publicado: (2026)
CodeMind: Evaluating Large Language Models for Code Reasoning
por: Liu, Changshu, et al.
Publicado: (2024)
por: Liu, Changshu, et al.
Publicado: (2024)
Towards Safety Evaluations of Theory of Mind in Large Language Models
por: Aoshima, Tatsuhiro, et al.
Publicado: (2025)
por: Aoshima, Tatsuhiro, et al.
Publicado: (2025)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
por: Hu, Xucong, et al.
Publicado: (2026)
por: Hu, Xucong, et al.
Publicado: (2026)
LearnLens: LLM-Enabled Personalised, Curriculum-Grounded Feedback with Educators in the Loop
por: Zhao, Runcong, et al.
Publicado: (2025)
por: Zhao, Runcong, et al.
Publicado: (2025)
Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?
por: Lu, Yi-Long, et al.
Publicado: (2025)
por: Lu, Yi-Long, et al.
Publicado: (2025)
ToM-LM: Delegating Theory of Mind Reasoning to External Symbolic Executors in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
por: Nickel, Christian, et al.
Publicado: (2026)
por: Nickel, Christian, et al.
Publicado: (2026)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
por: Tao, Zhengwei, et al.
Publicado: (2024)
por: Tao, Zhengwei, et al.
Publicado: (2024)
Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
por: Liu, Wei, et al.
Publicado: (2026)
por: Liu, Wei, et al.
Publicado: (2026)
Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models
por: Liu, Weize, et al.
Publicado: (2023)
por: Liu, Weize, et al.
Publicado: (2023)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
por: Xu, Fangzhi, et al.
Publicado: (2023)
por: Xu, Fangzhi, et al.
Publicado: (2023)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
Decompose-ToM: Enhancing Theory of Mind Reasoning in Large Language Models through Simulation and Task Decomposition
por: Sarangi, Sneheel, et al.
Publicado: (2025)
por: Sarangi, Sneheel, et al.
Publicado: (2025)
Multi-ToM: Evaluating Multilingual Theory of Mind Capabilities in Large Language Models
por: Sadhu, Jayanta, et al.
Publicado: (2024)
por: Sadhu, Jayanta, et al.
Publicado: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
por: Kasetty, Tejas, et al.
Publicado: (2024)
por: Kasetty, Tejas, et al.
Publicado: (2024)
Zero, Finite, and Infinite Belief History of Theory of Mind Reasoning in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
Sparse Activation Editing for Reliable Instruction Following in Narratives
por: Zhao, Runcong, et al.
Publicado: (2025)
por: Zhao, Runcong, et al.
Publicado: (2025)
Modeling Subjectivity in Cognitive Appraisal with Language Models
por: Zhou, Yuxiang, et al.
Publicado: (2025)
por: Zhou, Yuxiang, et al.
Publicado: (2025)
PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models
por: Song, Inpyo, et al.
Publicado: (2025)
por: Song, Inpyo, et al.
Publicado: (2025)
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
por: Neehal, Nafis, et al.
Publicado: (2024)
por: Neehal, Nafis, et al.
Publicado: (2024)
CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning
por: Sun, Zhaoyue, et al.
Publicado: (2026)
por: Sun, Zhaoyue, et al.
Publicado: (2026)
Ejemplares similares
-
SymbolicThought: Integrating Language Models and Symbolic Reasoning for Consistent and Interpretable Human Relationship Understanding
por: Zhao, Runcong, et al.
Publicado: (2025) -
EnigmaToM: Improve LLMs' Theory-of-Mind Reasoning Capabilities with Neural Knowledge Base of Entity States
por: Xu, Hainiu, et al.
Publicado: (2025) -
Large Language Models Fall Short: Understanding Complex Relationships in Detective Narratives
por: Zhao, Runcong, et al.
Publicado: (2024) -
EvolvTrip: Enhancing Literary Character Understanding with Temporal Theory-of-Mind Graphs
por: Yang, Bohao, et al.
Publicado: (2025) -
Are NLP Models Good at Tracing Thoughts: An Overview of Narrative Understanding
por: Zhu, Lixing, et al.
Publicado: (2023)