ToMBench: Benchmarking Theory of Mind in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Zhuang, Wu, Jincenzi, Zhou, Jinfeng, Wen, Bosi, Bi, Guanqun, Jiang, Gongyao, Cao, Yaru, Hu, Mengting, Lai, Yunghwei, Xiong, Zexuan, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
COKE: A Cognitive Knowledge Graph for Machine Theory of Mind
di: Wu, Jincenzi, et al.
Pubblicazione: (2023)
di: Wu, Jincenzi, et al.
Pubblicazione: (2023)
CharacterBench: Benchmarking Character Customization of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
UniToMBench: Integrating Perspective-Taking to Improve Theory of Mind in LLMs
di: Thiyagarajan, Prameshwar, et al.
Pubblicazione: (2025)
di: Thiyagarajan, Prameshwar, et al.
Pubblicazione: (2025)
T2MBench: A Benchmark for Out-of-Distribution Text-to-Motion Generation
di: Yang, Bin, et al.
Pubblicazione: (2026)
di: Yang, Bin, et al.
Pubblicazione: (2026)
SS-GEN: A Social Story Generation Framework with Large Language Models
di: Feng, Yi, et al.
Pubblicazione: (2024)
di: Feng, Yi, et al.
Pubblicazione: (2024)
Beyond Words: Evaluating and Bridging Epistemic Divergence in User-Agent Interaction via Theory of Mind
di: Ruan, Minyuan, et al.
Pubblicazione: (2026)
di: Ruan, Minyuan, et al.
Pubblicazione: (2026)
Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric Reasoning
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
A Group Fairness Lens for Large Language Models
di: Bi, Guanqun, et al.
Pubblicazione: (2023)
di: Bi, Guanqun, et al.
Pubblicazione: (2023)
SocialEval: Evaluating Social Intelligence of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning
di: Zhong, Xuanyue, et al.
Pubblicazione: (2026)
di: Zhong, Xuanyue, et al.
Pubblicazione: (2026)
MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
Chart-CoCa: Self-Improving Chart Understanding of Vision LMs via Code-Driven Synthesis and Candidate-Conditioned Answering
di: Jiang, Gongyao, et al.
Pubblicazione: (2025)
di: Jiang, Gongyao, et al.
Pubblicazione: (2025)
PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments
di: Chen, Zhuang, et al.
Pubblicazione: (2026)
di: Chen, Zhuang, et al.
Pubblicazione: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
Position: Theory of Mind Benchmarks are Broken for Large Language Models
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
JRE-L: Journalist, Reader, and Editor LLMs in the Loop for Science Journalism for the General Audience
di: Jiang, Gongyao, et al.
Pubblicazione: (2025)
di: Jiang, Gongyao, et al.
Pubblicazione: (2025)
LLM-Collaboration on Automatic Science Journalism for the General Audience
di: Jiang, Gongyao, et al.
Pubblicazione: (2024)
di: Jiang, Gongyao, et al.
Pubblicazione: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2026)
di: Wen, Bosi, et al.
Pubblicazione: (2026)
Benchmarking Complex Instruction-Following with Multiple Constraints Composition
di: Wen, Bosi, et al.
Pubblicazione: (2024)
di: Wen, Bosi, et al.
Pubblicazione: (2024)
MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
PersuasiveToM: A Benchmark for Evaluating Machine Theory of Mind in Persuasive Dialogues
di: Yu, Fangxu, et al.
Pubblicazione: (2025)
di: Yu, Fangxu, et al.
Pubblicazione: (2025)
Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
di: Lee, Seungbeen, et al.
Pubblicazione: (2025)
di: Lee, Seungbeen, et al.
Pubblicazione: (2025)
Learn from the Past: Language-conditioned Object Rearrangement with Large Language Models
di: Cao, Guanqun, et al.
Pubblicazione: (2025)
di: Cao, Guanqun, et al.
Pubblicazione: (2025)
HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
di: Wen, Bosi, et al.
Pubblicazione: (2025)
di: Wen, Bosi, et al.
Pubblicazione: (2025)
Patient-Zero: Scaling Synthetic Patient Agents to Real-World Distributions without Real Patient Data
di: Lai, Yunghwei, et al.
Pubblicazione: (2025)
di: Lai, Yunghwei, et al.
Pubblicazione: (2025)
Theory of Mind in Large Language Models: Assessment and Enhancement
di: Chen, Ruirui, et al.
Pubblicazione: (2025)
di: Chen, Ruirui, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
Towards Optimal Learning of Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
MAGI: Multi-Agent Guided Interview for Psychiatric Assessment
di: Bi, Guanqun, et al.
Pubblicazione: (2025)
di: Bi, Guanqun, et al.
Pubblicazione: (2025)
The Effects of Market Power Discrepancy on Trade Credit Scales: A Paradoxical Perspective of Digitalization
di: Weiqing Wang, et al.
Pubblicazione: (2025)
di: Weiqing Wang, et al.
Pubblicazione: (2025)
The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
di: Gong, Linlu, et al.
Pubblicazione: (2025)
di: Gong, Linlu, et al.
Pubblicazione: (2025)
Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
di: Lai, Yunghwei, et al.
Pubblicazione: (2025)
di: Lai, Yunghwei, et al.
Pubblicazione: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
di: Ke, Pei, et al.
Pubblicazione: (2023)
di: Ke, Pei, et al.
Pubblicazione: (2023)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
Beyond Context to Cognitive Appraisal: Emotion Reasoning as a Theory of Mind Benchmark for Large Language Models
di: Yeo, Gerard Christopher, et al.
Pubblicazione: (2025)
di: Yeo, Gerard Christopher, et al.
Pubblicazione: (2025)
CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models
di: Tong, Haibo, et al.
Pubblicazione: (2026)
di: Tong, Haibo, et al.
Pubblicazione: (2026)
Evaluating Large Language Models in Theory of Mind Tasks
di: Kosinski, Michal
Pubblicazione: (2023)
di: Kosinski, Michal
Pubblicazione: (2023)
Probing the Robustness of Theory of Mind in Large Language Models
di: Nickel, Christian, et al.
Pubblicazione: (2024)
di: Nickel, Christian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
di: Chen, Zhuang, et al.
Pubblicazione: (2025) -
COKE: A Cognitive Knowledge Graph for Machine Theory of Mind
di: Wu, Jincenzi, et al.
Pubblicazione: (2023) -
CharacterBench: Benchmarking Character Customization of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024) -
UniToMBench: Integrating Perspective-Taking to Improve Theory of Mind in LLMs
di: Thiyagarajan, Prameshwar, et al.
Pubblicazione: (2025) -
T2MBench: A Benchmark for Out-of-Distribution Text-to-Motion Generation
di: Yang, Bin, et al.
Pubblicazione: (2026)