Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
Fuente:
arXiv
Salvato in:
| Autori principali: | Amirizaniani, Maryam, Martin, Elias, Sivachenko, Maryna, Mashhadi, Afra, Shah, Chirag |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026)
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026)
Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026)
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026)
How Likely Do LLMs with CoT Mimic Human Reasoning?
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
LLMs Do Not Grade Essays Like Humans
di: Mathew, Jerin George, et al.
Pubblicazione: (2026)
di: Mathew, Jerin George, et al.
Pubblicazione: (2026)
InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles
di: Li, Zizhen, et al.
Pubblicazione: (2025)
di: Li, Zizhen, et al.
Pubblicazione: (2025)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
TactfulToM: Do LLMs Have the Theory of Mind Ability to Understand White Lies?
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning
di: Dash, Saloni, et al.
Pubblicazione: (2025)
di: Dash, Saloni, et al.
Pubblicazione: (2025)
MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning
di: Lică, Mircea, et al.
Pubblicazione: (2024)
di: Lică, Mircea, et al.
Pubblicazione: (2024)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
Theory of Mind and Self-Attributions of Mentality are Dissociable in LLMs
di: Kim, Junsol, et al.
Pubblicazione: (2026)
di: Kim, Junsol, et al.
Pubblicazione: (2026)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
di: An, Subin, et al.
Pubblicazione: (2025)
di: An, Subin, et al.
Pubblicazione: (2025)
Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning
di: Richardson, Andrew Keenan, et al.
Pubblicazione: (2025)
di: Richardson, Andrew Keenan, et al.
Pubblicazione: (2025)
Small LLMs Do Not Learn a Generalizable Theory of Mind via Reinforcement Learning
di: Sarangi, Sneheel, et al.
Pubblicazione: (2025)
di: Sarangi, Sneheel, et al.
Pubblicazione: (2025)
LLMAuditor: A Framework for Auditing Large Language Models Using Human-in-the-Loop
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
di: Chiang, Wei-Lin, et al.
Pubblicazione: (2024)
di: Chiang, Wei-Lin, et al.
Pubblicazione: (2024)
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs
di: Jeune, Pierre Le, et al.
Pubblicazione: (2026)
di: Jeune, Pierre Le, et al.
Pubblicazione: (2026)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
Can LLMs Reliably Simulate Human Learner Actions? A Simulation Authoring Framework for Open-Ended Learning Environments
di: Mannekote, Amogh, et al.
Pubblicazione: (2024)
di: Mannekote, Amogh, et al.
Pubblicazione: (2024)
UniToMBench: Integrating Perspective-Taking to Improve Theory of Mind in LLMs
di: Thiyagarajan, Prameshwar, et al.
Pubblicazione: (2025)
di: Thiyagarajan, Prameshwar, et al.
Pubblicazione: (2025)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
di: Yehudai, Asaf, et al.
Pubblicazione: (2026)
Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral
di: Liu, Xiaoxiao, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxiao, et al.
Pubblicazione: (2025)
Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning
di: Wagner, Eitan, et al.
Pubblicazione: (2024)
di: Wagner, Eitan, et al.
Pubblicazione: (2024)
How Do LLMs Perform Two-Hop Reasoning in Context?
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
Do LLMs Really Think Step-by-step In Implicit Reasoning?
di: Yu, Yijiong
Pubblicazione: (2024)
di: Yu, Yijiong
Pubblicazione: (2024)
ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2025)
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2025)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
di: Choukrani, Omar, et al.
Pubblicazione: (2025)
di: Choukrani, Omar, et al.
Pubblicazione: (2025)
Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games
di: Yadav, Neemesh, et al.
Pubblicazione: (2025)
di: Yadav, Neemesh, et al.
Pubblicazione: (2025)
Do LLMs Agree on the Creativity Evaluation of Alternative Uses?
di: Rabeyah, Abdullah Al, et al.
Pubblicazione: (2024)
di: Rabeyah, Abdullah Al, et al.
Pubblicazione: (2024)
R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning
di: Liu, Wanlong, et al.
Pubblicazione: (2026)
di: Liu, Wanlong, et al.
Pubblicazione: (2026)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
di: Jin, Keyan, et al.
Pubblicazione: (2025)
di: Jin, Keyan, et al.
Pubblicazione: (2025)
Evaluating and Enhancing LLMs Agent based on Theory of Mind in Guandan: A Multi-Player Cooperative Game under Imperfect Information
di: Yim, Yauwai, et al.
Pubblicazione: (2024)
di: Yim, Yauwai, et al.
Pubblicazione: (2024)
Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
di: Shen, Hua, et al.
Pubblicazione: (2025)
di: Shen, Hua, et al.
Pubblicazione: (2025)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
di: Tran, Khanh-Tung, et al.
Pubblicazione: (2025)
di: Tran, Khanh-Tung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AuditLLM: A Tool for Auditing Large Language Models Using Multiprobe Approach
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2024) -
Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026) -
Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering
di: Amirizaniani, Maryam, et al.
Pubblicazione: (2026) -
How Likely Do LLMs with CoT Mimic Human Reasoning?
di: Bao, Guangsheng, et al.
Pubblicazione: (2024) -
LLMs Do Not Grade Essays Like Humans
di: Mathew, Jerin George, et al.
Pubblicazione: (2026)