Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human States
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Yang, Wang, Jiashuo, Xu, Qiancheng, Song, Changhe, Xu, Chunpu, Cheng, Yi, Li, Wenjie, Liu, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards a Client-Centered Assessment of LLM Therapists by Client Simulation
par: Wang, Jiashuo, et autres
Publié: (2024)
par: Wang, Jiashuo, et autres
Publié: (2024)
How Far Are LLMs from Believable AI? A Benchmark for Evaluating the Believability of Human Behavior Simulation
par: Xiao, Yang, et autres
Publié: (2023)
par: Xiao, Yang, et autres
Publié: (2023)
Enhancing User Engagement in Socially-Driven Dialogue through Interactive LLM Alignments
par: Wang, Jiashuo, et autres
Publié: (2025)
par: Wang, Jiashuo, et autres
Publié: (2025)
SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Mitigating Unhelpfulness in Emotional Support Conversations with Multifaceted AI Feedback
par: Wang, Jiashuo, et autres
Publié: (2024)
par: Wang, Jiashuo, et autres
Publié: (2024)
Evaluating Large Language Models in Theory of Mind Tasks
par: Kosinski, Michal
Publié: (2023)
par: Kosinski, Michal
Publié: (2023)
Assessing LLMs in Art Contexts: Critique Generation and Theory of Mind Evaluation
par: Arita, Takaya, et autres
Publié: (2025)
par: Arita, Takaya, et autres
Publié: (2025)
Exploring the Human-LLM Synergy in Advancing Theory-driven Qualitative Analysis
par: Meng, Han, et autres
Publié: (2024)
par: Meng, Han, et autres
Publié: (2024)
A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks
par: Sarıtaş, Karahan, et autres
Publié: (2025)
par: Sarıtaş, Karahan, et autres
Publié: (2025)
Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion
par: Shankar, Hari, et autres
Publié: (2026)
par: Shankar, Hari, et autres
Publié: (2026)
JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community
par: Xiao, Yunze, et autres
Publié: (2025)
par: Xiao, Yunze, et autres
Publié: (2025)
From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the Lens of Social Relationship
par: Xu, Yue, et autres
Publié: (2025)
par: Xu, Yue, et autres
Publié: (2025)
Challenges and Innovations in LLM-Powered Fake News Detection: A Synthesis of Approaches and Future Directions
par: Yi, Jingyuan, et autres
Publié: (2025)
par: Yi, Jingyuan, et autres
Publié: (2025)
CARE: Causality Reasoning for Empathetic Responses by Conditional Graph Generation
par: Wang, Jiashuo, et autres
Publié: (2022)
par: Wang, Jiashuo, et autres
Publié: (2022)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2025)
par: Xu, Qiancheng, et autres
Publié: (2025)
MoVa: Towards Generalizable Classification of Human Morals and Values
par: Chen, Ziyu, et autres
Publié: (2025)
par: Chen, Ziyu, et autres
Publié: (2025)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
par: Nazi, Zabir Al, et autres
Publié: (2025)
par: Nazi, Zabir Al, et autres
Publié: (2025)
RAGAT-Mind: A Multi-Granular Modeling Approach for Rumor Detection Based on MindSpore
par: Qin, Zhenkai, et autres
Publié: (2025)
par: Qin, Zhenkai, et autres
Publié: (2025)
Triangulating Temporal Dynamics in Multilingual Swiss Online News
par: Victor, Bros, et autres
Publié: (2026)
par: Victor, Bros, et autres
Publié: (2026)
Representation Learning to Study Temporal Dynamics in Tutorial Scaffolding
par: Borchers, Conrad, et autres
Publié: (2026)
par: Borchers, Conrad, et autres
Publié: (2026)
BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents
par: Myakala, Praveen Kumar, et autres
Publié: (2026)
par: Myakala, Praveen Kumar, et autres
Publié: (2026)
Tracking the Temporal Dynamics of News Coverage of Catastrophic and Violent Events
par: Lugos, Emily, et autres
Publié: (2026)
par: Lugos, Emily, et autres
Publié: (2026)
The Parrot Dilemma: Human-Labeled vs. LLM-augmented Data in Classification Tasks
par: Møller, Anders Giovanni, et autres
Publié: (2023)
par: Møller, Anders Giovanni, et autres
Publié: (2023)
Foresight Optimization for Strategic Reasoning in Large Language Models
par: Wang, Jiashuo, et autres
Publié: (2026)
par: Wang, Jiashuo, et autres
Publié: (2026)
Minding the Politeness Gap in Cross-cultural Communication
par: Machino, Yuka, et autres
Publié: (2025)
par: Machino, Yuka, et autres
Publié: (2025)
LLM or Human? Perceptions of Trust and Information Quality in Research Summaries
par: Akpinar, Nil-Jana, et autres
Publié: (2026)
par: Akpinar, Nil-Jana, et autres
Publié: (2026)
SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation
par: Liu, Xiaoze, et autres
Publié: (2024)
par: Liu, Xiaoze, et autres
Publié: (2024)
Human or LLM as Standardized Patients? A Comparative Study for Medical Education
par: Zhang, Bingquan, et autres
Publié: (2025)
par: Zhang, Bingquan, et autres
Publié: (2025)
Misalignment of LLM-Generated Personas with Human Perceptions in Low-Resource Settings
par: Prama, Tabia Tanzin, et autres
Publié: (2025)
par: Prama, Tabia Tanzin, et autres
Publié: (2025)
Agree to Disagree? A Meta-Evaluation of LLM Misgendering
par: Subramonian, Arjun, et autres
Publié: (2025)
par: Subramonian, Arjun, et autres
Publié: (2025)
Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactions
par: Borah, Angana, et autres
Publié: (2024)
par: Borah, Angana, et autres
Publié: (2024)
OATH-Frames: Characterizing Online Attitudes Towards Homelessness with LLM Assistants
par: Ranjit, Jaspreet, et autres
Publié: (2024)
par: Ranjit, Jaspreet, et autres
Publié: (2024)
Mind the Style: Impact of Communication Style on Human-Chatbot Interaction
par: Derner, Erik, et autres
Publié: (2026)
par: Derner, Erik, et autres
Publié: (2026)
LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education
par: Weissburg, Iain, et autres
Publié: (2024)
par: Weissburg, Iain, et autres
Publié: (2024)
Evaluating the Simulation of Human Personality-Driven Susceptibility to Misinformation with LLMs
par: Pratelli, Manuel, et autres
Publié: (2025)
par: Pratelli, Manuel, et autres
Publié: (2025)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
par: Bao, Han, et autres
Publié: (2026)
par: Bao, Han, et autres
Publié: (2026)
Probing Cultural Awareness in LLMs: A Case Study of Cross-Culture Aesthetic Stylistics
par: Wang, Jiashuo, et autres
Publié: (2026)
par: Wang, Jiashuo, et autres
Publié: (2026)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
par: Liu, Yiran, et autres
Publié: (2024)
par: Liu, Yiran, et autres
Publié: (2024)
Few-shot Hate Speech Detection Based on the MindSpore Framework
par: Qin, Zhenkai, et autres
Publié: (2025)
par: Qin, Zhenkai, et autres
Publié: (2025)
Documents similaires
-
Towards a Client-Centered Assessment of LLM Therapists by Client Simulation
par: Wang, Jiashuo, et autres
Publié: (2024) -
How Far Are LLMs from Believable AI? A Benchmark for Evaluating the Believability of Human Behavior Simulation
par: Xiao, Yang, et autres
Publié: (2023) -
Enhancing User Engagement in Socially-Driven Dialogue through Interactive LLM Alignments
par: Wang, Jiashuo, et autres
Publié: (2025) -
SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025) -
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)