MuMA-ToM: Multi-modal Multi-Agent Theory of Mind
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Haojun, Ye, Suyu, Fang, Xinyu, Jin, Chuanyang, Isik, Leyla, Kuo, Yen-Ling, Shu, Tianmin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
by: Fan, Xianzhe, et al.
Published: (2025)
by: Fan, Xianzhe, et al.
Published: (2025)
MuMA: 3D PBR Texturing via Multi-Channel Multi-View Generation and Agentic Post-Processing
by: Zhu, Lingting, et al.
Published: (2025)
by: Zhu, Lingting, et al.
Published: (2025)
MMToM-QA: Multimodal Theory of Mind Question Answering
by: Jin, Chuanyang, et al.
Published: (2024)
by: Jin, Chuanyang, et al.
Published: (2024)
Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation
by: Shi, Haojun, et al.
Published: (2026)
by: Shi, Haojun, et al.
Published: (2026)
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
by: Ye, Suyu, et al.
Published: (2025)
by: Ye, Suyu, et al.
Published: (2025)
Multi-ToM: Evaluating Multilingual Theory of Mind Capabilities in Large Language Models
by: Sadhu, Jayanta, et al.
Published: (2024)
by: Sadhu, Jayanta, et al.
Published: (2024)
AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling
by: Zhang, Zhining, et al.
Published: (2025)
by: Zhang, Zhining, et al.
Published: (2025)
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
by: Ahmed, Nesreen K., et al.
Published: (2026)
by: Ahmed, Nesreen K., et al.
Published: (2026)
ToM-SSI: Evaluating Theory of Mind in Situated Social Interactions
by: Bortoletto, Matteo, et al.
Published: (2025)
by: Bortoletto, Matteo, et al.
Published: (2025)
Exploring Next Token Prediction in Theory of Mind (ToM) Tasks: Comparative Experiments with GPT-2 and LLaMA-2 AI Models
by: Yadav, Pavan, et al.
Published: (2025)
by: Yadav, Pavan, et al.
Published: (2025)
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
by: Liu, Siqi, et al.
Published: (2026)
by: Liu, Siqi, et al.
Published: (2026)
Mind Modeling: A ToM-Based Framework for Personalization
by: Gena, Cristina
Published: (2026)
by: Gena, Cristina
Published: (2026)
Rank-O-ToM: Unlocking Emotional Nuance Ranking to Enhance Affective Theory-of-Mind
by: Kim, JiHyun, et al.
Published: (2025)
by: Kim, JiHyun, et al.
Published: (2025)
Pragmatic Embodied Spoken Instruction Following in Human-Robot Collaboration with Theory of Mind
by: Ying, Lance, et al.
Published: (2024)
by: Ying, Lance, et al.
Published: (2024)
CoMA: Compositional Human Motion Generation with Multi-modal Agents
by: Sun, Shanlin, et al.
Published: (2024)
by: Sun, Shanlin, et al.
Published: (2024)
DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
by: Wu, Yuheng, et al.
Published: (2025)
by: Wu, Yuheng, et al.
Published: (2025)
ToM-LM: Delegating Theory of Mind Reasoning to External Symbolic Executors in Large Language Models
by: Tang, Weizhi, et al.
Published: (2024)
by: Tang, Weizhi, et al.
Published: (2024)
Simple 3D Pose Features Support Human and Machine Social Scene Understanding
by: Qin, Wenshuo, et al.
Published: (2025)
by: Qin, Wenshuo, et al.
Published: (2025)
The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
by: Lupu, Andrei, et al.
Published: (2025)
by: Lupu, Andrei, et al.
Published: (2025)
Decompose-ToM: Enhancing Theory of Mind Reasoning in Large Language Models through Simulation and Task Decomposition
by: Sarangi, Sneheel, et al.
Published: (2025)
by: Sarangi, Sneheel, et al.
Published: (2025)
MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot
by: Song, Zirui, et al.
Published: (2024)
by: Song, Zirui, et al.
Published: (2024)
Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models
by: Huang, Minbin, et al.
Published: (2025)
by: Huang, Minbin, et al.
Published: (2025)
Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception
by: Garcia, Kathy, et al.
Published: (2025)
by: Garcia, Kathy, et al.
Published: (2025)
MindZero: Learning Online Mental Reasoning With Zero Annotations
by: Zhang, Shunchi, et al.
Published: (2026)
by: Zhang, Shunchi, et al.
Published: (2026)
Efficient Multi-modal Large Language Models via Visual Token Grouping
by: Huang, Minbin, et al.
Published: (2024)
by: Huang, Minbin, et al.
Published: (2024)
MuDG: Taming Multi-modal Diffusion with Gaussian Splatting for Urban Scene Reconstruction
by: Zou, Yingshuang, et al.
Published: (2025)
by: Zou, Yingshuang, et al.
Published: (2025)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
by: Miao, Yongzhu, et al.
Published: (2023)
by: Miao, Yongzhu, et al.
Published: (2023)
Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making
by: Nan, Shufeng, et al.
Published: (2026)
by: Nan, Shufeng, et al.
Published: (2026)
Theory of Mind for Multi-Agent Collaboration via Large Language Models
by: Li, Huao, et al.
Published: (2023)
by: Li, Huao, et al.
Published: (2023)
CoMuMDR: Code-mixed Multi-modal Multi-domain corpus for Discourse paRsing in conversations
by: Shukla, Divyaksh, et al.
Published: (2025)
by: Shukla, Divyaksh, et al.
Published: (2025)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
by: Ma, Zi-Ao, et al.
Published: (2024)
by: Ma, Zi-Ao, et al.
Published: (2024)
SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs
by: Gu, Yuling, et al.
Published: (2024)
by: Gu, Yuling, et al.
Published: (2024)
GaitMA: Pose-guided Multi-modal Feature Fusion for Gait Recognition
by: Min, Fanxu, et al.
Published: (2024)
by: Min, Fanxu, et al.
Published: (2024)
The Era of Real-World Human Interaction: RL from User Conversations
by: Jin, Chuanyang, et al.
Published: (2025)
by: Jin, Chuanyang, et al.
Published: (2025)
MuLan: Multimodal-LLM Agent for Progressive and Interactive Multi-Object Diffusion
by: Li, Sen, et al.
Published: (2024)
by: Li, Sen, et al.
Published: (2024)
Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models
by: Choi, Younwoo, et al.
Published: (2025)
by: Choi, Younwoo, et al.
Published: (2025)
A Computable Game-Theoretic Framework for Multi-Agent Theory of Mind
by: Zhu, Fengming, et al.
Published: (2025)
by: Zhu, Fengming, et al.
Published: (2025)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
by: Ling, Shaoshi, et al.
Published: (2025)
by: Ling, Shaoshi, et al.
Published: (2025)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
by: Liu, Shansong, et al.
Published: (2024)
by: Liu, Shansong, et al.
Published: (2024)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
by: Madaan, Divyam, et al.
Published: (2025)
by: Madaan, Divyam, et al.
Published: (2025)
Similar Items
-
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
by: Fan, Xianzhe, et al.
Published: (2025) -
MuMA: 3D PBR Texturing via Multi-Channel Multi-View Generation and Agentic Post-Processing
by: Zhu, Lingting, et al.
Published: (2025) -
MMToM-QA: Multimodal Theory of Mind Question Answering
by: Jin, Chuanyang, et al.
Published: (2024) -
Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation
by: Shi, Haojun, et al.
Published: (2026) -
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
by: Ye, Suyu, et al.
Published: (2025)