Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Chunhui, Ouyang, Zhongyu, Lee, Kwonjoon, Agarwal, Nakul, Houlihan, Sean Dae, Vosoughi, Soroush, Lo, Shao-Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
by: Mittal, Himangi, et al.
Published: (2024)
by: Mittal, Himangi, et al.
Published: (2024)
Scaled Supervision is an Implicit Lipschitz Regularizer
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
by: Diao, Xingjian, et al.
Published: (2025)
by: Diao, Xingjian, et al.
Published: (2025)
What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
Non-parametric Graph Convolution for Re-ranking in Recommendation Systems
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
by: Diao, Xingjian, et al.
Published: (2025)
by: Diao, Xingjian, et al.
Published: (2025)
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
by: Yang, Yuchen, et al.
Published: (2024)
by: Yang, Yuchen, et al.
Published: (2024)
Is It Navajo? Accurate Language Detection in Endangered Athabaskan Languages
by: Yang, Ivory, et al.
Published: (2025)
by: Yang, Ivory, et al.
Published: (2025)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
by: Xie, Sean, et al.
Published: (2022)
by: Xie, Sean, et al.
Published: (2022)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
by: You, Wenhao, et al.
Published: (2025)
by: You, Wenhao, et al.
Published: (2025)
Vamos: Versatile Action Models for Video Understanding
by: Wang, Shijie, et al.
Published: (2023)
by: Wang, Shijie, et al.
Published: (2023)
Behavior Knowledge Merge in Reinforced Agentic Models
by: Yuan, Xiangchi, et al.
Published: (2026)
by: Yuan, Xiangchi, et al.
Published: (2026)
Disordered-DABS: A Benchmark for Dynamic Aspect-Based Summarization in Disordered Texts
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
Serial Position Effects of Large Language Models
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
by: Kang, Haoqiang, et al.
Published: (2025)
by: Kang, Haoqiang, et al.
Published: (2025)
Enhanced Detection of Conversational Mental Manipulation Through Advanced Prompting Techniques
by: Yang, Ivory, et al.
Published: (2024)
by: Yang, Ivory, et al.
Published: (2024)
Learning Robust Reasoning through Guided Adversarial Self-Play
by: Li, Shuozhe, et al.
Published: (2026)
by: Li, Shuozhe, et al.
Published: (2026)
M2D2M: Multi-Motion Generation from Text with Discrete Diffusion Models
by: Chi, Seunggeun, et al.
Published: (2024)
by: Chi, Seunggeun, et al.
Published: (2024)
Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction
by: Jian, Yiren, et al.
Published: (2023)
by: Jian, Yiren, et al.
Published: (2023)
AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?
by: Zhao, Qi, et al.
Published: (2023)
by: Zhao, Qi, et al.
Published: (2023)
Semantic Compositions Enhance Vision-Language Contrastive Learning
by: Aladago, Maxwell, et al.
Published: (2024)
by: Aladago, Maxwell, et al.
Published: (2024)
NushuRescue: Revitalization of the Endangered Nushu Language with AI
by: Yang, Ivory, et al.
Published: (2024)
by: Yang, Ivory, et al.
Published: (2024)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
by: Diao, Xingjian, et al.
Published: (2026)
by: Diao, Xingjian, et al.
Published: (2026)
KCES: Training-Free Defense for Robust Graph Neural Networks via Kernel Complexity
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?
by: Lu, Yi-Long, et al.
Published: (2025)
by: Lu, Yi-Long, et al.
Published: (2025)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
by: Luo, Meng, et al.
Published: (2026)
by: Luo, Meng, et al.
Published: (2026)
Children's Studies, Archives Literacy, and Cultural Contexts: Designing Teaching for Academic Library Learning
by: Houlihan, Barry
Published: (2019)
by: Houlihan, Barry
Published: (2019)
Improving Study Skills.
by: Houlihan, Bettyjean
Published: (1979)
by: Houlihan, Bettyjean
Published: (1979)
The University Curriculum Library: Evaluate, Update, Renovate.
by: Houlihan, Bettyjean
Published: (1978)
by: Houlihan, Bettyjean
Published: (1978)
Achieving Domain-Independent Certified Robustness via Knowledge Continuity
by: Sun, Alan, et al.
Published: (2024)
by: Sun, Alan, et al.
Published: (2024)
MentalManip: A Dataset For Fine-grained Analysis of Mental Manipulation in Conversations
by: Wang, Yuxin, et al.
Published: (2024)
by: Wang, Yuxin, et al.
Published: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
by: Zhou, Kaiwen, et al.
Published: (2023)
by: Zhou, Kaiwen, et al.
Published: (2023)
Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning
by: Wagner, Eitan, et al.
Published: (2024)
by: Wagner, Eitan, et al.
Published: (2024)
Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models
by: Zhang, Gengwei, et al.
Published: (2026)
by: Zhang, Gengwei, et al.
Published: (2026)
Similar Items
-
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
by: Mittal, Himangi, et al.
Published: (2024) -
Scaled Supervision is an Implicit Lipschitz Regularizer
by: Ouyang, Zhongyu, et al.
Published: (2025) -
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025) -
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025) -
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
by: Diao, Xingjian, et al.
Published: (2025)