Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Siqi, Li, Xinyang, Zou, Bochao, Zhuo, Junbao, Ma, Huimin, Chen, Jiansheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RhythmFormer: Extracting Patterned rPPG Signals based on Periodic Sparse Attention
by: Zou, Bochao, et al.
Published: (2024)
by: Zou, Bochao, et al.
Published: (2024)
From Black Boxes to Transparent Minds: Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models
by: Li, Xinyang, et al.
Published: (2025)
by: Li, Xinyang, et al.
Published: (2025)
ME-TST+: Micro-expression Analysis via Temporal State Transition with ROI Relationship Awareness
by: Guo, Zizheng, et al.
Published: (2025)
by: Guo, Zizheng, et al.
Published: (2025)
AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios
by: Hou, Yunhao, et al.
Published: (2025)
by: Hou, Yunhao, et al.
Published: (2025)
InstDrive: Instance-Aware 3D Gaussian Splatting for Driving Scenes
by: Liu, Hongyuan, et al.
Published: (2025)
by: Liu, Hongyuan, et al.
Published: (2025)
Boosting Micro-Expression Analysis via Prior-Guided Video-Level Regression
by: Guo, Zizheng, et al.
Published: (2025)
by: Guo, Zizheng, et al.
Published: (2025)
$\textrm{A}^{\textrm{2}}$RNet: Adversarial Attack Resilient Network for Robust Infrared and Visible Image Fusion
by: Li, Jiawei, et al.
Published: (2024)
by: Li, Jiawei, et al.
Published: (2024)
Through the Theory of Mind's Eye: Reading Minds with Multimodal Video Large Language Models
by: Chen, Zhawnen, et al.
Published: (2024)
by: Chen, Zhawnen, et al.
Published: (2024)
Kaleidoscopic Background Attack: Disrupting Pose Estimation with Multi-Fold Radial Symmetry Textures
by: Ding, Xinlong, et al.
Published: (2025)
by: Ding, Xinlong, et al.
Published: (2025)
RhythmMamba: Fast, Lightweight, and Accurate Remote Physiological Measurement
by: Zou, Bochao, et al.
Published: (2024)
by: Zou, Bochao, et al.
Published: (2024)
MuMA-ToM: Multi-modal Multi-Agent Theory of Mind
by: Shi, Haojun, et al.
Published: (2024)
by: Shi, Haojun, et al.
Published: (2024)
SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions
by: Fan, Xianzhe, et al.
Published: (2025)
by: Fan, Xianzhe, et al.
Published: (2025)
DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation using Limited Data
by: Zhu, Jingyuan, et al.
Published: (2023)
by: Zhu, Jingyuan, et al.
Published: (2023)
Unveiling the Dynamics of Information Interplay in Supervised Learning
by: Song, Kun, et al.
Published: (2024)
by: Song, Kun, et al.
Published: (2024)
Few-shot Image Generation via Masked Discrimination
by: Zhu, Jingyuan, et al.
Published: (2022)
by: Zhu, Jingyuan, et al.
Published: (2022)
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
by: Zhu, Jingyuan, et al.
Published: (2024)
by: Zhu, Jingyuan, et al.
Published: (2024)
Synergistic Spotting and Recognition of Micro-Expression via Temporal State Transition
by: Zou, Bochao, et al.
Published: (2024)
by: Zou, Bochao, et al.
Published: (2024)
Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images
by: Liu, Hongyuan, et al.
Published: (2026)
by: Liu, Hongyuan, et al.
Published: (2026)
Confusing Pair Correction Based on Category Prototype for Domain Adaptation under Noisy Environments
by: Zhi, Churan, et al.
Published: (2024)
by: Zhi, Churan, et al.
Published: (2024)
MVSMamba: Multi-View Stereo with State Space Model
by: Jiang, Jianfei, et al.
Published: (2025)
by: Jiang, Jianfei, et al.
Published: (2025)
A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
by: Zhao, Fufangchen, et al.
Published: (2025)
by: Zhao, Fufangchen, et al.
Published: (2025)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
by: Li, Jiansheng, et al.
Published: (2025)
by: Li, Jiansheng, et al.
Published: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
by: Wu, Jianlong, et al.
Published: (2025)
by: Wu, Jianlong, et al.
Published: (2025)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
by: Wu, Jianzong, et al.
Published: (2024)
by: Wu, Jianzong, et al.
Published: (2024)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
by: Huang, Zhuo, et al.
Published: (2023)
by: Huang, Zhuo, et al.
Published: (2023)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
by: Zhang, Zhihong, et al.
Published: (2025)
by: Zhang, Zhihong, et al.
Published: (2025)
MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network
by: Jiang, Jianfei, et al.
Published: (2025)
by: Jiang, Jianfei, et al.
Published: (2025)
XYZCylinder: Towards Compatible Feed-Forward 3D Gaussian Splatting for Driving Scenes via Unified Cylinder Lifting Method
by: Yu, Haochen, et al.
Published: (2025)
by: Yu, Haochen, et al.
Published: (2025)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
by: He, Zhihao, et al.
Published: (2025)
by: He, Zhihao, et al.
Published: (2025)
SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem
by: Shi, Ziqiang, et al.
Published: (2026)
by: Shi, Ziqiang, et al.
Published: (2026)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
by: Zhang, Xingxuan, et al.
Published: (2024)
by: Zhang, Xingxuan, et al.
Published: (2024)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
by: Wang, Hanqing, et al.
Published: (2026)
by: Wang, Hanqing, et al.
Published: (2026)
SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning
by: Chen, Junkai, et al.
Published: (2025)
by: Chen, Junkai, et al.
Published: (2025)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
by: Zhou, Tian-Yi, et al.
Published: (2026)
by: Zhou, Tian-Yi, et al.
Published: (2026)
Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models
by: Zhang, Linghao, et al.
Published: (2026)
by: Zhang, Linghao, et al.
Published: (2026)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
by: Luo, Meng, et al.
Published: (2026)
by: Luo, Meng, et al.
Published: (2026)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
by: Luo, Jingnan, et al.
Published: (2026)
by: Luo, Jingnan, et al.
Published: (2026)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
by: Qiao, Yanyuan, et al.
Published: (2025)
by: Qiao, Yanyuan, et al.
Published: (2025)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
by: Qin, Zhenyue, et al.
Published: (2024)
by: Qin, Zhenyue, et al.
Published: (2024)
Similar Items
-
RhythmFormer: Extracting Patterned rPPG Signals based on Periodic Sparse Attention
by: Zou, Bochao, et al.
Published: (2024) -
From Black Boxes to Transparent Minds: Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models
by: Li, Xinyang, et al.
Published: (2025) -
ME-TST+: Micro-expression Analysis via Temporal State Transition with ROI Relationship Awareness
by: Guo, Zizheng, et al.
Published: (2025) -
AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios
by: Hou, Yunhao, et al.
Published: (2025) -
InstDrive: Instance-Aware 3D Gaussian Splatting for Driving Scenes
by: Liu, Hongyuan, et al.
Published: (2025)