Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Xueqi, Jiang, Yanbei, Erfani, Sarah, Bailey, James, Liu, Weifeng, Ehinger, Krista A., Lau, Jey Han |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules
par: Jiang, Yanbei, et autres
Publié: (2025)
par: Jiang, Yanbei, et autres
Publié: (2025)
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
par: Jiang, Yanbei, et autres
Publié: (2024)
par: Jiang, Yanbei, et autres
Publié: (2024)
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
par: Jiang, Yanbei, et autres
Publié: (2025)
par: Jiang, Yanbei, et autres
Publié: (2025)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
par: Jiang, Yanbei, et autres
Publié: (2025)
par: Jiang, Yanbei, et autres
Publié: (2025)
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024)
par: Yang, Xiaocui, et autres
Publié: (2024)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
par: Liu, Shuhang, et autres
Publié: (2025)
par: Liu, Shuhang, et autres
Publié: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
par: Ma, Xueqi, et autres
Publié: (2025)
par: Ma, Xueqi, et autres
Publié: (2025)
Multimodal Emotion Recognition with Large Language Models
par: Zhang, Hongrui, et autres
Publié: (2026)
par: Zhang, Hongrui, et autres
Publié: (2026)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
par: Ma, Chenghao, et autres
Publié: (2025)
par: Ma, Chenghao, et autres
Publié: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
par: Lin, Yuxiang, et autres
Publié: (2025)
par: Lin, Yuxiang, et autres
Publié: (2025)
Multimodal Graph-Based Variational Mixture of Experts Network for Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2025)
par: Zhou, Baohang, et autres
Publié: (2025)
SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
par: Hu, Pengfei, et autres
Publié: (2025)
par: Hu, Pengfei, et autres
Publié: (2025)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
par: Imajuku, Yuki, et autres
Publié: (2024)
par: Imajuku, Yuki, et autres
Publié: (2024)
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
par: Zhao, Yu, et autres
Publié: (2025)
par: Zhao, Yu, et autres
Publié: (2025)
MOMENTA: Mixture-of-Experts Over Multimodal Embeddings with Neural Temporal Aggregation for Misinformation Detection
par: Abdollahinejad, Yeganeh, et autres
Publié: (2026)
par: Abdollahinejad, Yeganeh, et autres
Publié: (2026)
When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs
par: Shi, Weiyan, et autres
Publié: (2026)
par: Shi, Weiyan, et autres
Publié: (2026)
Harnessing Multimodal Large Language Models for Personalized Product Search with Query-aware Refinement
par: Zhang, Beibei, et autres
Publié: (2025)
par: Zhang, Beibei, et autres
Publié: (2025)
Mutual Information-based Representations Disentanglement for Unaligned Multimodal Language Sequences
par: Qian, Fan, et autres
Publié: (2024)
par: Qian, Fan, et autres
Publié: (2024)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
par: Wu, Zichen, et autres
Publié: (2025)
par: Wu, Zichen, et autres
Publié: (2025)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2026)
par: Zhou, Qianrui, et autres
Publié: (2026)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
CAMMSR: Category-Guided Attentive Mixture of Experts for Multimodal Sequential Recommendation
par: Xu, Jinfeng, et autres
Publié: (2026)
par: Xu, Jinfeng, et autres
Publié: (2026)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
par: Luo, Pengfei, et autres
Publié: (2025)
par: Luo, Pengfei, et autres
Publié: (2025)
RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation
par: Yan, Feng, et autres
Publié: (2024)
par: Yan, Feng, et autres
Publié: (2024)
MultimodalHugs: Enabling Sign Language Processing in Hugging Face
par: Sant, Gerard, et autres
Publié: (2025)
par: Sant, Gerard, et autres
Publié: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
par: Cui, Shiyao, et autres
Publié: (2025)
par: Cui, Shiyao, et autres
Publié: (2025)
Multimodal LLM-based Query Paraphrasing for Video Search
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Challenging Dataset and Multi-modal Gated Mixture of Experts Model for Remote Sensing Copy-Move Forgery Understanding
par: Zhang, Ze, et autres
Publié: (2025)
par: Zhang, Ze, et autres
Publié: (2025)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
par: Hao, Fangyu, et autres
Publié: (2026)
par: Hao, Fangyu, et autres
Publié: (2026)
Documents similaires
-
Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules
par: Jiang, Yanbei, et autres
Publié: (2025) -
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
par: Jiang, Yanbei, et autres
Publié: (2024) -
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
par: Jiang, Yanbei, et autres
Publié: (2025) -
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
par: Jiang, Yanbei, et autres
Publié: (2025) -
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024)