Mind with Eyes: from Language Reasoning to Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhiyu, Gao, Yifei, Zhao, Xian, Yang, Yunfan, Sang, Jitao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AIGCs Confuse AI Too: Investigating and Explaining Synthetic Image-induced Hallucinations in Large Vision-Language Models
di: Gao, Yifei, et al.
Pubblicazione: (2024)
di: Gao, Yifei, et al.
Pubblicazione: (2024)
Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models
di: Wu, Wenshan, et al.
Pubblicazione: (2024)
di: Wu, Wenshan, et al.
Pubblicazione: (2024)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024)
di: Tu, Yahan, et al.
Pubblicazione: (2024)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
Constrained Reasoning Chains for Enhancing Theory-of-Mind in Large Language Models
di: Lin, Zizheng, et al.
Pubblicazione: (2024)
di: Lin, Zizheng, et al.
Pubblicazione: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
\texttt{ReMind}: Understanding Deductive Code Reasoning in LLMs
di: Gao, Jun, et al.
Pubblicazione: (2025)
di: Gao, Jun, et al.
Pubblicazione: (2025)
CodeMind: Evaluating Large Language Models for Code Reasoning
di: Liu, Changshu, et al.
Pubblicazione: (2024)
di: Liu, Changshu, et al.
Pubblicazione: (2024)
EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning
di: Zhao, Shangziqi, et al.
Pubblicazione: (2025)
di: Zhao, Shangziqi, et al.
Pubblicazione: (2025)
Debiasing Vison-Language Models with Text-Only Training
di: Yang, Yunfan, et al.
Pubblicazione: (2024)
di: Yang, Yunfan, et al.
Pubblicazione: (2024)
Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
di: Zhang, Chuyifei, et al.
Pubblicazione: (2026)
di: Zhang, Chuyifei, et al.
Pubblicazione: (2026)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
di: Wang, Yiqi, et al.
Pubblicazione: (2024)
di: Wang, Yiqi, et al.
Pubblicazione: (2024)
Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning
di: Wei, Shuyu, et al.
Pubblicazione: (2026)
di: Wei, Shuyu, et al.
Pubblicazione: (2026)
ThinkPilot: Steering Reasoning Models via Automated Think-prefixes Optimization
di: Li, Sunzhu, et al.
Pubblicazione: (2025)
di: Li, Sunzhu, et al.
Pubblicazione: (2025)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification
di: Wan, Faxian, et al.
Pubblicazione: (2026)
di: Wan, Faxian, et al.
Pubblicazione: (2026)
Parrot Mind: Towards Explaining the Complex Task Reasoning of Pretrained Large Language Models with Template-Content Structure
di: Yang, Haotong, et al.
Pubblicazione: (2023)
di: Yang, Haotong, et al.
Pubblicazione: (2023)
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
di: Yan, Qianqi, et al.
Pubblicazione: (2025)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
MSA at ImageCLEF 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language Models
di: Ahmed, Seif, et al.
Pubblicazione: (2025)
di: Ahmed, Seif, et al.
Pubblicazione: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
RRTL: Red Teaming Reasoning Large Language Models in Tool Learning
di: Liu, Yifei, et al.
Pubblicazione: (2025)
di: Liu, Yifei, et al.
Pubblicazione: (2025)
Multimodal Behavioral Patterns Analysis with Eye-Tracking and LLM-Based Reasoning
di: Guo, Dongyang, et al.
Pubblicazione: (2025)
di: Guo, Dongyang, et al.
Pubblicazione: (2025)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
di: He, Kaiyu, et al.
Pubblicazione: (2025)
di: He, Kaiyu, et al.
Pubblicazione: (2025)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
di: WU, Jiageng, et al.
Pubblicazione: (2024)
di: WU, Jiageng, et al.
Pubblicazione: (2024)
AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models
di: Liu, Hao, et al.
Pubblicazione: (2026)
di: Liu, Hao, et al.
Pubblicazione: (2026)
MUR: Momentum Uncertainty guided Reasoning for Large Language Models
di: Yan, Hang, et al.
Pubblicazione: (2025)
di: Yan, Hang, et al.
Pubblicazione: (2025)
VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
di: Wang, Jiaqi, et al.
Pubblicazione: (2024)
Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
di: Zhang, Yunfan, et al.
Pubblicazione: (2025)
di: Zhang, Yunfan, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection
di: Yang, Ruichao, et al.
Pubblicazione: (2026)
di: Yang, Ruichao, et al.
Pubblicazione: (2026)
Debiased Prompt Tuning in Vision-Language Model without Annotations
di: Jiang, Chaoquan, et al.
Pubblicazione: (2025)
di: Jiang, Chaoquan, et al.
Pubblicazione: (2025)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
di: Lin, Zhiyu, et al.
Pubblicazione: (2025)
di: Lin, Zhiyu, et al.
Pubblicazione: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
di: Xie, Congkai, et al.
Pubblicazione: (2025)
di: Xie, Congkai, et al.
Pubblicazione: (2025)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
di: Hu, Xucong, et al.
Pubblicazione: (2026)
di: Hu, Xucong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AIGCs Confuse AI Too: Investigating and Explaining Synthetic Image-induced Hallucinations in Large Vision-Language Models
di: Gao, Yifei, et al.
Pubblicazione: (2024) -
Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models
di: Wu, Wenshan, et al.
Pubblicazione: (2024) -
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024) -
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025) -
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)