LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Shi-Yu, Zhou, Zhi, Yu, Kun-Yang, Yang, Ming, Chen, Yang, Shang, Ziqiao, Guo, Lan-Zhe, Li, Yu-Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
di: Lv, Song-Lin, et al.
Pubblicazione: (2025)
di: Lv, Song-Lin, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
VCSearch: Bridging the Gap Between Well-Defined and Ill-Defined Problems in Mathematical Reasoning
di: Tian, Shi-Yu, et al.
Pubblicazione: (2024)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2024)
NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing
di: Yang, Ming, et al.
Pubblicazione: (2026)
di: Yang, Ming, et al.
Pubblicazione: (2026)
On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective
di: Zhou, Zhi, et al.
Pubblicazione: (2026)
di: Zhou, Zhi, et al.
Pubblicazione: (2026)
Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning
di: Yu, Kun-Yang, et al.
Pubblicazione: (2026)
di: Yu, Kun-Yang, et al.
Pubblicazione: (2026)
BMIP: Bi-directional Modality Interaction Prompt Learning for VLM
di: Lv, Song-Lin, et al.
Pubblicazione: (2025)
di: Lv, Song-Lin, et al.
Pubblicazione: (2025)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation
di: Yang, Dongsheng, et al.
Pubblicazione: (2026)
di: Yang, Dongsheng, et al.
Pubblicazione: (2026)
Boosting Facial Action Unit Detection Through Jointly Learning Facial Landmark Detection and Domain Separation and Reconstruction
di: Shang, Ziqiao, et al.
Pubblicazione: (2023)
di: Shang, Ziqiao, et al.
Pubblicazione: (2023)
Safety of Multimodal Large Language Models on Images and Texts
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
di: Shiri, Fatemeh, et al.
Pubblicazione: (2024)
di: Shiri, Fatemeh, et al.
Pubblicazione: (2024)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
di: Huang, Yu, et al.
Pubblicazione: (2025)
di: Huang, Yu, et al.
Pubblicazione: (2025)
Fully Test-time Adaptation for Tabular Data
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
di: Jia, Zi-Yi, et al.
Pubblicazione: (2026)
di: Jia, Zi-Yi, et al.
Pubblicazione: (2026)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
di: Peng, Kunyu, et al.
Pubblicazione: (2026)
di: Peng, Kunyu, et al.
Pubblicazione: (2026)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
di: Peng, Yi-Xing, et al.
Pubblicazione: (2025)
di: Peng, Yi-Xing, et al.
Pubblicazione: (2025)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
di: Ma, Chuang, et al.
Pubblicazione: (2026)
di: Ma, Chuang, et al.
Pubblicazione: (2026)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
You Only Submit One Image to Find the Most Suitable Generative Model
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
di: Zhou, Zhi, et al.
Pubblicazione: (2024)
Fast Spatial Memory with Elastic Test-Time Training
di: Ma, Ziqiao, et al.
Pubblicazione: (2026)
di: Ma, Ziqiao, et al.
Pubblicazione: (2026)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
di: Sun, Yiming, et al.
Pubblicazione: (2024)
di: Sun, Yiming, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
di: He, Yulin, et al.
Pubblicazione: (2026)
di: He, Yulin, et al.
Pubblicazione: (2026)
Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous Driving
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
Vision Function Layer in Multimodal LLMs
di: Shi, Cheng, et al.
Pubblicazione: (2025)
di: Shi, Cheng, et al.
Pubblicazione: (2025)
Multimodal Classification via Total Correlation Maximization
di: Yu, Feng, et al.
Pubblicazione: (2026)
di: Yu, Feng, et al.
Pubblicazione: (2026)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025) -
Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
di: Lv, Song-Lin, et al.
Pubblicazione: (2025) -
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025) -
DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection
di: Zhou, Zhi, et al.
Pubblicazione: (2024) -
VCSearch: Bridging the Gap Between Well-Defined and Ill-Defined Problems in Mathematical Reasoning
di: Tian, Shi-Yu, et al.
Pubblicazione: (2024)