Can Multimodal Large Language Models Understand Spatial Relations?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Jingping, Liu, Ziyan, Cen, Zhedong, Zhou, Yan, Zou, Yinan, Zhang, Weiyan, Jiang, Haiyun, Ruan, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
von: Chu, Meng, et al.
Veröffentlicht: (2023)
von: Chu, Meng, et al.
Veröffentlicht: (2023)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
von: Zhu, Yule, et al.
Veröffentlicht: (2025)
von: Zhu, Yule, et al.
Veröffentlicht: (2025)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
von: Ma, Xueqi, et al.
Veröffentlicht: (2025)
von: Ma, Xueqi, et al.
Veröffentlicht: (2025)
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
von: Liu, Lingyu, et al.
Veröffentlicht: (2025)
von: Liu, Lingyu, et al.
Veröffentlicht: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
von: Yang, Shuyu, et al.
Veröffentlicht: (2024)
von: Yang, Shuyu, et al.
Veröffentlicht: (2024)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
von: Zhou, Shengli, et al.
Veröffentlicht: (2026)
von: Zhou, Shengli, et al.
Veröffentlicht: (2026)
Scaling up Multimodal Pre-training for Sign Language Understanding
von: Zhou, Wengang, et al.
Veröffentlicht: (2024)
von: Zhou, Wengang, et al.
Veröffentlicht: (2024)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
von: Ikuta, Hikaru, et al.
Veröffentlicht: (2024)
von: Ikuta, Hikaru, et al.
Veröffentlicht: (2024)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
von: Yu, Hang, et al.
Veröffentlicht: (2025)
von: Yu, Hang, et al.
Veröffentlicht: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
von: E, Shaojun, et al.
Veröffentlicht: (2025)
von: E, Shaojun, et al.
Veröffentlicht: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
von: Xiao, Yicheng, et al.
Veröffentlicht: (2025)
von: Xiao, Yicheng, et al.
Veröffentlicht: (2025)
Can We Edit Multimodal Large Language Models?
von: Cheng, Siyuan, et al.
Veröffentlicht: (2023)
von: Cheng, Siyuan, et al.
Veröffentlicht: (2023)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
von: Wang, Yuze, et al.
Veröffentlicht: (2025)
von: Wang, Yuze, et al.
Veröffentlicht: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
von: Hao, Jing, et al.
Veröffentlicht: (2025)
von: Hao, Jing, et al.
Veröffentlicht: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
von: Sun, Jintao, et al.
Veröffentlicht: (2024)
von: Sun, Jintao, et al.
Veröffentlicht: (2024)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
von: Liu, Shuo, et al.
Veröffentlicht: (2025)
von: Liu, Shuo, et al.
Veröffentlicht: (2025)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
von: He, Xin, et al.
Veröffentlicht: (2024)
von: He, Xin, et al.
Veröffentlicht: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
von: Liu, Weijia, et al.
Veröffentlicht: (2024)
von: Liu, Weijia, et al.
Veröffentlicht: (2024)
Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion
von: Chen, Sen, et al.
Veröffentlicht: (2022)
von: Chen, Sen, et al.
Veröffentlicht: (2022)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
von: Ma, Jingtian, et al.
Veröffentlicht: (2025)
von: Ma, Jingtian, et al.
Veröffentlicht: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
von: Imajuku, Yuki, et al.
Veröffentlicht: (2024)
von: Imajuku, Yuki, et al.
Veröffentlicht: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
von: Wu, Xun, et al.
Veröffentlicht: (2024)
von: Wu, Xun, et al.
Veröffentlicht: (2024)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
von: Li, Yixuan, et al.
Veröffentlicht: (2024)
von: Li, Yixuan, et al.
Veröffentlicht: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
von: Xu, Yifang, et al.
Veröffentlicht: (2025)
von: Xu, Yifang, et al.
Veröffentlicht: (2025)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
von: Liu, Jiale, et al.
Veröffentlicht: (2025)
von: Liu, Jiale, et al.
Veröffentlicht: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
von: Guo, Zile, et al.
Veröffentlicht: (2026)
von: Guo, Zile, et al.
Veröffentlicht: (2026)
Bridging Compressed Image Latents and Multimodal Large Language Models
von: Kao, Chia-Hao, et al.
Veröffentlicht: (2024)
von: Kao, Chia-Hao, et al.
Veröffentlicht: (2024)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
von: Zhang, Xuesong, et al.
Veröffentlicht: (2024)
von: Zhang, Xuesong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
von: Liu, Lingyu, et al.
Veröffentlicht: (2026) -
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
von: Chu, Meng, et al.
Veröffentlicht: (2023) -
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
von: Zhu, Yule, et al.
Veröffentlicht: (2025) -
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
von: Ma, Xueqi, et al.
Veröffentlicht: (2025) -
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
von: Liu, Lingyu, et al.
Veröffentlicht: (2025)