Exploring Spatial Language Grounding Through Referring Expressions
Fuente:
arXiv
Salvato in:
| Autori principali: | Tumu, Akshar, Kordjamshidi, Parisa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
di: Kamali, Danial, et al.
Pubblicazione: (2025)
di: Kamali, Danial, et al.
Pubblicazione: (2025)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
di: Premsri, Tanawan, et al.
Pubblicazione: (2025)
di: Premsri, Tanawan, et al.
Pubblicazione: (2025)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
di: Ma, Tianyi, et al.
Pubblicazione: (2025)
di: Ma, Tianyi, et al.
Pubblicazione: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
di: Barezi, Elham J., et al.
Pubblicazione: (2024)
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
di: Willemsen, Bram, et al.
Pubblicazione: (2024)
di: Willemsen, Bram, et al.
Pubblicazione: (2024)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
Narrowing the Gap between Vision and Action in Navigation
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Discovering Failure Modes in Vision-Language Models using RL
di: Jain, Kanishk, et al.
Pubblicazione: (2026)
di: Jain, Kanishk, et al.
Pubblicazione: (2026)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
di: Hu, Yizhi, et al.
Pubblicazione: (2025)
di: Hu, Yizhi, et al.
Pubblicazione: (2025)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
Evaluating Automated Radiology Report Quality through Fine-Grained Phrasal Grounding of Clinical Findings
di: Mahmood, Razi, et al.
Pubblicazione: (2024)
di: Mahmood, Razi, et al.
Pubblicazione: (2024)
GHOST: Ground-projected Hypotheses from Observed Structure-from-Motion Trajectories
di: Frelek, Tomasz, et al.
Pubblicazione: (2026)
di: Frelek, Tomasz, et al.
Pubblicazione: (2026)
CK-Transformer: Commonsense Knowledge Enhanced Transformers for Referring Expression Comprehension
di: Zhang, Zhi, et al.
Pubblicazione: (2023)
di: Zhang, Zhi, et al.
Pubblicazione: (2023)
Latent Expression Generation for Referring Image Segmentation and Grounding
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
Learning Language Structures through Grounding
di: Shi, Freda
Pubblicazione: (2024)
di: Shi, Freda
Pubblicazione: (2024)
The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
di: Xu, Kepeng, et al.
Pubblicazione: (2026)
di: Xu, Kepeng, et al.
Pubblicazione: (2026)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
Convolutional Neural Nets vs Vision Transformers: A SpaceNet Case Study with Balanced vs Imbalanced Regimes
di: Gothi, Akshar
Pubblicazione: (2025)
di: Gothi, Akshar
Pubblicazione: (2025)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
di: Li, Dingming, et al.
Pubblicazione: (2025)
di: Li, Dingming, et al.
Pubblicazione: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
di: He, Zoe Wanying, et al.
Pubblicazione: (2025)
di: He, Zoe Wanying, et al.
Pubblicazione: (2025)
Beyond Vision: How Large Language Models Interpret Facial Expressions from Valence-Arousal Values
di: Mehra, Vaibhav, et al.
Pubblicazione: (2025)
di: Mehra, Vaibhav, et al.
Pubblicazione: (2025)
Grounding Language in Multi-Perspective Referential Communication
di: Tang, Zineng, et al.
Pubblicazione: (2024)
di: Tang, Zineng, et al.
Pubblicazione: (2024)
From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning
di: Gado, Ahmed Y., et al.
Pubblicazione: (2026)
di: Gado, Ahmed Y., et al.
Pubblicazione: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
di: Li, You, et al.
Pubblicazione: (2025)
di: Li, You, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025) -
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
di: Kamali, Danial, et al.
Pubblicazione: (2025) -
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
di: Premsri, Tanawan, et al.
Pubblicazione: (2025) -
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
di: Ma, Tianyi, et al.
Pubblicazione: (2025) -
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
di: Barezi, Elham J., et al.
Pubblicazione: (2024)