Transformer-based Spatial Grounding: A Comprehensive Survey
Fuente:
arXiv
Saved in:
| Main Authors: | Haq, Ijazul, Saqib, Muhammad, Zhang, Yingjie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
A benchmark multimodal oro-dental dataset for large vision-language models
by: Lv, Haoxin, et al.
Published: (2025)
by: Lv, Haoxin, et al.
Published: (2025)
Detecting Severity of Diabetic Retinopathy from Fundus Images: A Transformer Network-based Review
by: Karkera, Tejas, et al.
Published: (2023)
by: Karkera, Tejas, et al.
Published: (2023)
Vision Transformers in Precision Agriculture: A Comprehensive Survey
by: Mehdipour, Saber, et al.
Published: (2025)
by: Mehdipour, Saber, et al.
Published: (2025)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
by: Gao, Hong, et al.
Published: (2025)
by: Gao, Hong, et al.
Published: (2025)
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
by: Wu, Haoning, et al.
Published: (2025)
by: Wu, Haoning, et al.
Published: (2025)
A Comprehensive Survey on Deep Learning Solutions for 3D Flood Mapping
by: Jia, Wenfeng, et al.
Published: (2025)
by: Jia, Wenfeng, et al.
Published: (2025)
Towards Label-Free Single-Cell Phenotyping Using Multi-Task Learning
by: Nazir, Saqib, et al.
Published: (2026)
by: Nazir, Saqib, et al.
Published: (2026)
SAM2 for Image and Video Segmentation: A Comprehensive Survey
by: Jiaxing, Zhang, et al.
Published: (2025)
by: Jiaxing, Zhang, et al.
Published: (2025)
Deep Learning in Palmprint Recognition-A Comprehensive Survey
by: Gao, Chengrui, et al.
Published: (2025)
by: Gao, Chengrui, et al.
Published: (2025)
From Satellite to Street: A Hybrid Framework Integrating Stable Diffusion and PanoGAN for Consistent Cross-View Synthesis
by: Bajbaa, Khawlah, et al.
Published: (2025)
by: Bajbaa, Khawlah, et al.
Published: (2025)
A Survey of Video Datasets for Grounded Event Understanding
by: Sanders, Kate, et al.
Published: (2024)
by: Sanders, Kate, et al.
Published: (2024)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
by: Ropero, Fernando, et al.
Published: (2026)
by: Ropero, Fernando, et al.
Published: (2026)
Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
by: Li, Jinxuan, et al.
Published: (2025)
by: Li, Jinxuan, et al.
Published: (2025)
A Survey of Adversarial Defenses in Vision-based Systems: Categorization, Methods and Challenges
by: Chattopadhyay, Nandish, et al.
Published: (2025)
by: Chattopadhyay, Nandish, et al.
Published: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
A Comprehensive Survey on 3D Content Generation
by: Liu, Jian, et al.
Published: (2024)
by: Liu, Jian, et al.
Published: (2024)
Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
by: Wang, Xingyue, et al.
Published: (2026)
by: Wang, Xingyue, et al.
Published: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
by: Jia, Mengdi, et al.
Published: (2025)
by: Jia, Mengdi, et al.
Published: (2025)
Transformers Meet Hyperspectral Imaging: A Comprehensive Study of Models, Challenges and Open Problems
by: Zhang, Guyang, et al.
Published: (2025)
by: Zhang, Guyang, et al.
Published: (2025)
Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments
by: Ali, Muhammad, et al.
Published: (2025)
by: Ali, Muhammad, et al.
Published: (2025)
UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science
by: Zhang, Jie, et al.
Published: (2026)
by: Zhang, Jie, et al.
Published: (2026)
A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
by: Ma, Guozheng, et al.
Published: (2022)
by: Ma, Guozheng, et al.
Published: (2022)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
by: Chen, Boyuan, et al.
Published: (2026)
by: Chen, Boyuan, et al.
Published: (2026)
Transformer for Object Re-Identification: A Survey
by: Ye, Mang, et al.
Published: (2024)
by: Ye, Mang, et al.
Published: (2024)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
by: Zheng, Xinyi, et al.
Published: (2026)
by: Zheng, Xinyi, et al.
Published: (2026)
A Comprehensive Survey on Concept Erasure in Text-to-Image Diffusion Models
by: Kim, Changhoon, et al.
Published: (2025)
by: Kim, Changhoon, et al.
Published: (2025)
A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights
by: Lei, Wentao, et al.
Published: (2024)
by: Lei, Wentao, et al.
Published: (2024)
A Comprehensive Survey on Surgical Digital Twin
by: Khan, Afsah Sharaf, et al.
Published: (2025)
by: Khan, Afsah Sharaf, et al.
Published: (2025)
OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding
by: Huang, Wenyuan, et al.
Published: (2025)
by: Huang, Wenyuan, et al.
Published: (2025)
Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark
by: Li, Qi, et al.
Published: (2026)
by: Li, Qi, et al.
Published: (2026)
Edge Deep Learning in Computer Vision and Medical Diagnostics: A Comprehensive Survey
by: Xu, Yiwen, et al.
Published: (2026)
by: Xu, Yiwen, et al.
Published: (2026)
Self-Attention Based Multi-Scale Graph Auto-Encoder Network of 3D Meshes
by: Nazir, Saqib, et al.
Published: (2025)
by: Nazir, Saqib, et al.
Published: (2025)
Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models
by: Samin, Niamul Hassan, et al.
Published: (2026)
by: Samin, Niamul Hassan, et al.
Published: (2026)
Online Handwritten Signature Verification Based on Temporal-Spatial Graph Attention Transformer
by: Yuan, Hai-jie, et al.
Published: (2025)
by: Yuan, Hai-jie, et al.
Published: (2025)
A Comprehensive Survey of Foundation Models in Medicine
by: Khan, Wasif, et al.
Published: (2024)
by: Khan, Wasif, et al.
Published: (2024)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
by: Lei, Yinjie, et al.
Published: (2023)
by: Lei, Yinjie, et al.
Published: (2023)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
by: Alansari, Mohamad, et al.
Published: (2026)
by: Alansari, Mohamad, et al.
Published: (2026)
RDD4D: 4D Attention-Guided Road Damage Detection And Classification
by: Alkalbani, Asma, et al.
Published: (2025)
by: Alkalbani, Asma, et al.
Published: (2025)
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
by: Lee, Jungho, et al.
Published: (2025)
by: Lee, Jungho, et al.
Published: (2025)
Similar Items
-
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025) -
A benchmark multimodal oro-dental dataset for large vision-language models
by: Lv, Haoxin, et al.
Published: (2025) -
Detecting Severity of Diabetic Retinopathy from Fundus Images: A Transformer Network-based Review
by: Karkera, Tejas, et al.
Published: (2023) -
Vision Transformers in Precision Agriculture: A Comprehensive Survey
by: Mehdipour, Saber, et al.
Published: (2025) -
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
by: Gao, Hong, et al.
Published: (2025)