Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Bo, Yang, Fengze, Liu, Yiming, Wang, Chao, Luo, Xuewen, Li, Taozhe, Ke, Ruimin, Zhou, Xiaofan, Liu, Chenxi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance
por: Yang, Fengze, et al.
Publicado: (2025)
por: Yang, Fengze, et al.
Publicado: (2025)
Don't let the information slip away
por: Li, Taozhe, et al.
Publicado: (2026)
por: Li, Taozhe, et al.
Publicado: (2026)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
por: Feng, Ruimin, et al.
Publicado: (2025)
por: Feng, Ruimin, et al.
Publicado: (2025)
AirV2X: Unified Air-Ground Vehicle-to-Everything Collaboration
por: Gao, Xiangbo, et al.
Publicado: (2025)
por: Gao, Xiangbo, et al.
Publicado: (2025)
Adaptive Stopping for Multi-Turn LLM Reasoning
por: Zhou, Xiaofan, et al.
Publicado: (2026)
por: Zhou, Xiaofan, et al.
Publicado: (2026)
V2X-UniPool: Unifying Multimodal Perception and Knowledge Reasoning for Autonomous Driving
por: Luo, Xuewen, et al.
Publicado: (2025)
por: Luo, Xuewen, et al.
Publicado: (2025)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
KnowDiffuser: A Knowledge-Guided Diffusion Planner with LLM Reasoning
por: Ding, Fan, et al.
Publicado: (2026)
por: Ding, Fan, et al.
Publicado: (2026)
Endo-G$^{2}$T: Geometry-Guided & Temporally Aware Time-Embedded 4DGS For Endoscopic Scenes
por: Liu, Yangle, et al.
Publicado: (2025)
por: Liu, Yangle, et al.
Publicado: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Unleashing Vision Transformer Potential In Image Quality Assessment via Global-Local Adaptive Interaction
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Motion Guided Token Compression for Efficient Masked Video Modeling
por: Feng, Yukun, et al.
Publicado: (2024)
por: Feng, Yukun, et al.
Publicado: (2024)
SenseRAG: Constructing Environmental Knowledge Bases with Proactive Querying for LLM-Based Autonomous Driving
por: Luo, Xuewen, et al.
Publicado: (2025)
por: Luo, Xuewen, et al.
Publicado: (2025)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
por: Li, Ling, et al.
Publicado: (2024)
por: Li, Ling, et al.
Publicado: (2024)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
por: Li, Ling, et al.
Publicado: (2025)
por: Li, Ling, et al.
Publicado: (2025)
MLP-SLAM: Multilayer Perceptron-Based Simultaneous Localization and Mapping
por: Li, Taozhe, et al.
Publicado: (2024)
por: Li, Taozhe, et al.
Publicado: (2024)
ATA: Bridging Implicit Reasoning with Attention-Guided and Action-Guided Inference for Vision-Language Action Models
por: Yang, Cheng, et al.
Publicado: (2026)
por: Yang, Cheng, et al.
Publicado: (2026)
VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning Framework
por: Sheng, Ziqi, et al.
Publicado: (2025)
por: Sheng, Ziqi, et al.
Publicado: (2025)
LocateBench: Evaluating the Locating Ability of Vision Language Models
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2026)
por: Li, Haoyang, et al.
Publicado: (2026)
Vision-Language Model Guided Image Restoration
por: Yang, Cuixin, et al.
Publicado: (2025)
por: Yang, Cuixin, et al.
Publicado: (2025)
Inference Compute-Optimal Video Vision Language Models
por: Wang, Peiqi, et al.
Publicado: (2025)
por: Wang, Peiqi, et al.
Publicado: (2025)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
por: He, Xingxin, et al.
Publicado: (2025)
por: He, Xingxin, et al.
Publicado: (2025)
MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks
por: Zeng, Wenqi, et al.
Publicado: (2025)
por: Zeng, Wenqi, et al.
Publicado: (2025)
iPay: Integrated Payment Action Recognition via Multimodal Networks and Adaptive Spatial Prior Learning
por: Huang, Kaicong, et al.
Publicado: (2026)
por: Huang, Kaicong, et al.
Publicado: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
por: Ling, Yiran, et al.
Publicado: (2026)
por: Ling, Yiran, et al.
Publicado: (2026)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
por: Peng, Wenshuo, et al.
Publicado: (2024)
por: Peng, Wenshuo, et al.
Publicado: (2024)
TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models
por: Cheng, Jiajun, et al.
Publicado: (2026)
por: Cheng, Jiajun, et al.
Publicado: (2026)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
por: Liu, Yaohua, et al.
Publicado: (2025)
por: Liu, Yaohua, et al.
Publicado: (2025)
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
por: Liu, Yuanyuan, et al.
Publicado: (2025)
por: Liu, Yuanyuan, et al.
Publicado: (2025)
Fake-HR1: Rethinking Reasoning of Vision Language Model for Synthetic Image Detection
por: Jiang, Changjiang, et al.
Publicado: (2026)
por: Jiang, Changjiang, et al.
Publicado: (2026)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
por: Qi, Yukun, et al.
Publicado: (2026)
por: Qi, Yukun, et al.
Publicado: (2026)
Adaptive Vision-Language Model Routing for Computer Use Agents
por: Liu, Xunzhuo, et al.
Publicado: (2026)
por: Liu, Xunzhuo, et al.
Publicado: (2026)
CountingFruit: Language-Guided 3D Fruit Counting with Semantic Gaussian Splatting
por: Li, Fengze, et al.
Publicado: (2025)
por: Li, Fengze, et al.
Publicado: (2025)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
por: Liang, Chen, et al.
Publicado: (2022)
por: Liang, Chen, et al.
Publicado: (2022)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
por: Saini, Harshvardhan, et al.
Publicado: (2026)
por: Saini, Harshvardhan, et al.
Publicado: (2026)
Ejemplares similares
-
Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance
por: Yang, Fengze, et al.
Publicado: (2025) -
Don't let the information slip away
por: Li, Taozhe, et al.
Publicado: (2026) -
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
por: Feng, Ruimin, et al.
Publicado: (2025) -
AirV2X: Unified Air-Ground Vehicle-to-Everything Collaboration
por: Gao, Xiangbo, et al.
Publicado: (2025) -
Adaptive Stopping for Multi-Turn LLM Reasoning
por: Zhou, Xiaofan, et al.
Publicado: (2026)