SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Furong, Dai, Ling, Deng, Wenjin, Zhang, Fan, Hu, Chen, Jiang, Daxin, Liu, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
par: Li, Ling, et autres
Publié: (2024)
par: Li, Ling, et autres
Publié: (2024)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
par: Li, Ling, et autres
Publié: (2025)
par: Li, Ling, et autres
Publié: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models
par: Lee, Seungjae, et autres
Publié: (2025)
par: Lee, Seungjae, et autres
Publié: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Prompting Large Vision-Language Models for Compositional Reasoning
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
par: Luo, Liqin, et autres
Publié: (2025)
par: Luo, Liqin, et autres
Publié: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
par: Fan, Rong, et autres
Publié: (2026)
par: Fan, Rong, et autres
Publié: (2026)
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
par: Zeng, Yu, et autres
Publié: (2025)
par: Zeng, Yu, et autres
Publié: (2025)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
par: Mahmood, Hazza, et autres
Publié: (2026)
par: Mahmood, Hazza, et autres
Publié: (2026)
REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization
par: Li, Yong, et autres
Publié: (2026)
par: Li, Yong, et autres
Publié: (2026)
Agentic Reasoning for Large Language Models
par: Wei, Tianxin, et autres
Publié: (2026)
par: Wei, Tianxin, et autres
Publié: (2026)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
par: Li, Yangfu, et autres
Publié: (2026)
par: Li, Yangfu, et autres
Publié: (2026)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
par: Yoon, Hee Suk, et autres
Publié: (2026)
par: Yoon, Hee Suk, et autres
Publié: (2026)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
par: Jia, Pengyue, et autres
Publié: (2025)
par: Jia, Pengyue, et autres
Publié: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
Towards Interpretable Geo-localization: a Concept-Aware Global Image-GPS Alignment Framework
par: Jia, Furong, et autres
Publié: (2025)
par: Jia, Furong, et autres
Publié: (2025)
Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning
par: Yu, Song, et autres
Publié: (2025)
par: Yu, Song, et autres
Publié: (2025)
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
par: Wang, Yikun, et autres
Publié: (2025)
par: Wang, Yikun, et autres
Publié: (2025)
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
par: Wang, Junxin, et autres
Publié: (2026)
par: Wang, Junxin, et autres
Publié: (2026)
Large Vision-Language Models for Knowledge-Grounded Data Annotation of Memes
par: Deng, Shiling, et autres
Publié: (2025)
par: Deng, Shiling, et autres
Publié: (2025)
Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models
par: Zheng, Ziwei, et autres
Publié: (2025)
par: Zheng, Ziwei, et autres
Publié: (2025)
Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models
par: Deng, Wei, et autres
Publié: (2026)
par: Deng, Wei, et autres
Publié: (2026)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
par: Dai, Haocheng, et autres
Publié: (2024)
par: Dai, Haocheng, et autres
Publié: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Enhancing Large Language Models through Structured Reasoning
par: Dong, Yubo, et autres
Publié: (2025)
par: Dong, Yubo, et autres
Publié: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models
par: Yu, Chung-En Johnny, et autres
Publié: (2025)
par: Yu, Chung-En Johnny, et autres
Publié: (2025)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
Probing Mechanical Reasoning in Large Vision Language Models
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
par: Zhang, Congzhi, et autres
Publié: (2025)
par: Zhang, Congzhi, et autres
Publié: (2025)
Documents similaires
-
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
par: Li, Ling, et autres
Publié: (2024) -
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
par: Li, Ling, et autres
Publié: (2025) -
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024) -
Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models
par: Lee, Seungjae, et autres
Publié: (2025) -
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)