GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yikun, Liu, Zuyan, Wang, Ziyi, Hu, Han, Liu, Pengfei, Rao, Yongming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
par: Zhu, Jiashun, et autres
Publié: (2026)
par: Zhu, Jiashun, et autres
Publié: (2026)
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Efficient Inference of Vision Instruction-Following Models with Elastic Cache
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
par: Sun, Peiwen, et autres
Publié: (2025)
par: Sun, Peiwen, et autres
Publié: (2025)
Vision Generalist Model: A Survey
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
Interpretable Perception and Reasoning for Audiovisual Geolocation
par: Su, Yiyang, et autres
Publié: (2026)
par: Su, Yiyang, et autres
Publié: (2026)
Ola: Pushing the Frontiers of Omni-Modal Language Model
par: Liu, Zuyan, et autres
Publié: (2025)
par: Liu, Zuyan, et autres
Publié: (2025)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
par: Xiao, Yijia, et autres
Publié: (2024)
par: Xiao, Yijia, et autres
Publié: (2024)
Statewide Visual Geolocalization in the Wild
par: Fervers, Florian, et autres
Publié: (2024)
par: Fervers, Florian, et autres
Publié: (2024)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
par: Liu, Shifeng, et autres
Publié: (2026)
par: Liu, Shifeng, et autres
Publié: (2026)
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
par: Ji, Yuxiang, et autres
Publié: (2026)
par: Ji, Yuxiang, et autres
Publié: (2026)
VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning
par: Chen, Li-Heng, et autres
Publié: (2026)
par: Chen, Li-Heng, et autres
Publié: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
GeoSearch: Augmenting Worldwide Geolocalization with Web-Scale Reverse Image Search and Image Matching
par: Le-Duc, Tung-Duong, et autres
Publié: (2026)
par: Le-Duc, Tung-Duong, et autres
Publié: (2026)
GaGA: Towards Interactive Global Geolocation Assistant
par: Dou, Zhiyang, et autres
Publié: (2024)
par: Dou, Zhiyang, et autres
Publié: (2024)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
par: Gadi, Hari Krishna, et autres
Publié: (2026)
par: Gadi, Hari Krishna, et autres
Publié: (2026)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
par: Liu, Xiangyan, et autres
Publié: (2025)
par: Liu, Xiangyan, et autres
Publié: (2025)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
par: Liu, Chengwen, et autres
Publié: (2026)
par: Liu, Chengwen, et autres
Publié: (2026)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
VistaDream: Sampling multiview consistent images for single-view scene reconstruction
par: Wang, Haiping, et autres
Publié: (2024)
par: Wang, Haiping, et autres
Publié: (2024)
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
par: Su, Zhaochen, et autres
Publié: (2026)
par: Su, Zhaochen, et autres
Publié: (2026)
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
par: X, Tencent Robotics, et autres
Publié: (2026)
par: X, Tencent Robotics, et autres
Publié: (2026)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
A Neurosymbolic Agent System for Compositional Visual Reasoning
par: Xu, Yichang, et autres
Publié: (2025)
par: Xu, Yichang, et autres
Publié: (2025)
From Web to Pixels: Bringing Agentic Search into Visual Perception
par: Yang, Bokang, et autres
Publié: (2026)
par: Yang, Bokang, et autres
Publié: (2026)
GeoRC: A Benchmark for Geolocation Reasoning Chains
par: Talreja, Mohit, et autres
Publié: (2026)
par: Talreja, Mohit, et autres
Publié: (2026)
Semantic-Enriched Latent Visual Reasoning
par: Xu, Tianrun, et autres
Publié: (2026)
par: Xu, Tianrun, et autres
Publié: (2026)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
WebCryptoAgent: Agentic Crypto Trading with Web Informatics
par: Kurban, Ali, et autres
Publié: (2026)
par: Kurban, Ali, et autres
Publié: (2026)
GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
par: Jia, Pengyue, et autres
Publié: (2025)
par: Jia, Pengyue, et autres
Publié: (2025)
GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization
par: Jia, Pengyue, et autres
Publié: (2026)
par: Jia, Pengyue, et autres
Publié: (2026)
Documents similaires
-
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
par: Zhu, Jiashun, et autres
Publié: (2026) -
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
par: Wang, Jiahui, et autres
Publié: (2025) -
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024) -
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024) -
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)