Skill-Conditioned Visual Geolocation for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Chenjie, Jiang, Yutian, Deng, Yutong, Wu, Chenyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
di: Erzurumlu, Yunus Talha, et al.
Pubblicazione: (2026)
di: Erzurumlu, Yunus Talha, et al.
Pubblicazione: (2026)
GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
di: Liu, Xinwei, et al.
Pubblicazione: (2025)
di: Liu, Xinwei, et al.
Pubblicazione: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
di: Gadi, Hari Krishna, et al.
Pubblicazione: (2026)
di: Gadi, Hari Krishna, et al.
Pubblicazione: (2026)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2026)
di: Chen, Junkai, et al.
Pubblicazione: (2026)
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
di: Lim, Sohwi, et al.
Pubblicazione: (2026)
di: Lim, Sohwi, et al.
Pubblicazione: (2026)
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
di: Lu, Hui, et al.
Pubblicazione: (2025)
di: Lu, Hui, et al.
Pubblicazione: (2025)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
OpenStreetView-5M: The Many Roads to Global Visual Geolocation
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
di: Astruc, Guillaume, et al.
Pubblicazione: (2024)
Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation
di: Bicakci, Yunus Serhat, et al.
Pubblicazione: (2025)
di: Bicakci, Yunus Serhat, et al.
Pubblicazione: (2025)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
di: Wu, Junfei, et al.
Pubblicazione: (2025)
di: Wu, Junfei, et al.
Pubblicazione: (2025)
WalkVLM:Aid Visually Impaired People Walking by Vision Language Model
di: Yuan, Zhiqiang, et al.
Pubblicazione: (2024)
di: Yuan, Zhiqiang, et al.
Pubblicazione: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
di: Kim, Sohee, et al.
Pubblicazione: (2025)
di: Kim, Sohee, et al.
Pubblicazione: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Language-Conditioned World Modeling for Visual Navigation
di: Dong, Yifei, et al.
Pubblicazione: (2026)
di: Dong, Yifei, et al.
Pubblicazione: (2026)
Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics
di: Chen, Minglei, et al.
Pubblicazione: (2026)
di: Chen, Minglei, et al.
Pubblicazione: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
Generative Visual Communication in the Era of Vision-Language Models
di: Vinker, Yael
Pubblicazione: (2024)
di: Vinker, Yael
Pubblicazione: (2024)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
di: He, Yuting, et al.
Pubblicazione: (2026)
di: He, Yuting, et al.
Pubblicazione: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
Evolving Prompt Adaptation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2026)
di: Zhang, Enming, et al.
Pubblicazione: (2026)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
di: Ong, Kenneth J. K.
Pubblicazione: (2026)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
AVA: Towards Agentic Video Analytics with Vision Language Models
di: Yan, Yuxuan, et al.
Pubblicazione: (2025)
di: Yan, Yuxuan, et al.
Pubblicazione: (2025)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison
di: Jiang, Xi, et al.
Pubblicazione: (2026)
di: Jiang, Xi, et al.
Pubblicazione: (2026)
Computer Vision for Multimedia Geolocation in Human Trafficking Investigation: A Systematic Literature Review
di: Bamigbade, Opeyemi, et al.
Pubblicazione: (2024)
di: Bamigbade, Opeyemi, et al.
Pubblicazione: (2024)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
di: Yang, Luyu, et al.
Pubblicazione: (2026)
di: Yang, Luyu, et al.
Pubblicazione: (2026)
DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring
di: Rani, Anju, et al.
Pubblicazione: (2026)
di: Rani, Anju, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
di: Chae, Hyunsik, et al.
Pubblicazione: (2025) -
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
di: Erzurumlu, Yunus Talha, et al.
Pubblicazione: (2026) -
GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
di: Liu, Xinwei, et al.
Pubblicazione: (2025) -
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
di: Liu, Xiwei, et al.
Pubblicazione: (2026) -
HierLoc: Hyperbolic Entity Embeddings for Hierarchical Visual Geolocation
di: Gadi, Hari Krishna, et al.
Pubblicazione: (2026)