AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Shixiong, Zhang, Chenghao, Fan, Lubin, Zhou, Yuan, Fan, Bin, Xiang, Shiming, Meng, Gaofeng, Ye, Jieping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
by: Xu, Shixiong, et al.
Published: (2024)
by: Xu, Shixiong, et al.
Published: (2024)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
CoL3D: Collaborative Learning of Single-view Depth and Camera Intrinsics for Metric 3D Shape Recovery
by: Zhang, Chenghao, et al.
Published: (2025)
by: Zhang, Chenghao, et al.
Published: (2025)
Defying Imbalanced Forgetting in Class Incremental Learning
by: Xu, Shixiong, et al.
Published: (2024)
by: Xu, Shixiong, et al.
Published: (2024)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
by: Chen, Pingyi, et al.
Published: (2025)
by: Chen, Pingyi, et al.
Published: (2025)
Reusable Architecture Growth for Continual Stereo Matching
by: Zhang, Chenghao, et al.
Published: (2024)
by: Zhang, Chenghao, et al.
Published: (2024)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
Enhancing Visual Continual Learning with Language-Guided Supervision
by: Ni, Bolin, et al.
Published: (2024)
by: Ni, Bolin, et al.
Published: (2024)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
by: Hong, Yuyang, et al.
Published: (2025)
by: Hong, Yuyang, et al.
Published: (2025)
Learning Neural Volumetric Pose Features for Camera Localization
by: Lin, Jingyu, et al.
Published: (2024)
by: Lin, Jingyu, et al.
Published: (2024)
Free Lunch for Generating Effective Outlier Supervision
by: Pei, Sen, et al.
Published: (2023)
by: Pei, Sen, et al.
Published: (2023)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
by: Hong, Yuyang, et al.
Published: (2026)
by: Hong, Yuyang, et al.
Published: (2026)
PTZ-Calib: Robust Pan-Tilt-Zoom Camera Calibration
by: Guo, Jinhui, et al.
Published: (2025)
by: Guo, Jinhui, et al.
Published: (2025)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
by: Maharana, Adyasha, et al.
Published: (2023)
by: Maharana, Adyasha, et al.
Published: (2023)
NoPe-NeRF++: Local-to-Global Optimization of NeRF with No Pose Prior
by: Shi, Dongbo, et al.
Published: (2025)
by: Shi, Dongbo, et al.
Published: (2025)
VICI: VLM-Instructed Cross-view Image-localisation
by: Zhang, Xiaohan, et al.
Published: (2025)
by: Zhang, Xiaohan, et al.
Published: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
by: Zhu, Yingjian, et al.
Published: (2026)
by: Zhu, Yingjian, et al.
Published: (2026)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
by: Shen, Lingdong, et al.
Published: (2024)
by: Shen, Lingdong, et al.
Published: (2024)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
by: Zhu, Lanyun, et al.
Published: (2024)
by: Zhu, Lanyun, et al.
Published: (2024)
Addressing selection bias in cluster randomized experiments via weighting
by: Papadogeorgou, Georgia, et al.
Published: (2023)
by: Papadogeorgou, Georgia, et al.
Published: (2023)
What If We Let Forecasting Forget? A Sparse Bottleneck for Cross-Variable Dependencies
by: Zhang, Fan, et al.
Published: (2026)
by: Zhang, Fan, et al.
Published: (2026)
Personalisation or Prejudice? Addressing Geographic Bias in Hate Speech Detection using Debias Tuning in Large Language Models
by: Piot, Paloma, et al.
Published: (2025)
by: Piot, Paloma, et al.
Published: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
by: Diao, Xingjian, et al.
Published: (2026)
by: Diao, Xingjian, et al.
Published: (2026)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
by: Ding, Kun, et al.
Published: (2022)
by: Ding, Kun, et al.
Published: (2022)
CF-VLM:CounterFactual Vision-Language Fine-tuning
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
AddressWatcher: Sanitizer-Based Localization of Memory Leak Fixes
by: Murali, Aniruddhan, et al.
Published: (2024)
by: Murali, Aniruddhan, et al.
Published: (2024)
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
by: Wu, Kangyi, et al.
Published: (2026)
by: Wu, Kangyi, et al.
Published: (2026)
Addressing Moral Uncertainty using Large Language Models for Ethical Decision-Making
by: Dubey, Rohit K., et al.
Published: (2025)
by: Dubey, Rohit K., et al.
Published: (2025)
Unveiling and Addressing Pseudo Forgetting in Large Language Models
by: Sun, Huashan, et al.
Published: (2024)
by: Sun, Huashan, et al.
Published: (2024)
Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language Models
by: Ding, Zhuojun, et al.
Published: (2025)
by: Ding, Zhuojun, et al.
Published: (2025)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
by: Ding, Kun, et al.
Published: (2025)
by: Ding, Kun, et al.
Published: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
HybridGS: Decoupling Transients and Statics with 2D and 3D Gaussian Splatting
by: Lin, Jingyu, et al.
Published: (2024)
by: Lin, Jingyu, et al.
Published: (2024)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
by: Liu, Jiajin, et al.
Published: (2026)
by: Liu, Jiajin, et al.
Published: (2026)
Addressing Failures in Robotics using Vision-Based Language Models (VLMs) and Behavior Trees (BT)
by: Ahmad, Faseeh, et al.
Published: (2024)
by: Ahmad, Faseeh, et al.
Published: (2024)
Exploring Gradient Subspaces: Addressing and Overcoming LoRA's Limitations in Federated Fine-Tuning of Large Language Models
by: Mahla, Navyansh, et al.
Published: (2024)
by: Mahla, Navyansh, et al.
Published: (2024)
User-Driven Value Alignment: Understanding Users' Perceptions and Strategies for Addressing Biased and Discriminatory Statements in AI Companions
by: Fan, Xianzhe, et al.
Published: (2024)
by: Fan, Xianzhe, et al.
Published: (2024)
Similar Items
-
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
by: Xu, Shixiong, et al.
Published: (2024) -
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025) -
CoL3D: Collaborative Learning of Single-view Depth and Camera Intrinsics for Metric 3D Shape Recovery
by: Zhang, Chenghao, et al.
Published: (2025) -
Defying Imbalanced Forgetting in Class Incremental Learning
by: Xu, Shixiong, et al.
Published: (2024) -
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
by: Chen, Pingyi, et al.
Published: (2025)