MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
Fuente:
arXiv
Saved in:
| Main Authors: | Xiao, Zhendong, Wei, Wu, Ji, Shujie, Yang, Shan, Chen, Changhao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
by: Xiao, Zhendong, et al.
Published: (2024)
by: Xiao, Zhendong, et al.
Published: (2024)
ThermalLoc: A Vision Transformer-Based Approach for Robust Thermal Camera Relocalization in Large-Scale Environments
by: Liu, Yu, et al.
Published: (2025)
by: Liu, Yu, et al.
Published: (2025)
PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching
by: Ye, Hanqiao, et al.
Published: (2026)
by: Ye, Hanqiao, et al.
Published: (2026)
MambaLoc: Efficient Camera Localisation via State Space Model
by: Wang, Jialu, et al.
Published: (2024)
by: Wang, Jialu, et al.
Published: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
by: Zhang, Jiwen, et al.
Published: (2026)
by: Zhang, Jiwen, et al.
Published: (2026)
GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations
by: Khatib, Fadi, et al.
Published: (2025)
by: Khatib, Fadi, et al.
Published: (2025)
TrafficLoc: Localizing Traffic Surveillance Cameras in 3D Scenes
by: Xia, Yan, et al.
Published: (2024)
by: Xia, Yan, et al.
Published: (2024)
Semantic Object-level Modeling for Robust Visual Camera Relocalization
by: Zhu, Yifan, et al.
Published: (2024)
by: Zhu, Yifan, et al.
Published: (2024)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
by: Wang, Jingyi, et al.
Published: (2024)
by: Wang, Jingyi, et al.
Published: (2024)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
by: Wei, Hao, et al.
Published: (2024)
by: Wei, Hao, et al.
Published: (2024)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
by: Zhao, Ruosen, et al.
Published: (2025)
by: Zhao, Ruosen, et al.
Published: (2025)
GeLoc3r: Enhancing Relative Camera Pose Regression with Geometric Consistency Regularization
by: Li, Jingxing, et al.
Published: (2025)
by: Li, Jingxing, et al.
Published: (2025)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
by: Qu, Kevin, et al.
Published: (2026)
by: Qu, Kevin, et al.
Published: (2026)
Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable, Fast, and Accurate Visual Localization
by: Dong, Siyan, et al.
Published: (2024)
by: Dong, Siyan, et al.
Published: (2024)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
by: Ren, Yuan, et al.
Published: (2024)
by: Ren, Yuan, et al.
Published: (2024)
From Sparse to Dense: Camera Relocalization with Scene-Specific Detector from Feature Gaussian Splatting
by: Huang, Zhiwei, et al.
Published: (2025)
by: Huang, Zhiwei, et al.
Published: (2025)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
by: Wang, Dongkai, et al.
Published: (2024)
by: Wang, Dongkai, et al.
Published: (2024)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
by: Wang, Shenzhi, et al.
Published: (2026)
by: Wang, Shenzhi, et al.
Published: (2026)
SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization
by: Shang, Tianyi, et al.
Published: (2026)
by: Shang, Tianyi, et al.
Published: (2026)
Safety Alignment for Vision Language Models
by: Liu, Zhendong, et al.
Published: (2024)
by: Liu, Zhendong, et al.
Published: (2024)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction
by: Che, Henry, et al.
Published: (2026)
by: Che, Henry, et al.
Published: (2026)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
by: Ji, Yatai, et al.
Published: (2024)
by: Ji, Yatai, et al.
Published: (2024)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
by: Wang, JiYang, et al.
Published: (2026)
by: Wang, JiYang, et al.
Published: (2026)
Towards Generalizable Scene Change Detection
by: Kim, Jaewoo, et al.
Published: (2024)
by: Kim, Jaewoo, et al.
Published: (2024)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
by: Xu, Yifan, et al.
Published: (2025)
by: Xu, Yifan, et al.
Published: (2025)
Align before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action Recognition
by: Chen, Yifei, et al.
Published: (2023)
by: Chen, Yifei, et al.
Published: (2023)
Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge
by: Xiao, Mingyu, et al.
Published: (2024)
by: Xiao, Mingyu, et al.
Published: (2024)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
by: Cao, Yue, et al.
Published: (2024)
by: Cao, Yue, et al.
Published: (2024)
Adaptive Camera Sensor for Vision Models
by: Baek, Eunsu, et al.
Published: (2025)
by: Baek, Eunsu, et al.
Published: (2025)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
by: Li, Nanxi, et al.
Published: (2026)
by: Li, Nanxi, et al.
Published: (2026)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
by: Chen, Jiuhai, et al.
Published: (2024)
by: Chen, Jiuhai, et al.
Published: (2024)
UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation
by: Dai, Guangzhao, et al.
Published: (2024)
by: Dai, Guangzhao, et al.
Published: (2024)
Gondola: Grounded Vision Language Planning for Generalizable Robotic Manipulation
by: Chen, Shizhe, et al.
Published: (2025)
by: Chen, Shizhe, et al.
Published: (2025)
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
by: Yang, Yijun, et al.
Published: (2025)
by: Yang, Yijun, et al.
Published: (2025)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
by: Kang, Shuhao, et al.
Published: (2026)
by: Kang, Shuhao, et al.
Published: (2026)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
by: Becquet, Gabriel, et al.
Published: (2026)
by: Becquet, Gabriel, et al.
Published: (2026)
LocRef-Diffusion:Tuning-Free Layout and Appearance-Guided Generation
by: Deng, Fan, et al.
Published: (2024)
by: Deng, Fan, et al.
Published: (2024)
GALA: A GlobAl-LocAl Approach for Multi-Source Active Domain Adaptation
by: Zheng, Juepeng, et al.
Published: (2025)
by: Zheng, Juepeng, et al.
Published: (2025)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
by: Park, Eunkyu, et al.
Published: (2025)
by: Park, Eunkyu, et al.
Published: (2025)
Similar Items
-
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
by: Xiao, Zhendong, et al.
Published: (2024) -
ThermalLoc: A Vision Transformer-Based Approach for Robust Thermal Camera Relocalization in Large-Scale Environments
by: Liu, Yu, et al.
Published: (2025) -
PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching
by: Ye, Hanqiao, et al.
Published: (2026) -
MambaLoc: Efficient Camera Localisation via State Space Model
by: Wang, Jialu, et al.
Published: (2024) -
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
by: Zhang, Jiwen, et al.
Published: (2026)