UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Hao, Xixuan, Chen, Wei, Yan, Yibo, Zhong, Siru, Wang, Kun, Wen, Qingsong, Liang, Yuxuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation
by: Zhong, Siru, et al.
Published: (2024)
by: Zhong, Siru, et al.
Published: (2024)
UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web
by: Yan, Yibo, et al.
Published: (2023)
by: Yan, Yibo, et al.
Published: (2023)
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
by: Zhong, Siru, et al.
Published: (2025)
by: Zhong, Siru, et al.
Published: (2025)
Vision-Enhanced Time Series Forecasting via Latent Diffusion Models
by: Ruan, Weilin, et al.
Published: (2025)
by: Ruan, Weilin, et al.
Published: (2025)
OccamVTS: Distilling Vision Models to 1% Parameters for Time Series Forecasting
by: Lyu, Sisuo, et al.
Published: (2025)
by: Lyu, Sisuo, et al.
Published: (2025)
MuseCL: Predicting Urban Socioeconomic Indicators via Multi-Semantic Contrastive Learning
by: Yong, Xixian, et al.
Published: (2024)
by: Yong, Xixian, et al.
Published: (2024)
VLP: Vision Language Planning for Autonomous Driving
by: Pan, Chenbin, et al.
Published: (2024)
by: Pan, Chenbin, et al.
Published: (2024)
VLP: A Survey on Vision-Language Pre-training
by: Chen, Feilong, et al.
Published: (2022)
by: Chen, Feilong, et al.
Published: (2022)
Space-aware Socioeconomic Indicator Inference with Heterogeneous Graphs
by: Zou, Xingchen, et al.
Published: (2024)
by: Zou, Xingchen, et al.
Published: (2024)
UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models
by: Yin, Jun, et al.
Published: (2025)
by: Yin, Jun, et al.
Published: (2025)
CogVLM: Visual Expert for Pretrained Language Models
by: Wang, Weihan, et al.
Published: (2023)
by: Wang, Weihan, et al.
Published: (2023)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
by: Liu, Youzhi, et al.
Published: (2024)
by: Liu, Youzhi, et al.
Published: (2024)
SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics
by: Mahdizadeh, Ailar, et al.
Published: (2025)
by: Mahdizadeh, Ailar, et al.
Published: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
by: Li, Anqi, et al.
Published: (2025)
by: Li, Anqi, et al.
Published: (2025)
Cross Space and Time: A Spatio-Temporal Unitized Model for Traffic Flow Forecasting
by: Ruan, Weilin, et al.
Published: (2024)
by: Ruan, Weilin, et al.
Published: (2024)
Multi-Context Fusion Transformer for Pedestrian Crossing Intention Prediction in Urban Environments
by: Li, Yuanzhe, et al.
Published: (2025)
by: Li, Yuanzhe, et al.
Published: (2025)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
by: Jiang, Wen, et al.
Published: (2026)
by: Jiang, Wen, et al.
Published: (2026)
Advancing Medical Radiograph Representation Learning: A Hybrid Pre-training Paradigm with Multilevel Semantic Granularity
by: Jiang, Hanqi, et al.
Published: (2024)
by: Jiang, Hanqi, et al.
Published: (2024)
SocialTrack: Multi-Object Tracking in Complex Urban Traffic Scenes Inspired by Social Behavior
by: Tao, Wenguang, et al.
Published: (2025)
by: Tao, Wenguang, et al.
Published: (2025)
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
by: Mushkani, Rashid
Published: (2025)
by: Mushkani, Rashid
Published: (2025)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
by: Yan, Hao, et al.
Published: (2024)
by: Yan, Hao, et al.
Published: (2024)
Granularity at Scale: Estimating Neighborhood Socioeconomic Indicators from High-Resolution Orthographic Imagery and Hybrid Learning
by: Brewer, Ethan, et al.
Published: (2023)
by: Brewer, Ethan, et al.
Published: (2023)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
by: Zhao, Baining, et al.
Published: (2025)
by: Zhao, Baining, et al.
Published: (2025)
UrbanSAM: Learning Invariance-Inspired Adapters for Segment Anything Models in Urban Construction
by: Li, Chenyu, et al.
Published: (2025)
by: Li, Chenyu, et al.
Published: (2025)
Revisiting Prompt Pretraining of Vision-Language Models
by: Chen, Zhenyuan, et al.
Published: (2024)
by: Chen, Zhenyuan, et al.
Published: (2024)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
by: Jin, Yang, et al.
Published: (2023)
by: Jin, Yang, et al.
Published: (2023)
Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China
by: Wu, Menglin, et al.
Published: (2026)
by: Wu, Menglin, et al.
Published: (2026)
Rethink Predicting the Optical Flow with the Kinetics Perspective
by: Cheng, Yuhao, et al.
Published: (2024)
by: Cheng, Yuhao, et al.
Published: (2024)
Contrastive Pretraining for Visual Concept Explanations of Socioeconomic Outcomes
by: Obadic, Ivica, et al.
Published: (2024)
by: Obadic, Ivica, et al.
Published: (2024)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
Vision-and-Language Navigation Generative Pretrained Transformer
by: Hanlin, Wen
Published: (2024)
by: Hanlin, Wen
Published: (2024)
GLAM: Geometry-Guided Local Alignment for Multi-View VLP in Mammography
by: Du, Yuexi, et al.
Published: (2025)
by: Du, Yuexi, et al.
Published: (2025)
Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays
by: Liu, Kang, et al.
Published: (2026)
by: Liu, Kang, et al.
Published: (2026)
Urban Architect: Steerable 3D Urban Scene Generation with Layout Prior
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
by: Yan, Siyuan, et al.
Published: (2025)
by: Yan, Siyuan, et al.
Published: (2025)
VDNeRF: Vision-only Dynamic Neural Radiance Field for Urban Scenes
by: Zou, Zhengyu, et al.
Published: (2025)
by: Zou, Zhengyu, et al.
Published: (2025)
Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation
by: Peng, Jiankun, et al.
Published: (2026)
by: Peng, Jiankun, et al.
Published: (2026)
Granular Privacy Control for Geolocation with Vision Language Models
by: Mendes, Ethan, et al.
Published: (2024)
by: Mendes, Ethan, et al.
Published: (2024)
Planning for Cooler Cities: A Multimodal AI Framework for Predicting and Mitigating Urban Heat Stress through Urban Landscape Transformation
by: Yi, Shengao, et al.
Published: (2025)
by: Yi, Shengao, et al.
Published: (2025)
Similar Items
-
UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation
by: Zhong, Siru, et al.
Published: (2024) -
UrbanCLIP: Learning Text-enhanced Urban Region Profiling with Contrastive Language-Image Pretraining from the Web
by: Yan, Yibo, et al.
Published: (2023) -
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
by: Zhong, Siru, et al.
Published: (2025) -
Vision-Enhanced Time Series Forecasting via Latent Diffusion Models
by: Ruan, Weilin, et al.
Published: (2025) -
OccamVTS: Distilling Vision Models to 1% Parameters for Time Series Forecasting
by: Lyu, Sisuo, et al.
Published: (2025)