UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Jun, Zhong, Jing, Li, Peilin, Pan, Ruolin, Zeng, Pengyu, Zhang, Miao, Lu, Shuai |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
by: Zhong, Jing, et al.
Published: (2025)
by: Zhong, Jing, et al.
Published: (2025)
ArchShapeNet:An Interpretable 3D-CNN Framework for Evaluating Architectural Shapes
by: Yin, Jun, et al.
Published: (2025)
by: Yin, Jun, et al.
Published: (2025)
Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes
by: Perez, Joan, et al.
Published: (2025)
by: Perez, Joan, et al.
Published: (2025)
Boundless: Generating Photorealistic Synthetic Data for Object Detection in Urban Streetscapes
by: Turkcan, Mehmet Kerem, et al.
Published: (2024)
by: Turkcan, Mehmet Kerem, et al.
Published: (2024)
Segment Any Architectural Facades (SAAF):An automatic segmentation model for building facades, walls and windows based on multimodal semantics guidance
by: Li, Peilin, et al.
Published: (2025)
by: Li, Peilin, et al.
Published: (2025)
TSCnet: A Text-driven Semantic-level Controllable Framework for Customized Low-Light Image Enhancement
by: Zhang, Miao, et al.
Published: (2025)
by: Zhang, Miao, et al.
Published: (2025)
The Streetscape Application Services Stack (SASS): Towards a Distributed Sensing Architecture for Urban Applications
by: Pargoo, Navid Salami, et al.
Published: (2024)
by: Pargoo, Navid Salami, et al.
Published: (2024)
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery
by: Chen, Pengyu, et al.
Published: (2025)
by: Chen, Pengyu, et al.
Published: (2025)
First-place Solution for Streetscape Shop Sign Recognition Competition
by: Wang, Bin, et al.
Published: (2025)
by: Wang, Bin, et al.
Published: (2025)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
by: Hao, Xixuan, et al.
Published: (2024)
by: Hao, Xixuan, et al.
Published: (2024)
PromptLNet: Region-Adaptive Aesthetic Enhancement via Prompt Guidance in Low-Light Enhancement Net
by: Yin, Jun, et al.
Published: (2025)
by: Yin, Jun, et al.
Published: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
by: Li, Anqi, et al.
Published: (2025)
by: Li, Anqi, et al.
Published: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
by: Mushkani, Rashid
Published: (2025)
by: Mushkani, Rashid
Published: (2025)
Streetscapes: Large-scale Consistent Street View Generation Using Autoregressive Video Diffusion
by: Deng, Boyang, et al.
Published: (2024)
by: Deng, Boyang, et al.
Published: (2024)
OpenUrban3D: Annotation-Free Open-Vocabulary Semantic Segmentation of Large-Scale Urban Point Clouds
by: Wang, Chongyu, et al.
Published: (2025)
by: Wang, Chongyu, et al.
Published: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
by: Xu, Haotian, et al.
Published: (2026)
by: Xu, Haotian, et al.
Published: (2026)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
by: Zhao, Baining, et al.
Published: (2025)
by: Zhao, Baining, et al.
Published: (2025)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
by: Huo, Fushuo, et al.
Published: (2024)
by: Huo, Fushuo, et al.
Published: (2024)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
by: Mei, Yanghong, et al.
Published: (2025)
by: Mei, Yanghong, et al.
Published: (2025)
Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China
by: Wu, Menglin, et al.
Published: (2026)
by: Wu, Menglin, et al.
Published: (2026)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
TEFormer: Texture-Aware and Edge-Guided Transformer for Semantic Segmentation of Urban Remote Sensing Images
by: Zhou, Guoyu, et al.
Published: (2025)
by: Zhou, Guoyu, et al.
Published: (2025)
Mitigating Urban-Rural Disparities in Contrastive Representation Learning with Satellite Imagery
by: Zhang, Miao, et al.
Published: (2022)
by: Zhang, Miao, et al.
Published: (2022)
Urban Architect: Steerable 3D Urban Scene Generation with Layout Prior
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
Multi-scale Semantic Prior Features Guided Deep Neural Network for Urban Street-view Image
by: Zeng, Jianshun, et al.
Published: (2024)
by: Zeng, Jianshun, et al.
Published: (2024)
UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video
by: Lin, Chih-Hao, et al.
Published: (2023)
by: Lin, Chih-Hao, et al.
Published: (2023)
Comprehensive Dataset for Urban Streetlight Analysis
by: S, Eliza Femi Sherley, et al.
Published: (2024)
by: S, Eliza Femi Sherley, et al.
Published: (2024)
UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors
by: Wang, Tianhang, et al.
Published: (2025)
by: Wang, Tianhang, et al.
Published: (2025)
Efficient Depth-Guided Urban View Synthesis
by: Miao, Sheng, et al.
Published: (2024)
by: Miao, Sheng, et al.
Published: (2024)
From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models
by: Fan, Zicheng, et al.
Published: (2025)
by: Fan, Zicheng, et al.
Published: (2025)
Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
by: Zhou, Wentao, et al.
Published: (2025)
by: Zhou, Wentao, et al.
Published: (2025)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
by: Pang, Chao, et al.
Published: (2024)
by: Pang, Chao, et al.
Published: (2024)
WS-DETR: Robust Water Surface Object Detection through Vision-Radar Fusion with Detection Transformer
by: Yin, Huilin, et al.
Published: (2025)
by: Yin, Huilin, et al.
Published: (2025)
UrbanCAD: Towards Highly Controllable and Photorealistic 3D Vehicles for Urban Scene Simulation
by: Lu, Yichong, et al.
Published: (2024)
by: Lu, Yichong, et al.
Published: (2024)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
by: Feng, Jie, et al.
Published: (2025)
by: Feng, Jie, et al.
Published: (2025)
Beyond a Single Light: A Large-Scale Aerial Dataset for Urban Scene Reconstruction Under Varying Illumination
by: Li, Zhuoxiao, et al.
Published: (2025)
by: Li, Zhuoxiao, et al.
Published: (2025)
Towards General Urban Monitoring with Vision-Language Models: A Review, Evaluation, and a Research Agenda
by: Torneiro, André, et al.
Published: (2025)
by: Torneiro, André, et al.
Published: (2025)
OpenCity3D: What do Vision-Language Models know about Urban Environments?
by: Bieri, Valentin, et al.
Published: (2025)
by: Bieri, Valentin, et al.
Published: (2025)
Compound Expression Recognition via Large Vision-Language Models
by: Yu, Jun, et al.
Published: (2025)
by: Yu, Jun, et al.
Published: (2025)
CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning
by: Liu, Tianhui, et al.
Published: (2025)
by: Liu, Tianhui, et al.
Published: (2025)
Similar Items
-
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
by: Zhong, Jing, et al.
Published: (2025) -
ArchShapeNet:An Interpretable 3D-CNN Framework for Evaluating Architectural Shapes
by: Yin, Jun, et al.
Published: (2025) -
Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes
by: Perez, Joan, et al.
Published: (2025) -
Boundless: Generating Photorealistic Synthetic Data for Object Detection in Urban Streetscapes
by: Turkcan, Mehmet Kerem, et al.
Published: (2024) -
Segment Any Architectural Facades (SAAF):An automatic segmentation model for building facades, walls and windows based on multimodal semantics guidance
by: Li, Peilin, et al.
Published: (2025)