UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Jun, Zhong, Jing, Li, Peilin, Pan, Ruolin, Zeng, Pengyu, Zhang, Miao, Lu, Shuai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
por: Zhong, Jing, et al.
Publicado: (2025)
por: Zhong, Jing, et al.
Publicado: (2025)
ArchShapeNet:An Interpretable 3D-CNN Framework for Evaluating Architectural Shapes
por: Yin, Jun, et al.
Publicado: (2025)
por: Yin, Jun, et al.
Publicado: (2025)
Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes
por: Perez, Joan, et al.
Publicado: (2025)
por: Perez, Joan, et al.
Publicado: (2025)
Boundless: Generating Photorealistic Synthetic Data for Object Detection in Urban Streetscapes
por: Turkcan, Mehmet Kerem, et al.
Publicado: (2024)
por: Turkcan, Mehmet Kerem, et al.
Publicado: (2024)
Segment Any Architectural Facades (SAAF):An automatic segmentation model for building facades, walls and windows based on multimodal semantics guidance
por: Li, Peilin, et al.
Publicado: (2025)
por: Li, Peilin, et al.
Publicado: (2025)
TSCnet: A Text-driven Semantic-level Controllable Framework for Customized Low-Light Image Enhancement
por: Zhang, Miao, et al.
Publicado: (2025)
por: Zhang, Miao, et al.
Publicado: (2025)
The Streetscape Application Services Stack (SASS): Towards a Distributed Sensing Architecture for Urban Applications
por: Pargoo, Navid Salami, et al.
Publicado: (2024)
por: Pargoo, Navid Salami, et al.
Publicado: (2024)
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery
por: Chen, Pengyu, et al.
Publicado: (2025)
por: Chen, Pengyu, et al.
Publicado: (2025)
First-place Solution for Streetscape Shop Sign Recognition Competition
por: Wang, Bin, et al.
Publicado: (2025)
por: Wang, Bin, et al.
Publicado: (2025)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
por: Hao, Xixuan, et al.
Publicado: (2024)
por: Hao, Xixuan, et al.
Publicado: (2024)
PromptLNet: Region-Adaptive Aesthetic Enhancement via Prompt Guidance in Low-Light Enhancement Net
por: Yin, Jun, et al.
Publicado: (2025)
por: Yin, Jun, et al.
Publicado: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
por: Mushkani, Rashid
Publicado: (2025)
por: Mushkani, Rashid
Publicado: (2025)
Streetscapes: Large-scale Consistent Street View Generation Using Autoregressive Video Diffusion
por: Deng, Boyang, et al.
Publicado: (2024)
por: Deng, Boyang, et al.
Publicado: (2024)
OpenUrban3D: Annotation-Free Open-Vocabulary Semantic Segmentation of Large-Scale Urban Point Clouds
por: Wang, Chongyu, et al.
Publicado: (2025)
por: Wang, Chongyu, et al.
Publicado: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
por: Xu, Haotian, et al.
Publicado: (2026)
por: Xu, Haotian, et al.
Publicado: (2026)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
por: Zhao, Baining, et al.
Publicado: (2025)
por: Zhao, Baining, et al.
Publicado: (2025)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
por: Huo, Fushuo, et al.
Publicado: (2024)
por: Huo, Fushuo, et al.
Publicado: (2024)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
por: Mei, Yanghong, et al.
Publicado: (2025)
por: Mei, Yanghong, et al.
Publicado: (2025)
Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China
por: Wu, Menglin, et al.
Publicado: (2026)
por: Wu, Menglin, et al.
Publicado: (2026)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
por: Wang, Yu, et al.
Publicado: (2026)
por: Wang, Yu, et al.
Publicado: (2026)
TEFormer: Texture-Aware and Edge-Guided Transformer for Semantic Segmentation of Urban Remote Sensing Images
por: Zhou, Guoyu, et al.
Publicado: (2025)
por: Zhou, Guoyu, et al.
Publicado: (2025)
Mitigating Urban-Rural Disparities in Contrastive Representation Learning with Satellite Imagery
por: Zhang, Miao, et al.
Publicado: (2022)
por: Zhang, Miao, et al.
Publicado: (2022)
Urban Architect: Steerable 3D Urban Scene Generation with Layout Prior
por: Lu, Fan, et al.
Publicado: (2024)
por: Lu, Fan, et al.
Publicado: (2024)
UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video
por: Lin, Chih-Hao, et al.
Publicado: (2023)
por: Lin, Chih-Hao, et al.
Publicado: (2023)
Multi-scale Semantic Prior Features Guided Deep Neural Network for Urban Street-view Image
por: Zeng, Jianshun, et al.
Publicado: (2024)
por: Zeng, Jianshun, et al.
Publicado: (2024)
Comprehensive Dataset for Urban Streetlight Analysis
por: S, Eliza Femi Sherley, et al.
Publicado: (2024)
por: S, Eliza Femi Sherley, et al.
Publicado: (2024)
UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors
por: Wang, Tianhang, et al.
Publicado: (2025)
por: Wang, Tianhang, et al.
Publicado: (2025)
Efficient Depth-Guided Urban View Synthesis
por: Miao, Sheng, et al.
Publicado: (2024)
por: Miao, Sheng, et al.
Publicado: (2024)
From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models
por: Fan, Zicheng, et al.
Publicado: (2025)
por: Fan, Zicheng, et al.
Publicado: (2025)
Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
por: Zhou, Wentao, et al.
Publicado: (2025)
por: Zhou, Wentao, et al.
Publicado: (2025)
VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
por: Pang, Chao, et al.
Publicado: (2024)
por: Pang, Chao, et al.
Publicado: (2024)
WS-DETR: Robust Water Surface Object Detection through Vision-Radar Fusion with Detection Transformer
por: Yin, Huilin, et al.
Publicado: (2025)
por: Yin, Huilin, et al.
Publicado: (2025)
UrbanCAD: Towards Highly Controllable and Photorealistic 3D Vehicles for Urban Scene Simulation
por: Lu, Yichong, et al.
Publicado: (2024)
por: Lu, Yichong, et al.
Publicado: (2024)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025)
por: Feng, Jie, et al.
Publicado: (2025)
Beyond a Single Light: A Large-Scale Aerial Dataset for Urban Scene Reconstruction Under Varying Illumination
por: Li, Zhuoxiao, et al.
Publicado: (2025)
por: Li, Zhuoxiao, et al.
Publicado: (2025)
Towards General Urban Monitoring with Vision-Language Models: A Review, Evaluation, and a Research Agenda
por: Torneiro, André, et al.
Publicado: (2025)
por: Torneiro, André, et al.
Publicado: (2025)
OpenCity3D: What do Vision-Language Models know about Urban Environments?
por: Bieri, Valentin, et al.
Publicado: (2025)
por: Bieri, Valentin, et al.
Publicado: (2025)
Compound Expression Recognition via Large Vision-Language Models
por: Yu, Jun, et al.
Publicado: (2025)
por: Yu, Jun, et al.
Publicado: (2025)
CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning
por: Liu, Tianhui, et al.
Publicado: (2025)
por: Liu, Tianhui, et al.
Publicado: (2025)
Ejemplares similares
-
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
por: Zhong, Jing, et al.
Publicado: (2025) -
ArchShapeNet:An Interpretable 3D-CNN Framework for Evaluating Architectural Shapes
por: Yin, Jun, et al.
Publicado: (2025) -
Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes
por: Perez, Joan, et al.
Publicado: (2025) -
Boundless: Generating Photorealistic Synthetic Data for Object Detection in Urban Streetscapes
por: Turkcan, Mehmet Kerem, et al.
Publicado: (2024) -
Segment Any Architectural Facades (SAAF):An automatic segmentation model for building facades, walls and windows based on multimodal semantics guidance
por: Li, Peilin, et al.
Publicado: (2025)