Enregistré dans:
| Auteurs principaux: | Zhang, Jiaxin, Li, Yunqin, Fukuda, Tomohiro, Wang, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.19719 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks
par: Zhang, Jiaxin, et autres
Publié: (2025)
par: Zhang, Jiaxin, et autres
Publié: (2025)
BuildingView: Constructing Urban Building Exteriors Databases with Street View Imagery and Multimodal Large Language Mode
par: Li, Zongrong, et autres
Publié: (2024)
par: Li, Zongrong, et autres
Publié: (2024)
Modeling Urban Food Insecurity with Google Street View Images
par: Li, David
Publié: (2025)
par: Li, David
Publié: (2025)
Interpretable Multimodal Framework for Human-Centered Street Assessment: Integrating Visual-Language Models for Perceptual Urban Diagnostics
par: Lan, HaoTian
Publié: (2025)
par: Lan, HaoTian
Publié: (2025)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
par: Wang, Ziyue, et autres
Publié: (2024)
par: Wang, Ziyue, et autres
Publié: (2024)
UrbanVGGT: Scalable Sidewalk Width Estimation from Street View Images
par: Tan, Kaizhen, et autres
Publié: (2026)
par: Tan, Kaizhen, et autres
Publié: (2026)
From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models
par: Fan, Zicheng, et autres
Publié: (2025)
par: Fan, Zicheng, et autres
Publié: (2025)
Benchmarking Attention Mechanisms and Consistency Regularization Semi-Supervised Learning for Post-Flood Building Damage Assessment in Satellite Images
par: Yu, Jiaxi, et autres
Publié: (2024)
par: Yu, Jiaxi, et autres
Publié: (2024)
CityPulse: Fine-Grained Assessment of Urban Change with Street View Time Series
par: Huang, Tianyuan, et autres
Publié: (2024)
par: Huang, Tianyuan, et autres
Publié: (2024)
Eyes on the Streets: Leveraging Street-Level Imaging to Model Urban Crime Dynamics
par: Qi, Zhixuan, et autres
Publié: (2024)
par: Qi, Zhixuan, et autres
Publié: (2024)
An Integrated Causal Inference Framework for Traffic Safety Modeling with Semantic Street-View Visual Features
par: Sun, Lishan, et autres
Publié: (2026)
par: Sun, Lishan, et autres
Publié: (2026)
Safety of Multimodal Large Language Models on Images and Texts
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
Seeing through Satellite Images at Street Views
par: Qian, Ming, et autres
Publié: (2025)
par: Qian, Ming, et autres
Publié: (2025)
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Semantic4Safety: Causal Insights from Zero-shot Street View Imagery Segmentation for Urban Road Safety
par: Chen, Huan, et autres
Publié: (2025)
par: Chen, Huan, et autres
Publié: (2025)
DamageArbiter: A CLIP-Enhanced Multimodal Arbitration Framework for Hurricane Damage Assessment from Street-View Imagery
par: Yang, Yifan, et autres
Publié: (2026)
par: Yang, Yifan, et autres
Publié: (2026)
StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models
par: Yan, Yunzhi, et autres
Publié: (2024)
par: Yan, Yunzhi, et autres
Publié: (2024)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
par: Wu, Sijing, et autres
Publié: (2026)
par: Wu, Sijing, et autres
Publié: (2026)
MMaDA: Multimodal Large Diffusion Language Models
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
StreetSurfGS: Scalable Urban Street Surface Reconstruction with Planar-based Gaussian Splatting
par: Cui, Xiao, et autres
Publié: (2024)
par: Cui, Xiao, et autres
Publié: (2024)
StreetView-Waste: A Multi-Task Dataset for Urban Waste Management
par: Paulo, Diogo J., et autres
Publié: (2025)
par: Paulo, Diogo J., et autres
Publié: (2025)
Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery
par: Yao, Siyuan, et autres
Publié: (2026)
par: Yao, Siyuan, et autres
Publié: (2026)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
par: Shi, Zhelun, et autres
Publié: (2024)
par: Shi, Zhelun, et autres
Publié: (2024)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
par: Wu, Tianhe, et autres
Publié: (2024)
par: Wu, Tianhe, et autres
Publié: (2024)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
par: Liu, Youzhi, et autres
Publié: (2024)
par: Liu, Youzhi, et autres
Publié: (2024)
ZenSVI: An Open-Source Software for the Integrated Acquisition, Processing and Analysis of Street View Imagery Towards Scalable Urban Science
par: Ito, Koichi, et autres
Publié: (2024)
par: Ito, Koichi, et autres
Publié: (2024)
Street-View Image Generation from a Bird's-Eye View Layout
par: Swerdlow, Alexander, et autres
Publié: (2023)
par: Swerdlow, Alexander, et autres
Publié: (2023)
FaceInsight: A Multimodal Large Language Model for Face Perception
par: Li, Jingzhi, et autres
Publié: (2025)
par: Li, Jingzhi, et autres
Publié: (2025)
Examining the Commitments and Difficulties Inherent in Multimodal Foundation Models for Street View Imagery
par: Yang, Zhenyuan, et autres
Publié: (2024)
par: Yang, Zhenyuan, et autres
Publié: (2024)
CrossViewDiff: A Cross-View Diffusion Model for Satellite-to-Street View Synthesis
par: Li, Weijia, et autres
Publié: (2024)
par: Li, Weijia, et autres
Publié: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Diffusion Models
par: Zhu, Ruishu, et autres
Publié: (2025)
par: Zhu, Ruishu, et autres
Publié: (2025)
SVIA: A Street View Image Anonymization Framework for Self-Driving Applications
par: Liu, Dongyu, et autres
Publié: (2025)
par: Liu, Dongyu, et autres
Publié: (2025)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
par: Li, Ling, et autres
Publié: (2024)
par: Li, Ling, et autres
Publié: (2024)
Diagnosing Urban Street Vitality via a Visual-Semantic and Spatiotemporal Framework for Street-Level Economics
par: Zhuo, Xinxin, et autres
Publié: (2026)
par: Zhuo, Xinxin, et autres
Publié: (2026)
DiffPlace: Street View Generation via Place-Controllable Diffusion Model Enhancing Place Recognition
par: Li, Ji, et autres
Publié: (2026)
par: Li, Ji, et autres
Publié: (2026)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
par: Chen, Zheng, et autres
Publié: (2024)
par: Chen, Zheng, et autres
Publié: (2024)
Fine-Grained Building Function Recognition from Street-View Images via Geometry-Aware Semi-Supervised Learning
par: Li, Weijia, et autres
Publié: (2024)
par: Li, Weijia, et autres
Publié: (2024)
Efficient Depth-Guided Urban View Synthesis
par: Miao, Sheng, et autres
Publié: (2024)
par: Miao, Sheng, et autres
Publié: (2024)
Documents similaires
-
Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks
par: Zhang, Jiaxin, et autres
Publié: (2025) -
BuildingView: Constructing Urban Building Exteriors Databases with Street View Imagery and Multimodal Large Language Mode
par: Li, Zongrong, et autres
Publié: (2024) -
Modeling Urban Food Insecurity with Google Street View Images
par: Li, David
Publié: (2025) -
Interpretable Multimodal Framework for Human-Centered Street Assessment: Integrating Visual-Language Models for Perceptual Urban Diagnostics
par: Lan, HaoTian
Publié: (2025) -
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
par: Wang, Ziyue, et autres
Publié: (2024)