Guardado en:
| Autores principales: | Zhang, Jie, Yu, Xingtong, Fang, Yuan, Stouffs, Rudi, Trivic, Zdravko |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.08342 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Pixels to Predicates Structuring urban perception with scene graphs
por: Liu, Yunlong, et al.
Publicado: (2025)
por: Liu, Yunlong, et al.
Publicado: (2025)
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
por: Chen, Jiabin, et al.
Publicado: (2025)
por: Chen, Jiabin, et al.
Publicado: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025)
por: Feng, Jie, et al.
Publicado: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
por: Wen, Zhihao, et al.
Publicado: (2025)
por: Wen, Zhihao, et al.
Publicado: (2025)
Fine-Grained Urban Flow Inference with Multi-scale Representation Learning
por: Yuan, Shilu, et al.
Publicado: (2024)
por: Yuan, Shilu, et al.
Publicado: (2024)
WalkCLIP: Multimodal Learning for Urban Walkability Prediction
por: Xiang, Shilong, et al.
Publicado: (2025)
por: Xiang, Shilong, et al.
Publicado: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
por: Zhao, Baining, et al.
Publicado: (2025)
por: Zhao, Baining, et al.
Publicado: (2025)
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
por: Ye, Guanting, et al.
Publicado: (2026)
por: Ye, Guanting, et al.
Publicado: (2026)
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
por: Gu, Tiancheng, et al.
Publicado: (2025)
por: Gu, Tiancheng, et al.
Publicado: (2025)
FLAME: Learning to Navigate with Multimodal LLM in Urban Environments
por: Xu, Yunzhe, et al.
Publicado: (2024)
por: Xu, Yunzhe, et al.
Publicado: (2024)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
por: Shiri, Fatemeh, et al.
Publicado: (2024)
por: Shiri, Fatemeh, et al.
Publicado: (2024)
PixelBytes: Catching Unified Embedding for Multimodal Generation
por: Furfaro, Fabien
Publicado: (2024)
por: Furfaro, Fabien
Publicado: (2024)
AUG: A New Dataset and An Efficient Model for Aerial Image Urban Scene Graph Generation
por: Li, Yansheng, et al.
Publicado: (2024)
por: Li, Yansheng, et al.
Publicado: (2024)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
por: Giahi, Ramin, et al.
Publicado: (2025)
por: Giahi, Ramin, et al.
Publicado: (2025)
UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models
por: Yin, Jun, et al.
Publicado: (2025)
por: Yin, Jun, et al.
Publicado: (2025)
Algorithm Research of ELMo Word Embedding and Deep Learning Multimodal Transformer in Image Description
por: Cheng, Xiaohan, et al.
Publicado: (2024)
por: Cheng, Xiaohan, et al.
Publicado: (2024)
Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models
por: Kim, Donggeun, et al.
Publicado: (2024)
por: Kim, Donggeun, et al.
Publicado: (2024)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
por: Wu, Wayne, et al.
Publicado: (2024)
por: Wu, Wayne, et al.
Publicado: (2024)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
por: Hao, Xixuan, et al.
Publicado: (2024)
por: Hao, Xixuan, et al.
Publicado: (2024)
A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition
por: Shen, Yaomin, et al.
Publicado: (2025)
por: Shen, Yaomin, et al.
Publicado: (2025)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
por: Liu, Mingxuan, et al.
Publicado: (2025)
por: Liu, Mingxuan, et al.
Publicado: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
por: Xu, Haotian, et al.
Publicado: (2026)
por: Xu, Haotian, et al.
Publicado: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
por: Jiang, Wen, et al.
Publicado: (2026)
por: Jiang, Wen, et al.
Publicado: (2026)
Spatial-Temporal Deep Embedding for Vehicle Trajectory Reconstruction from High-Angle Video
por: D., Tianya T. Zhang Ph., et al.
Publicado: (2022)
por: D., Tianya T. Zhang Ph., et al.
Publicado: (2022)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
por: He, Lixuan, et al.
Publicado: (2025)
por: He, Lixuan, et al.
Publicado: (2025)
SE-VGAE: Unsupervised Disentangled Representation Learning for Interpretable Architectural Layout Design Graph Generation
por: Chen, Jielin, et al.
Publicado: (2024)
por: Chen, Jielin, et al.
Publicado: (2024)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
por: Mushkani, Rashid
Publicado: (2025)
por: Mushkani, Rashid
Publicado: (2025)
Modular Embedding Recomposition for Incremental Learning
por: Panariello, Aniello, et al.
Publicado: (2025)
por: Panariello, Aniello, et al.
Publicado: (2025)
REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
AdaEmbed: Semi-supervised Domain Adaptation in the Embedding Space
por: Mottaghi, Ali, et al.
Publicado: (2024)
por: Mottaghi, Ali, et al.
Publicado: (2024)
SENSE: Self-Supervised Neural Embeddings for Spatial Ensembles
por: Gadirov, Hamid, et al.
Publicado: (2025)
por: Gadirov, Hamid, et al.
Publicado: (2025)
Learning Robust Intervention Representations with Delta Embeddings
por: Alimisis, Panagiotis, et al.
Publicado: (2025)
por: Alimisis, Panagiotis, et al.
Publicado: (2025)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
por: Zeng, Kang, et al.
Publicado: (2025)
por: Zeng, Kang, et al.
Publicado: (2025)
GERA: Geometric Embedding for Efficient Point Registration Analysis
por: Li, Geng, et al.
Publicado: (2024)
por: Li, Geng, et al.
Publicado: (2024)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
por: Fu, Chenghan, et al.
Publicado: (2025)
por: Fu, Chenghan, et al.
Publicado: (2025)
Unsupervised Document and Template Clustering using Multimodal Embeddings
por: Sampaio, Phillipe R., et al.
Publicado: (2025)
por: Sampaio, Phillipe R., et al.
Publicado: (2025)
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
por: Zhou, Fangshuo, et al.
Publicado: (2024)
por: Zhou, Fangshuo, et al.
Publicado: (2024)
Ejemplares similares
-
From Pixels to Predicates Structuring urban perception with scene graphs
por: Liu, Yunlong, et al.
Publicado: (2025) -
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
por: Chen, Jiabin, et al.
Publicado: (2025) -
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025) -
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
por: Zhou, Baichuan, et al.
Publicado: (2024) -
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
por: Wen, Zhihao, et al.
Publicado: (2025)