Enregistré dans:
| Auteurs principaux: | Zhang, Jie, Yu, Xingtong, Fang, Yuan, Stouffs, Rudi, Trivic, Zdravko |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.08342 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Pixels to Predicates Structuring urban perception with scene graphs
par: Liu, Yunlong, et autres
Publié: (2025)
par: Liu, Yunlong, et autres
Publié: (2025)
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
par: Chen, Jiabin, et autres
Publié: (2025)
par: Chen, Jiabin, et autres
Publié: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
par: Feng, Jie, et autres
Publié: (2025)
par: Feng, Jie, et autres
Publié: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
par: Zhou, Baichuan, et autres
Publié: (2024)
par: Zhou, Baichuan, et autres
Publié: (2024)
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
par: Wen, Zhihao, et autres
Publié: (2025)
par: Wen, Zhihao, et autres
Publié: (2025)
Fine-Grained Urban Flow Inference with Multi-scale Representation Learning
par: Yuan, Shilu, et autres
Publié: (2024)
par: Yuan, Shilu, et autres
Publié: (2024)
WalkCLIP: Multimodal Learning for Urban Walkability Prediction
par: Xiang, Shilong, et autres
Publié: (2025)
par: Xiang, Shilong, et autres
Publié: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
par: Ye, Guanting, et autres
Publié: (2026)
par: Ye, Guanting, et autres
Publié: (2026)
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
par: Gu, Tiancheng, et autres
Publié: (2025)
par: Gu, Tiancheng, et autres
Publié: (2025)
FLAME: Learning to Navigate with Multimodal LLM in Urban Environments
par: Xu, Yunzhe, et autres
Publié: (2024)
par: Xu, Yunzhe, et autres
Publié: (2024)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
par: Shiri, Fatemeh, et autres
Publié: (2024)
par: Shiri, Fatemeh, et autres
Publié: (2024)
PixelBytes: Catching Unified Embedding for Multimodal Generation
par: Furfaro, Fabien
Publié: (2024)
par: Furfaro, Fabien
Publié: (2024)
AUG: A New Dataset and An Efficient Model for Aerial Image Urban Scene Graph Generation
par: Li, Yansheng, et autres
Publié: (2024)
par: Li, Yansheng, et autres
Publié: (2024)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
par: Giahi, Ramin, et autres
Publié: (2025)
par: Giahi, Ramin, et autres
Publié: (2025)
UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models
par: Yin, Jun, et autres
Publié: (2025)
par: Yin, Jun, et autres
Publié: (2025)
Algorithm Research of ELMo Word Embedding and Deep Learning Multimodal Transformer in Image Description
par: Cheng, Xiaohan, et autres
Publié: (2024)
par: Cheng, Xiaohan, et autres
Publié: (2024)
Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models
par: Kim, Donggeun, et autres
Publié: (2024)
par: Kim, Donggeun, et autres
Publié: (2024)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
par: Wu, Wayne, et autres
Publié: (2024)
par: Wu, Wayne, et autres
Publié: (2024)
UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction
par: Hao, Xixuan, et autres
Publié: (2024)
par: Hao, Xixuan, et autres
Publié: (2024)
A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition
par: Shen, Yaomin, et autres
Publié: (2025)
par: Shen, Yaomin, et autres
Publié: (2025)
Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration
par: Zhou, Yue, et autres
Publié: (2025)
par: Zhou, Yue, et autres
Publié: (2025)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
par: Liu, Mingxuan, et autres
Publié: (2025)
par: Liu, Mingxuan, et autres
Publié: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
par: Xu, Haotian, et autres
Publié: (2026)
par: Xu, Haotian, et autres
Publié: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
par: Jiang, Wen, et autres
Publié: (2026)
par: Jiang, Wen, et autres
Publié: (2026)
Spatial-Temporal Deep Embedding for Vehicle Trajectory Reconstruction from High-Angle Video
par: D., Tianya T. Zhang Ph., et autres
Publié: (2022)
par: D., Tianya T. Zhang Ph., et autres
Publié: (2022)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
par: He, Lixuan, et autres
Publié: (2025)
par: He, Lixuan, et autres
Publié: (2025)
SE-VGAE: Unsupervised Disentangled Representation Learning for Interpretable Architectural Layout Design Graph Generation
par: Chen, Jielin, et autres
Publié: (2024)
par: Chen, Jielin, et autres
Publié: (2024)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
par: Mushkani, Rashid
Publié: (2025)
par: Mushkani, Rashid
Publié: (2025)
Modular Embedding Recomposition for Incremental Learning
par: Panariello, Aniello, et autres
Publié: (2025)
par: Panariello, Aniello, et autres
Publié: (2025)
REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing
par: Xu, Weihan, et autres
Publié: (2025)
par: Xu, Weihan, et autres
Publié: (2025)
AdaEmbed: Semi-supervised Domain Adaptation in the Embedding Space
par: Mottaghi, Ali, et autres
Publié: (2024)
par: Mottaghi, Ali, et autres
Publié: (2024)
SENSE: Self-Supervised Neural Embeddings for Spatial Ensembles
par: Gadirov, Hamid, et autres
Publié: (2025)
par: Gadirov, Hamid, et autres
Publié: (2025)
Learning Robust Intervention Representations with Delta Embeddings
par: Alimisis, Panagiotis, et autres
Publié: (2025)
par: Alimisis, Panagiotis, et autres
Publié: (2025)
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
par: Zeng, Kang, et autres
Publié: (2025)
par: Zeng, Kang, et autres
Publié: (2025)
GERA: Geometric Embedding for Efficient Point Registration Analysis
par: Li, Geng, et autres
Publié: (2024)
par: Li, Geng, et autres
Publié: (2024)
MOON Embedding: Multimodal Representation Learning for E-commerce Search Advertising
par: Fu, Chenghan, et autres
Publié: (2025)
par: Fu, Chenghan, et autres
Publié: (2025)
Unsupervised Document and Template Clustering using Multimodal Embeddings
par: Sampaio, Phillipe R., et autres
Publié: (2025)
par: Sampaio, Phillipe R., et autres
Publié: (2025)
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
par: Zhou, Fangshuo, et autres
Publié: (2024)
par: Zhou, Fangshuo, et autres
Publié: (2024)
Documents similaires
-
From Pixels to Predicates Structuring urban perception with scene graphs
par: Liu, Yunlong, et autres
Publié: (2025) -
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
par: Chen, Jiabin, et autres
Publié: (2025) -
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
par: Feng, Jie, et autres
Publié: (2025) -
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
par: Zhou, Baichuan, et autres
Publié: (2024) -
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
par: Wen, Zhihao, et autres
Publié: (2025)