CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Haotian, Hu, Yue, Zhu, Zhengqiu, Gao, Chen, Wang, Ziyou, Rao, Junreng, Lu, Wenhao, Li, Weishi, Yin, Quanjun, Li, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GeoNav: Empowering MLLMs with dual-scale geospatial reasoning for language-goal aerial navigation
di: Xu, Haotian, et al.
Pubblicazione: (2025)
di: Xu, Haotian, et al.
Pubblicazione: (2025)
Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology
di: Ji, Yatai, et al.
Pubblicazione: (2025)
di: Ji, Yatai, et al.
Pubblicazione: (2025)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space
di: Zhao, Yong, et al.
Pubblicazione: (2025)
di: Zhao, Yong, et al.
Pubblicazione: (2025)
Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution
di: Liu, Beidan, et al.
Pubblicazione: (2025)
di: Liu, Beidan, et al.
Pubblicazione: (2025)
NL2GenSym: Natural Language to Generative Symbolic Rules for SOAR Cognitive Architecture via Large Language Models
di: Yuan, Fang, et al.
Pubblicazione: (2025)
di: Yuan, Fang, et al.
Pubblicazione: (2025)
Fusing Urban Structure and Semantics: A Conditional Diffusion Model for Cross-City OD Matrix Generation
di: Chen, Bin, et al.
Pubblicazione: (2026)
di: Chen, Bin, et al.
Pubblicazione: (2026)
Psychology-driven LLM Agents for Explainable Panic Prediction on Social Media during Sudden Disaster Events
di: Liu, Mengzhu, et al.
Pubblicazione: (2025)
di: Liu, Mengzhu, et al.
Pubblicazione: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
Heterogeneous Graph Reinforcement Learning for Dependency-aware Multi-task Allocation in Spatial Crowdsourcing
di: Zhao, Yong, et al.
Pubblicazione: (2024)
di: Zhao, Yong, et al.
Pubblicazione: (2024)
Conversational Crowdsensing: A Parallel Intelligence Powered Novel Sensing Approach
di: Zhu, Zhengqiu, et al.
Pubblicazione: (2024)
di: Zhu, Zhengqiu, et al.
Pubblicazione: (2024)
DLW-CI: A Dynamic Likelihood-Weighted Cooperative Infotaxis Approach for Multi-Source Search in Urban Environments Using Consumer Drone Networks
di: Zhang, Xiaoran, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoran, et al.
Pubblicazione: (2025)
CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning
di: Liu, Tianhui, et al.
Pubblicazione: (2025)
di: Liu, Tianhui, et al.
Pubblicazione: (2025)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
Clash of the Titans: ultra-high energy KM3NeT event versus IceCube data
di: Li, Shirley Weishi, et al.
Pubblicazione: (2025)
di: Li, Shirley Weishi, et al.
Pubblicazione: (2025)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
di: Gao, Chen, et al.
Pubblicazione: (2024)
di: Gao, Chen, et al.
Pubblicazione: (2024)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
di: Zhang, Jiahuan, et al.
Pubblicazione: (2025)
di: Zhang, Jiahuan, et al.
Pubblicazione: (2025)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments
di: Li, Tianshun, et al.
Pubblicazione: (2025)
di: Li, Tianshun, et al.
Pubblicazione: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
di: He, Lixuan, et al.
Pubblicazione: (2025)
di: He, Lixuan, et al.
Pubblicazione: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
di: Feng, Jie, et al.
Pubblicazione: (2025)
di: Feng, Jie, et al.
Pubblicazione: (2025)
CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing
di: Liu, Tianhui, et al.
Pubblicazione: (2025)
di: Liu, Tianhui, et al.
Pubblicazione: (2025)
A Multi-Agent Reinforcement Learning Approach for Cooperative Air-Ground-Human Crowdsensing in Emergency Rescue
di: Lu, Wenhao, et al.
Pubblicazione: (2025)
di: Lu, Wenhao, et al.
Pubblicazione: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
di: Huang, Xinmiao, et al.
Pubblicazione: (2025)
di: Huang, Xinmiao, et al.
Pubblicazione: (2025)
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation
di: Liu, Ting, et al.
Pubblicazione: (2023)
di: Liu, Ting, et al.
Pubblicazione: (2023)
CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark
di: Wang, Wei, et al.
Pubblicazione: (2026)
di: Wang, Wei, et al.
Pubblicazione: (2026)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
di: Zhao, Yanpeng, et al.
Pubblicazione: (2026)
di: Zhao, Yanpeng, et al.
Pubblicazione: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
di: Jiang, Wen, et al.
Pubblicazione: (2026)
di: Jiang, Wen, et al.
Pubblicazione: (2026)
Chinese Digital Economy and Urban Green Innovation Quality and Efficiency: The Threshold Effect Analysis Based on Chinese Cities Agglomeration
di: Li Yue, et al.
Pubblicazione: (2025)
di: Li Yue, et al.
Pubblicazione: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
UrbanWorld: An Urban World Model for 3D City Generation
di: Shang, Yu, et al.
Pubblicazione: (2024)
di: Shang, Yu, et al.
Pubblicazione: (2024)
Self-test loss functions for learning weak-form operators and gradient flows
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
MMCR: Benchmarking Cross-Source Reasoning in Scientific Papers
di: Tian, Yang, et al.
Pubblicazione: (2025)
di: Tian, Yang, et al.
Pubblicazione: (2025)
Expanding the Action Space of LLMs to Reason Beyond Language
di: Yue, Zhongqi, et al.
Pubblicazione: (2025)
di: Yue, Zhongqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GeoNav: Empowering MLLMs with dual-scale geospatial reasoning for language-goal aerial navigation
di: Xu, Haotian, et al.
Pubblicazione: (2025) -
Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology
di: Ji, Yatai, et al.
Pubblicazione: (2025) -
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025) -
CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space
di: Zhao, Yong, et al.
Pubblicazione: (2025) -
Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution
di: Liu, Beidan, et al.
Pubblicazione: (2025)