UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Baining, Fang, Jianjie, Dai, Zichao, Wang, Ziyou, Zha, Jirong, Zhang, Weichen, Gao, Chen, Wang, Yue, Cui, Jinqiang, Chen, Xinlei, Li, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
di: Gao, Chen, et al.
Pubblicazione: (2024)
di: Gao, Chen, et al.
Pubblicazione: (2024)
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
di: Fang, Jianjie, et al.
Pubblicazione: (2026)
di: Fang, Jianjie, et al.
Pubblicazione: (2026)
AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning
di: Zha, Jirong, et al.
Pubblicazione: (2025)
di: Zha, Jirong, et al.
Pubblicazione: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing Agents
di: Man, Fanhang, et al.
Pubblicazione: (2025)
di: Man, Fanhang, et al.
Pubblicazione: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
di: Xu, Haotian, et al.
Pubblicazione: (2026)
di: Xu, Haotian, et al.
Pubblicazione: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
di: Li, Jiaao, et al.
Pubblicazione: (2025)
di: Li, Jiaao, et al.
Pubblicazione: (2025)
Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
di: Liu, Xinhao, et al.
Pubblicazione: (2024)
di: Liu, Xinhao, et al.
Pubblicazione: (2024)
AirScape: An Aerial Generative World Model with Motion Controllability
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM
di: Zha, Jirong, et al.
Pubblicazione: (2025)
di: Zha, Jirong, et al.
Pubblicazione: (2025)
FCMBench-Video: Benchmarking Document Video Intelligence
di: Cui, Runze, et al.
Pubblicazione: (2026)
di: Cui, Runze, et al.
Pubblicazione: (2026)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
di: Lin, Jingli, et al.
Pubblicazione: (2025)
di: Lin, Jingli, et al.
Pubblicazione: (2025)
DIMM: Decoupled Multi-hierarchy Kalman Filter for 3D Object Tracking
di: Zha, Jirong, et al.
Pubblicazione: (2025)
di: Zha, Jirong, et al.
Pubblicazione: (2025)
UrbanIR: Large-Scale Urban Scene Inverse Rendering from a Single Video
di: Lin, Chih-Hao, et al.
Pubblicazione: (2023)
di: Lin, Chih-Hao, et al.
Pubblicazione: (2023)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
di: Wu, Wayne, et al.
Pubblicazione: (2024)
di: Wu, Wayne, et al.
Pubblicazione: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Multimodal Contrastive Learning of Urban Space Representations from POI Data
di: Wang, Xinglei, et al.
Pubblicazione: (2024)
di: Wang, Xinglei, et al.
Pubblicazione: (2024)
EmbodiedPlace: Learning Mixture-of-Features with Embodied Constraints for Visual Place Recognition
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
di: Liu, Bingxi, et al.
Pubblicazione: (2025)
IP-Bench: Benchmark for Image Protection Methods in Image-to-Video Generation Scenarios
di: Li, Xiaofeng, et al.
Pubblicazione: (2026)
di: Li, Xiaofeng, et al.
Pubblicazione: (2026)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
di: Feng, Weixi, et al.
Pubblicazione: (2024)
di: Feng, Weixi, et al.
Pubblicazione: (2024)
Extrapolated Urban View Synthesis Benchmark
di: Han, Xiangyu, et al.
Pubblicazione: (2024)
di: Han, Xiangyu, et al.
Pubblicazione: (2024)
VideoMarkBench: Benchmarking Robustness of Video Watermarking
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
di: Jiang, Zhengyuan, et al.
Pubblicazione: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
di: Li, Anqi, et al.
Pubblicazione: (2025)
di: Li, Anqi, et al.
Pubblicazione: (2025)
Learning Video Representations without Natural Videos
di: Yu, Xueyang, et al.
Pubblicazione: (2024)
di: Yu, Xueyang, et al.
Pubblicazione: (2024)
Video-Bench: Human-Aligned Video Generation Benchmark
di: Han, Hui, et al.
Pubblicazione: (2025)
di: Han, Hui, et al.
Pubblicazione: (2025)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
di: Liu, Xuannan, et al.
Pubblicazione: (2025)
di: Liu, Xuannan, et al.
Pubblicazione: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
di: Liu, Mingxuan, et al.
Pubblicazione: (2025)
di: Liu, Mingxuan, et al.
Pubblicazione: (2025)
CleanUpBench: Embodied Sweeping and Grasping Benchmark
di: Li, Wenbo, et al.
Pubblicazione: (2025)
di: Li, Wenbo, et al.
Pubblicazione: (2025)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
di: Zhao, Baining, et al.
Pubblicazione: (2025) -
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
di: Zhao, Baining, et al.
Pubblicazione: (2026) -
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
di: Gao, Chen, et al.
Pubblicazione: (2024) -
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
di: Fang, Jianjie, et al.
Pubblicazione: (2026) -
AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning
di: Zha, Jirong, et al.
Pubblicazione: (2025)