UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Jun, Lin, Yi, Huang, Zilong, Yin, Jiacong, Ye, Junyan, Zhou, Yuchuan, Li, Weijia, Zhang, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration
di: Huang, Zilong, et al.
Pubblicazione: (2025)
di: Huang, Zilong, et al.
Pubblicazione: (2025)
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
di: Huang, Zilong, et al.
Pubblicazione: (2025)
di: Huang, Zilong, et al.
Pubblicazione: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
di: Zhou, Baichuan, et al.
Pubblicazione: (2024)
di: Zhou, Baichuan, et al.
Pubblicazione: (2024)
BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
di: Ye, Junyan, et al.
Pubblicazione: (2025)
di: Ye, Junyan, et al.
Pubblicazione: (2025)
The Less Meaningful the Understanding, the Faster the Feeling: Speech Comprehension Changes Perceptual Speech Tempo
di: Liangjie Chen, et al.
Pubblicazione: (2025)
di: Liangjie Chen, et al.
Pubblicazione: (2025)
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
di: Ye, Junyan, et al.
Pubblicazione: (2024)
di: Ye, Junyan, et al.
Pubblicazione: (2024)
CrossViewDiff: A Cross-View Diffusion Model for Satellite-to-Street View Synthesis
di: Li, Weijia, et al.
Pubblicazione: (2024)
di: Li, Weijia, et al.
Pubblicazione: (2024)
GenClaw: Code-Driven Agentic Image Generation
di: Ye, Junyan, et al.
Pubblicazione: (2026)
di: Ye, Junyan, et al.
Pubblicazione: (2026)
Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
di: He, Jun, et al.
Pubblicazione: (2026)
di: He, Jun, et al.
Pubblicazione: (2026)
Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior
di: Lin, Jiaying, et al.
Pubblicazione: (2024)
di: Lin, Jiaying, et al.
Pubblicazione: (2024)
SatSAM2: Motion-Constrained Video Object Tracking in Satellite Imagery using Promptable SAM2 and Kalman Priors
di: Fan, Ruijie, et al.
Pubblicazione: (2025)
di: Fan, Ruijie, et al.
Pubblicazione: (2025)
Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis
di: Ye, Junyan, et al.
Pubblicazione: (2024)
di: Ye, Junyan, et al.
Pubblicazione: (2024)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
di: Gao, Tianyi, et al.
Pubblicazione: (2025)
di: Gao, Tianyi, et al.
Pubblicazione: (2025)
Analog or Digital In-memory Computing? Benchmarking through Quantitative Modeling
di: Sun, Jiacong, et al.
Pubblicazione: (2024)
di: Sun, Jiacong, et al.
Pubblicazione: (2024)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
di: Shen, Lingdong, et al.
Pubblicazione: (2024)
di: Shen, Lingdong, et al.
Pubblicazione: (2024)
FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection
di: Zhu, Leqi, et al.
Pubblicazione: (2026)
di: Zhu, Leqi, et al.
Pubblicazione: (2026)
3D Question Answering for City Scene Understanding
di: Sun, Penglei, et al.
Pubblicazione: (2024)
di: Sun, Penglei, et al.
Pubblicazione: (2024)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
di: Fu, Yuchuan, et al.
Pubblicazione: (2025)
di: Fu, Yuchuan, et al.
Pubblicazione: (2025)
TrueCity: Real and Simulated Urban Data for Cross-Domain 3D Scene Understanding
di: Nguyen, Duc, et al.
Pubblicazione: (2025)
di: Nguyen, Duc, et al.
Pubblicazione: (2025)
ManiFeel: Benchmarking and Understanding Visuotactile Manipulation Policy Learning
di: Luu, Quan Khanh, et al.
Pubblicazione: (2025)
di: Luu, Quan Khanh, et al.
Pubblicazione: (2025)
LibCity: A Unified Library Towards Efficient and Comprehensive Urban Spatial-Temporal Prediction
di: Jiang, Jiawei, et al.
Pubblicazione: (2023)
di: Jiang, Jiawei, et al.
Pubblicazione: (2023)
SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia
di: Yue, Pengfei, et al.
Pubblicazione: (2026)
di: Yue, Pengfei, et al.
Pubblicazione: (2026)
SCTc-TE: A Comprehensive Formulation and Benchmark for Temporal Event Forecasting
di: Ma, Yunshan, et al.
Pubblicazione: (2023)
di: Ma, Yunshan, et al.
Pubblicazione: (2023)
Bharat Scene Text: A Novel Comprehensive Dataset and Benchmark for Indian Language Scene Text Understanding
di: De, Anik, et al.
Pubblicazione: (2025)
di: De, Anik, et al.
Pubblicazione: (2025)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
di: Ye, Junyan, et al.
Pubblicazione: (2025)
di: Ye, Junyan, et al.
Pubblicazione: (2025)
IntentGrasp: A Comprehensive Benchmark for Intent Understanding
di: Yin, Yuwei, et al.
Pubblicazione: (2026)
di: Yin, Yuwei, et al.
Pubblicazione: (2026)
Perceptual-GS: Scene-adaptive Perceptual Densification for Gaussian Splatting
di: Zhou, Hongbi, et al.
Pubblicazione: (2025)
di: Zhou, Hongbi, et al.
Pubblicazione: (2025)
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
di: Ye, Junyan, et al.
Pubblicazione: (2025)
di: Ye, Junyan, et al.
Pubblicazione: (2025)
Understanding Audiovisual Deepfake Detection: Techniques, Challenges, Human Factors and Perceptual Insights
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
Reference-based Controllable Scene Stylization with Gaussian Splatting
di: Mei, Yiqun, et al.
Pubblicazione: (2024)
di: Mei, Yiqun, et al.
Pubblicazione: (2024)
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
di: Shi, Shuyao, et al.
Pubblicazione: (2026)
di: Shi, Shuyao, et al.
Pubblicazione: (2026)
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
di: Zhao, Youjun, et al.
Pubblicazione: (2024)
di: Zhao, Youjun, et al.
Pubblicazione: (2024)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model
di: Li, Sijing, et al.
Pubblicazione: (2025)
di: Li, Sijing, et al.
Pubblicazione: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
In-Place Panoptic Radiance Field Segmentation with Perceptual Prior for 3D Scene Understanding
di: Li, Shenghao
Pubblicazione: (2024)
di: Li, Shenghao
Pubblicazione: (2024)
Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene Understanding
di: Zheng, Hongpei, et al.
Pubblicazione: (2025)
di: Zheng, Hongpei, et al.
Pubblicazione: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration
di: Huang, Zilong, et al.
Pubblicazione: (2025) -
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025) -
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
di: Huang, Zilong, et al.
Pubblicazione: (2025) -
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
di: Zhou, Baichuan, et al.
Pubblicazione: (2024) -
BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
di: Ye, Junyan, et al.
Pubblicazione: (2025)