DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Xuan, Weihao, Wang, Junjue, Qi, Heli, Chen, Zihang, Zheng, Zhuo, Zhong, Yanfei, Xia, Junshi, Yokoya, Naoto |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
por: Wang, Junjue, et al.
Publicado: (2026)
por: Wang, Junjue, et al.
Publicado: (2026)
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
por: Tsujimoto, Mai, et al.
Publicado: (2025)
por: Tsujimoto, Mai, et al.
Publicado: (2025)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
por: Wang, Junjue, et al.
Publicado: (2025)
por: Wang, Junjue, et al.
Publicado: (2025)
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
por: Song, Jian, et al.
Publicado: (2024)
por: Song, Jian, et al.
Publicado: (2024)
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026)
por: Liu, Quan, et al.
Publicado: (2026)
SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding
por: Wei, Yimin, et al.
Publicado: (2025)
por: Wei, Yimin, et al.
Publicado: (2025)
Segment Anything with Multiple Modalities
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations
por: Wang, Junjue, et al.
Publicado: (2026)
por: Wang, Junjue, et al.
Publicado: (2026)
MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
por: Wei, Yimin, et al.
Publicado: (2026)
por: Wei, Yimin, et al.
Publicado: (2026)
Unsupervised Domain Adaptation Architecture Search with Self-Training for Land Cover Mapping
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
Generalized Few-Shot Semantic Segmentation in Remote Sensing: Challenge and Benchmark
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
por: Dai, Pengyu, et al.
Publicado: (2026)
por: Dai, Pengyu, et al.
Publicado: (2026)
The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
por: Xuan, Weihao, et al.
Publicado: (2026)
por: Xuan, Weihao, et al.
Publicado: (2026)
ChangeMamba: Remote Sensing Change Detection With Spatiotemporal State Space Model
por: Chen, Hongruixuan, et al.
Publicado: (2024)
por: Chen, Hongruixuan, et al.
Publicado: (2024)
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
por: Chen, Hongruixuan, et al.
Publicado: (2025)
por: Chen, Hongruixuan, et al.
Publicado: (2025)
OpenEarthMap-SAR: A Benchmark Synthetic Aperture Radar Dataset for Global High-Resolution Land Cover Mapping
por: Xia, Junshi, et al.
Publicado: (2025)
por: Xia, Junshi, et al.
Publicado: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
ObjFormer: Learning Land-Cover Changes From Paired OSM Data and Optical High-Resolution Imagery via Object-Guided Transformer
por: Chen, Hongruixuan, et al.
Publicado: (2023)
por: Chen, Hongruixuan, et al.
Publicado: (2023)
EventVL: Understand Event Streams via Multimodal Large Language Model
por: Li, Pengteng, et al.
Publicado: (2025)
por: Li, Pengteng, et al.
Publicado: (2025)
OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation
por: Zhao, Sijie, et al.
Publicado: (2026)
por: Zhao, Sijie, et al.
Publicado: (2026)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
por: Qi, Tianye, et al.
Publicado: (2025)
por: Qi, Tianye, et al.
Publicado: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
por: Tian, Changyao, et al.
Publicado: (2026)
por: Tian, Changyao, et al.
Publicado: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
por: Jin, Zhiwei, et al.
Publicado: (2025)
por: Jin, Zhiwei, et al.
Publicado: (2025)
VL-Mamba: Exploring State Space Models for Multimodal Learning
por: Qiao, Yanyuan, et al.
Publicado: (2024)
por: Qiao, Yanyuan, et al.
Publicado: (2024)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
por: Wen, Zichen, et al.
Publicado: (2026)
por: Wen, Zichen, et al.
Publicado: (2026)
Single-Temporal Supervised Learning for Universal Remote Sensing Change Detection
por: Zheng, Zhuo, et al.
Publicado: (2024)
por: Zheng, Zhuo, et al.
Publicado: (2024)
Segment Any Change
por: Zheng, Zhuo, et al.
Publicado: (2024)
por: Zheng, Zhuo, et al.
Publicado: (2024)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
por: Wang, Xiaokun, et al.
Publicado: (2025)
por: Wang, Xiaokun, et al.
Publicado: (2025)
Enhancing Monocular Height Estimation via Sparse LiDAR-Guided Correction
por: Song, Jian, et al.
Publicado: (2025)
por: Song, Jian, et al.
Publicado: (2025)
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
por: Xiao, Aoran, et al.
Publicado: (2026)
por: Xiao, Aoran, et al.
Publicado: (2026)
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
MP-HSIR: A Multi-Prompt Framework for Universal Hyperspectral Image Restoration
por: Wu, Zhehui, et al.
Publicado: (2025)
por: Wu, Zhehui, et al.
Publicado: (2025)
Enhancing 3D LiDAR Segmentation by Shaping Dense and Accurate 2D Semantic Predictions
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
Exploring The Visual Feature Space for Multimodal Neural Decoding
por: Xia, Weihao, et al.
Publicado: (2025)
por: Xia, Weihao, et al.
Publicado: (2025)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
por: Wang, Qili, et al.
Publicado: (2025)
por: Wang, Qili, et al.
Publicado: (2025)
A-VL: Adaptive Attention for Large Vision-Language Models
por: Zhang, Junyang, et al.
Publicado: (2024)
por: Zhang, Junyang, et al.
Publicado: (2024)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
por: Zhang, Ruiyang, et al.
Publicado: (2024)
por: Zhang, Ruiyang, et al.
Publicado: (2024)
Ejemplares similares
-
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025) -
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
por: Wang, Junjue, et al.
Publicado: (2026) -
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
por: Tsujimoto, Mai, et al.
Publicado: (2025) -
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
por: Wang, Junjue, et al.
Publicado: (2025) -
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
por: Song, Jian, et al.
Publicado: (2024)