Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
Fuente:
arXiv
Guardado en:
| Autores principales: | Tsujimoto, Mai, Wang, Junjue, Xuan, Weihao, Yokoya, Naoto |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026)
por: Liu, Quan, et al.
Publicado: (2026)
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
por: Song, Jian, et al.
Publicado: (2024)
por: Song, Jian, et al.
Publicado: (2024)
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
por: Wang, Junjue, et al.
Publicado: (2025)
por: Wang, Junjue, et al.
Publicado: (2025)
Concept-based Explainable Data Mining with VLM for 3D Detection
por: Tsujimoto, Mai
Publicado: (2025)
por: Tsujimoto, Mai
Publicado: (2025)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
por: Dai, Pengyu, et al.
Publicado: (2026)
por: Dai, Pengyu, et al.
Publicado: (2026)
Segment Anything with Multiple Modalities
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
Enhancing 3D LiDAR Segmentation by Shaping Dense and Accurate 2D Semantic Predictions
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
Change Detection Between Optical Remote Sensing Imagery and Map Data via Segment Anything Model (SAM)
por: Chen, Hongruixuan, et al.
Publicado: (2024)
por: Chen, Hongruixuan, et al.
Publicado: (2024)
GaussianOcc: Fully Self-supervised and Efficient 3D Occupancy Estimation with Gaussian Splatting
por: Gan, Wanshui, et al.
Publicado: (2024)
por: Gan, Wanshui, et al.
Publicado: (2024)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
por: Gong, Ziyang, et al.
Publicado: (2024)
por: Gong, Ziyang, et al.
Publicado: (2024)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation
por: Zhao, Sijie, et al.
Publicado: (2026)
por: Zhao, Sijie, et al.
Publicado: (2026)
SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding
por: Wei, Yimin, et al.
Publicado: (2025)
por: Wei, Yimin, et al.
Publicado: (2025)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery
por: Shanker, Shambhavi, et al.
Publicado: (2025)
por: Shanker, Shambhavi, et al.
Publicado: (2025)
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery
por: Chen, Pengyu, et al.
Publicado: (2025)
por: Chen, Pengyu, et al.
Publicado: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
por: Fu, Ronghao, et al.
Publicado: (2026)
por: Fu, Ronghao, et al.
Publicado: (2026)
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
por: Xiao, Aoran, et al.
Publicado: (2026)
por: Xiao, Aoran, et al.
Publicado: (2026)
GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
por: Wang, Di, et al.
Publicado: (2025)
por: Wang, Di, et al.
Publicado: (2025)
Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery Simulation
por: Lee, Phillip Y., et al.
Publicado: (2025)
por: Lee, Phillip Y., et al.
Publicado: (2025)
Urban Neural Surface Reconstruction from Constrained Sparse Aerial Imagery with 3D SAR Fusion
por: Li, Da, et al.
Publicado: (2026)
por: Li, Da, et al.
Publicado: (2026)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
por: Xie, Qinghongbing, et al.
Publicado: (2025)
por: Xie, Qinghongbing, et al.
Publicado: (2025)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
por: Danish, Muhammad Sohail, et al.
Publicado: (2024)
por: Danish, Muhammad Sohail, et al.
Publicado: (2024)
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
MP-HSIR: A Multi-Prompt Framework for Universal Hyperspectral Image Restoration
por: Wu, Zhehui, et al.
Publicado: (2025)
por: Wu, Zhehui, et al.
Publicado: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
Few-Shot Vision-Language Reasoning for Satellite Imagery via Verifiable Rewards
por: Koksal, Aybora, et al.
Publicado: (2025)
por: Koksal, Aybora, et al.
Publicado: (2025)
Aerial Lifting: Neural Urban Semantic and Building Instance Lifting from Aerial Imagery
por: Zhang, Yuqi, et al.
Publicado: (2024)
por: Zhang, Yuqi, et al.
Publicado: (2024)
Unsupervised Domain Adaptation Architecture Search with Self-Training for Land Cover Mapping
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
Evaluating the Efficacy of Sentinel-2 versus Aerial Imagery in Serrated Tussock Classification
por: Sultana, Rezwana, et al.
Publicado: (2025)
por: Sultana, Rezwana, et al.
Publicado: (2025)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
por: Jia, Pengyue, et al.
Publicado: (2025)
por: Jia, Pengyue, et al.
Publicado: (2025)
Enhancing Monocular Height Estimation via Sparse LiDAR-Guided Correction
por: Song, Jian, et al.
Publicado: (2025)
por: Song, Jian, et al.
Publicado: (2025)
RankDVQA-mini: Knowledge Distillation-Driven Deep Video Quality Assessment
por: Feng, Chen, et al.
Publicado: (2023)
por: Feng, Chen, et al.
Publicado: (2023)
Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis
por: Lai, Haoran, et al.
Publicado: (2026)
por: Lai, Haoran, et al.
Publicado: (2026)
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
por: Nguyen, Minh Khoi, et al.
Publicado: (2026)
por: Nguyen, Minh Khoi, et al.
Publicado: (2026)
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
por: Chen, Hongruixuan, et al.
Publicado: (2025)
por: Chen, Hongruixuan, et al.
Publicado: (2025)
SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model
por: Li, Kaiyu, et al.
Publicado: (2025)
por: Li, Kaiyu, et al.
Publicado: (2025)
Ejemplares similares
-
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
por: Xuan, Weihao, et al.
Publicado: (2025) -
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026) -
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
por: Song, Jian, et al.
Publicado: (2024) -
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024) -
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
por: Xuan, Weihao, et al.
Publicado: (2025)