OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Ronghao, Liu, Haoran, Zhang, Weijie, Lin, Zhiwen, Yang, Xiao, Zhang, Peng, Yang, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data
par: Wang, Fengxiang, et autres
Publié: (2025)
par: Wang, Fengxiang, et autres
Publié: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
par: Liu, Ruixun, et autres
Publié: (2025)
par: Liu, Ruixun, et autres
Publié: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
par: Zhu, Jiashun, et autres
Publié: (2026)
par: Zhu, Jiashun, et autres
Publié: (2026)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
par: Gong, Ziyang, et autres
Publié: (2024)
par: Gong, Ziyang, et autres
Publié: (2024)
Evaluating and Benchmarking Foundation Models for Earth Observation and Geospatial AI
par: Dionelis, Nikolaos, et autres
Publié: (2024)
par: Dionelis, Nikolaos, et autres
Publié: (2024)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
par: Sun, Lang, et autres
Publié: (2026)
par: Sun, Lang, et autres
Publié: (2026)
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
par: Zhu, Yiqi, et autres
Publié: (2025)
par: Zhu, Yiqi, et autres
Publié: (2025)
CELLO: Causal Evaluation of Large Vision-Language Models
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
par: Yu, Hong-Tao, et autres
Publié: (2025)
par: Yu, Hong-Tao, et autres
Publié: (2025)
OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning
par: Yang, Zhengwei, et autres
Publié: (2026)
par: Yang, Zhengwei, et autres
Publié: (2026)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
par: Ying, Kaining, et autres
Publié: (2024)
par: Ying, Kaining, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
Omni6DPose: A Benchmark and Model for Universal 6D Object Pose Estimation and Tracking
par: Zhang, Jiyao, et autres
Publié: (2024)
par: Zhang, Jiyao, et autres
Publié: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
par: Fu, Teng, et autres
Publié: (2025)
par: Fu, Teng, et autres
Publié: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
Earth-Adapter: Bridge the Geospatial Domain Gaps with Mixture of Frequency Adaptation
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
par: Liu, Che, et autres
Publié: (2026)
par: Liu, Che, et autres
Publié: (2026)
SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model
par: Li, Kaiyu, et autres
Publié: (2025)
par: Li, Kaiyu, et autres
Publié: (2025)
Long Context Transfer from Language to Vision
par: Zhang, Peiyuan, et autres
Publié: (2024)
par: Zhang, Peiyuan, et autres
Publié: (2024)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
par: Lin, Xiao, et autres
Publié: (2024)
par: Lin, Xiao, et autres
Publié: (2024)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
par: Zhang, Yiman, et autres
Publié: (2025)
par: Zhang, Yiman, et autres
Publié: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
Geospatial Foundational Embedder: Top-1 Winning Solution on EarthVision Embed2Scale Challenge (CVPR 2025)
par: Xu, Zirui, et autres
Publié: (2025)
par: Xu, Zirui, et autres
Publié: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
Evaluating Attribute Comprehension in Large Vision-Language Models
par: Zhang, Haiwen, et autres
Publié: (2024)
par: Zhang, Haiwen, et autres
Publié: (2024)
Vision-Language Models for Vision Tasks: A Survey
par: Zhang, Jingyi, et autres
Publié: (2023)
par: Zhang, Jingyi, et autres
Publié: (2023)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models
par: Lin, Ling, et autres
Publié: (2026)
par: Lin, Ling, et autres
Publié: (2026)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
par: Tong, Baoshun, et autres
Publié: (2026)
par: Tong, Baoshun, et autres
Publié: (2026)
MMSpec: Benchmarking Speculative Decoding for Vision-Language Models
par: Shen, Hui, et autres
Publié: (2026)
par: Shen, Hui, et autres
Publié: (2026)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
par: Zhao, Ruixiang, et autres
Publié: (2026)
par: Zhao, Ruixiang, et autres
Publié: (2026)
Documents similaires
-
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025) -
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
par: Liu, Jiaqi, et autres
Publié: (2025) -
OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data
par: Wang, Fengxiang, et autres
Publié: (2025) -
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026) -
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
par: Liu, Ruixun, et autres
Publié: (2025)