VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Pang, Chao, Weng, Xingxing, Wu, Jiang, Li, Jiayu, Liu, Yi, Sun, Jiaxing, Li, Weijia, Wang, Shuai, Feng, Litong, Xia, Gui-Song, He, Conghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
por: Weng, Xingxing, et al.
Publicado: (2025)
por: Weng, Xingxing, et al.
Publicado: (2025)
3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level Supervisions
por: Li, Weijia, et al.
Publicado: (2024)
por: Li, Weijia, et al.
Publicado: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
por: Weng, Xingxing, et al.
Publicado: (2026)
por: Weng, Xingxing, et al.
Publicado: (2026)
HiCD: Change Detection in Quality-Varied Images via Hierarchical Correlation Distillation
por: Pang, Chao, et al.
Publicado: (2024)
por: Pang, Chao, et al.
Publicado: (2024)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
por: An, Xiao, et al.
Publicado: (2024)
por: An, Xiao, et al.
Publicado: (2024)
DragOSM: Extract Building Roofs and Footprints from Aerial Images by Aligning Historical Labels
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
por: Zhong, Chen, et al.
Publicado: (2026)
por: Zhong, Chen, et al.
Publicado: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Exploring Scene Affinity for Semi-Supervised LiDAR Semantic Segmentation
por: Liu, Chuandong, et al.
Publicado: (2024)
por: Liu, Chuandong, et al.
Publicado: (2024)
DescribeEarth: Describe Anything for Remote Sensing Images
por: Li, Kaiyu, et al.
Publicado: (2025)
por: Li, Kaiyu, et al.
Publicado: (2025)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
por: Song, Junru, et al.
Publicado: (2026)
por: Song, Junru, et al.
Publicado: (2026)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
por: Yang, Jiaxing, et al.
Publicado: (2025)
por: Yang, Jiaxing, et al.
Publicado: (2025)
High-quality Pseudo-labeling for Point Cloud Segmentation with Scene-level Annotation
por: Duan, Lunhao, et al.
Publicado: (2025)
por: Duan, Lunhao, et al.
Publicado: (2025)
RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation
por: Wang, Ruizhi, et al.
Publicado: (2026)
por: Wang, Ruizhi, et al.
Publicado: (2026)
Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
Multi-modal Uncertainty Robust Tree Cover Segmentation For High-Resolution Remote Sensing Images
por: Gui, Yuanyuan, et al.
Publicado: (2025)
por: Gui, Yuanyuan, et al.
Publicado: (2025)
FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection
por: Zhu, Leqi, et al.
Publicado: (2026)
por: Zhu, Leqi, et al.
Publicado: (2026)
ESC-MISR: Enhancing Spatial Correlations for Multi-Image Super-Resolution in Remote Sensing
por: Zhang, Zhihui, et al.
Publicado: (2024)
por: Zhang, Zhihui, et al.
Publicado: (2024)
RSDehamba: Lightweight Vision Mamba for Remote Sensing Satellite Image Dehazing
por: Zhou, Huiling, et al.
Publicado: (2024)
por: Zhou, Huiling, et al.
Publicado: (2024)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
LaVIDE: A Language-Vision Discriminator for Detecting Changes in Satellite Image with Map References
por: Jiang, Shuguo, et al.
Publicado: (2024)
por: Jiang, Shuguo, et al.
Publicado: (2024)
Bounds of Block Rewards in Honest PinFi Systems
por: He, Qi, et al.
Publicado: (2024)
por: He, Qi, et al.
Publicado: (2024)
VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
por: Ke, Junlong, et al.
Publicado: (2026)
por: Ke, Junlong, et al.
Publicado: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Fine-Grained Building Function Recognition from Street-View Images via Geometry-Aware Semi-Supervised Learning
por: Li, Weijia, et al.
Publicado: (2024)
por: Li, Weijia, et al.
Publicado: (2024)
EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing
por: Jiang, Hongxiang, et al.
Publicado: (2025)
por: Jiang, Hongxiang, et al.
Publicado: (2025)
UHR-DETR: Efficient End-to-End Small Object Detection for Ultra-High-Resolution Remote Sensing Imagery
por: Li, Jingfang, et al.
Publicado: (2026)
por: Li, Jingfang, et al.
Publicado: (2026)
HiSem: Hierarchical Semantic Disentangling for Remote Sensing Image Change Captioning
por: Wang, Man, et al.
Publicado: (2026)
por: Wang, Man, et al.
Publicado: (2026)
VFM-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images
por: Wang, Deliang, et al.
Publicado: (2025)
por: Wang, Deliang, et al.
Publicado: (2025)
OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
por: Guo, Yuncheng, et al.
Publicado: (2025)
por: Guo, Yuncheng, et al.
Publicado: (2025)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
por: Yao, Kelu, et al.
Publicado: (2025)
por: Yao, Kelu, et al.
Publicado: (2025)
OpenRSD: Towards Open-prompts for Object Detection in Remote Sensing Images
por: Huang, Ziyue, et al.
Publicado: (2025)
por: Huang, Ziyue, et al.
Publicado: (2025)
Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
por: Wen, Siwei, et al.
Publicado: (2025)
por: Wen, Siwei, et al.
Publicado: (2025)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
por: Huang, Ziyue, et al.
Publicado: (2025)
por: Huang, Ziyue, et al.
Publicado: (2025)
Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
por: Muhtar, Dilxat, et al.
Publicado: (2025)
por: Muhtar, Dilxat, et al.
Publicado: (2025)
RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation
por: Zhou, Zihui, et al.
Publicado: (2026)
por: Zhou, Zihui, et al.
Publicado: (2026)
Ejemplares similares
-
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
por: Weng, Xingxing, et al.
Publicado: (2025) -
3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level Supervisions
por: Li, Weijia, et al.
Publicado: (2024) -
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
por: Weng, Xingxing, et al.
Publicado: (2026) -
HiCD: Change Detection in Quality-Varied Images via Hierarchical Correlation Distillation
por: Pang, Chao, et al.
Publicado: (2024) -
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
por: An, Xiao, et al.
Publicado: (2024)