SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Qiwei, Lu, Xukun, Liu, Wang, Duan, Puhong, Kang, Xudong, Li, Shutao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agriculture-Vision Challenge 2024 -- The Runner-Up Solution for Agricultural Pattern Recognition via Class Balancing and Model Ensemble
par: Liu, Wang, et autres
Publié: (2024)
par: Liu, Wang, et autres
Publié: (2024)
Learning from Noisy Pseudo-labels for All-Weather Land Cover Mapping
par: Liu, Wang, et autres
Publié: (2025)
par: Liu, Wang, et autres
Publié: (2025)
SAR-AE-SFP: SAR Imagery Adversarial Example in Real Physics domain with Target Scattering Feature Parameters
par: Cui, Jiahao, et autres
Publié: (2024)
par: Cui, Jiahao, et autres
Publié: (2024)
Prompting Foundation Models for Zero-Shot Ship Instance Segmentation in SAR Imagery
par: Mansour, Islam, et autres
Publié: (2026)
par: Mansour, Islam, et autres
Publié: (2026)
SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning
par: Wu, Xue, et autres
Publié: (2026)
par: Wu, Xue, et autres
Publié: (2026)
Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery
par: Ma, Sai, et autres
Publié: (2025)
par: Ma, Sai, et autres
Publié: (2025)
FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery
par: Zhang, Xiaokun, et autres
Publié: (2026)
par: Zhang, Xiaokun, et autres
Publié: (2026)
Understanding the Transfer Limits of Vision Foundation Models
par: Huang, Shiqi, et autres
Publié: (2026)
par: Huang, Shiqi, et autres
Publié: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
par: Luo, Junwei, et autres
Publié: (2025)
par: Luo, Junwei, et autres
Publié: (2025)
Examining the Commitments and Difficulties Inherent in Multimodal Foundation Models for Street View Imagery
par: Yang, Zhenyuan, et autres
Publié: (2024)
par: Yang, Zhenyuan, et autres
Publié: (2024)
When are Foundation Models Effective? Understanding the Suitability for Pixel-Level Classification Using Multispectral Imagery
par: Xie, Yiqun, et autres
Publié: (2024)
par: Xie, Yiqun, et autres
Publié: (2024)
SoccerMaster: A Vision Foundation Model for Soccer Understanding
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
par: Ma, Jie, et autres
Publié: (2026)
par: Ma, Jie, et autres
Publié: (2026)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Bootstrapping Diffusion: Diffusion Model Training Leveraging Partial and Corrupted Data
par: Ma, Xudong
Publié: (2025)
par: Ma, Xudong
Publié: (2025)
RAU: Reference-based Anatomical Understanding with Vision Language Models
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
par: Wei, Jie, et autres
Publié: (2025)
par: Wei, Jie, et autres
Publié: (2025)
Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models
par: Hu, Nanxing, et autres
Publié: (2025)
par: Hu, Nanxing, et autres
Publié: (2025)
All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation
par: Wang, Xudong, et autres
Publié: (2026)
par: Wang, Xudong, et autres
Publié: (2026)
Deep Hashing with Semantic Hash Centers for Image Retrieval
par: Chen, Li, et autres
Publié: (2025)
par: Chen, Li, et autres
Publié: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
par: Liu, Hanqing, et autres
Publié: (2026)
par: Liu, Hanqing, et autres
Publié: (2026)
Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications
par: Rahman, Ben
Publié: (2025)
par: Rahman, Ben
Publié: (2025)
Heuristical Comparison of Vision Transformers Against Convolutional Neural Networks for Semantic Segmentation on Remote Sensing Imagery
par: Dahal, Ashim, et autres
Publié: (2024)
par: Dahal, Ashim, et autres
Publié: (2024)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
par: Zhang, Jihai, et autres
Publié: (2025)
par: Zhang, Jihai, et autres
Publié: (2025)
Causality Model for Semantic Understanding on Videos
par: Yicong, Li
Publié: (2025)
par: Yicong, Li
Publié: (2025)
Multimodal Prompt Alignment for Facial Expression Recognition
par: Ma, Fuyan, et autres
Publié: (2025)
par: Ma, Fuyan, et autres
Publié: (2025)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
par: Guo, Grace, et autres
Publié: (2024)
par: Guo, Grace, et autres
Publié: (2024)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
par: Song, Python, et autres
Publié: (2025)
par: Song, Python, et autres
Publié: (2025)
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
par: Feng, Ruimin, et autres
Publié: (2025)
par: Feng, Ruimin, et autres
Publié: (2025)
FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph
par: Liu, Zhangding, et autres
Publié: (2025)
par: Liu, Zhangding, et autres
Publié: (2025)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
par: Hasani, Hosein, et autres
Publié: (2025)
par: Hasani, Hosein, et autres
Publié: (2025)
From Isolated Islands to Pangea: Unifying Semantic Space for Human Action Understanding
par: Li, Yong-Lu, et autres
Publié: (2023)
par: Li, Yong-Lu, et autres
Publié: (2023)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
par: Zheng, Qi, et autres
Publié: (2026)
par: Zheng, Qi, et autres
Publié: (2026)
Differential Privacy Image Generation with Reconstruction Loss and Noise Injection Using an Error Feedback SGD
par: Ma, Qiwei, et autres
Publié: (2026)
par: Ma, Qiwei, et autres
Publié: (2026)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
par: Wu, Xiangyang, et autres
Publié: (2025)
par: Wu, Xiangyang, et autres
Publié: (2025)
Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
par: Shi, Jin, et autres
Publié: (2026)
par: Shi, Jin, et autres
Publié: (2026)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
par: Li, Nanxi, et autres
Publié: (2026)
par: Li, Nanxi, et autres
Publié: (2026)
SatVision-TOA: A Geospatial Foundation Model for Coarse-Resolution All-Sky Remote Sensing Imagery
par: Spradlin, Caleb S., et autres
Publié: (2024)
par: Spradlin, Caleb S., et autres
Publié: (2024)
Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset
par: Blankemeier, Louis, et autres
Publié: (2024)
par: Blankemeier, Louis, et autres
Publié: (2024)
Documents similaires
-
Agriculture-Vision Challenge 2024 -- The Runner-Up Solution for Agricultural Pattern Recognition via Class Balancing and Model Ensemble
par: Liu, Wang, et autres
Publié: (2024) -
Learning from Noisy Pseudo-labels for All-Weather Land Cover Mapping
par: Liu, Wang, et autres
Publié: (2025) -
SAR-AE-SFP: SAR Imagery Adversarial Example in Real Physics domain with Target Scattering Feature Parameters
par: Cui, Jiahao, et autres
Publié: (2024) -
Prompting Foundation Models for Zero-Shot Ship Instance Segmentation in SAR Imagery
par: Mansour, Islam, et autres
Publié: (2026) -
SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning
par: Wu, Xue, et autres
Publié: (2026)