Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Kaixuan, Zhang, Ruiqian, Huang, Xiao, Xie, Yuxing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
di: Lu, Kaixuan
Pubblicazione: (2024)
di: Lu, Kaixuan
Pubblicazione: (2024)
Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing
di: Lu, Kaixuan, et al.
Pubblicazione: (2024)
di: Lu, Kaixuan, et al.
Pubblicazione: (2024)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
di: Zhong, Chen, et al.
Pubblicazione: (2026)
di: Zhong, Chen, et al.
Pubblicazione: (2026)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
di: Shao, Run, et al.
Pubblicazione: (2024)
di: Shao, Run, et al.
Pubblicazione: (2024)
Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval
di: Ma, Qing, et al.
Pubblicazione: (2023)
di: Ma, Qing, et al.
Pubblicazione: (2023)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
di: Muhtar, Dilxat, et al.
Pubblicazione: (2024)
di: Muhtar, Dilxat, et al.
Pubblicazione: (2024)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
di: Yang, Jiaxing, et al.
Pubblicazione: (2025)
di: Yang, Jiaxing, et al.
Pubblicazione: (2025)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering
di: Lin, Hui, et al.
Pubblicazione: (2024)
di: Lin, Hui, et al.
Pubblicazione: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
di: Zhang, Jielu, et al.
Pubblicazione: (2023)
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation
di: Li, Shuyang, et al.
Pubblicazione: (2025)
di: Li, Shuyang, et al.
Pubblicazione: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
di: Wang, Shanwen, et al.
Pubblicazione: (2026)
di: Wang, Shanwen, et al.
Pubblicazione: (2026)
DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models
di: Dong, Zhe, et al.
Pubblicazione: (2025)
di: Dong, Zhe, et al.
Pubblicazione: (2025)
Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification
di: Xu, Wenjia, et al.
Pubblicazione: (2024)
di: Xu, Wenjia, et al.
Pubblicazione: (2024)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
di: Wen, Congcong, et al.
Pubblicazione: (2025)
di: Wen, Congcong, et al.
Pubblicazione: (2025)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
di: Zhen, Yihao, et al.
Pubblicazione: (2025)
di: Zhen, Yihao, et al.
Pubblicazione: (2025)
RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance
di: Hou, Xianbao, et al.
Pubblicazione: (2026)
di: Hou, Xianbao, et al.
Pubblicazione: (2026)
Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models
di: Ghatkesar, Aarti, et al.
Pubblicazione: (2025)
di: Ghatkesar, Aarti, et al.
Pubblicazione: (2025)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
di: Zhang, Fei, et al.
Pubblicazione: (2025)
di: Zhang, Fei, et al.
Pubblicazione: (2025)
Efficient Adaptation For Remote Sensing Visual Grounding
di: Moughnieh, Hasan, et al.
Pubblicazione: (2025)
di: Moughnieh, Hasan, et al.
Pubblicazione: (2025)
Open-Vocabulary Remote Sensing Image Semantic Segmentation
di: Cao, Qinglong, et al.
Pubblicazione: (2024)
di: Cao, Qinglong, et al.
Pubblicazione: (2024)
Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation
di: Dong, Zhe, et al.
Pubblicazione: (2024)
di: Dong, Zhe, et al.
Pubblicazione: (2024)
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
di: Liu, Cencen, et al.
Pubblicazione: (2026)
di: Liu, Cencen, et al.
Pubblicazione: (2026)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
FedRSClip: Federated Learning for Remote Sensing Scene Classification Using Vision-Language Models
di: Lin, Hui, et al.
Pubblicazione: (2025)
di: Lin, Hui, et al.
Pubblicazione: (2025)
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
di: Li, Ke, et al.
Pubblicazione: (2025)
di: Li, Ke, et al.
Pubblicazione: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024)
di: Luo, Junwei, et al.
Pubblicazione: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
di: Luo, Zhiming, et al.
Pubblicazione: (2026)
EMRA-proxy: Enhancing Multi-Class Region Semantic Segmentation in Remote Sensing Images with Attention Proxy
di: Yu, Yichun, et al.
Pubblicazione: (2025)
di: Yu, Yichun, et al.
Pubblicazione: (2025)
Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval
di: Xiao, J., et al.
Pubblicazione: (2025)
di: Xiao, J., et al.
Pubblicazione: (2025)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
Remote Sensing Image Classification Using Deep Ensemble Learning
di: Islam, Niful, et al.
Pubblicazione: (2026)
di: Islam, Niful, et al.
Pubblicazione: (2026)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
di: Lu, Meng, et al.
Pubblicazione: (2026)
di: Lu, Meng, et al.
Pubblicazione: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
di: Chen, Weizhi, et al.
Pubblicazione: (2025)
di: Chen, Weizhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
di: Lu, Kaixuan
Pubblicazione: (2024) -
Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing
di: Lu, Kaixuan, et al.
Pubblicazione: (2024) -
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
di: Zhang, Xinyu, et al.
Pubblicazione: (2026) -
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
di: Liu, Yi, et al.
Pubblicazione: (2025) -
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
di: Zhong, Chen, et al.
Pubblicazione: (2026)