Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Kaixuan, Zhang, Ruiqian, Huang, Xiao, Xie, Yuxing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
por: Lu, Kaixuan
Publicado: (2024)
por: Lu, Kaixuan
Publicado: (2024)
Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing
por: Lu, Kaixuan, et al.
Publicado: (2024)
por: Lu, Kaixuan, et al.
Publicado: (2024)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
por: Zhang, Xinyu, et al.
Publicado: (2026)
por: Zhang, Xinyu, et al.
Publicado: (2026)
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
por: Zhong, Chen, et al.
Publicado: (2026)
por: Zhong, Chen, et al.
Publicado: (2026)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
por: Pan, Jiancheng, et al.
Publicado: (2024)
por: Pan, Jiancheng, et al.
Publicado: (2024)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
por: Shao, Run, et al.
Publicado: (2024)
por: Shao, Run, et al.
Publicado: (2024)
Direction-Oriented Visual-semantic Embedding Model for Remote Sensing Image-text Retrieval
por: Ma, Qing, et al.
Publicado: (2023)
por: Ma, Qing, et al.
Publicado: (2023)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
por: Muhtar, Dilxat, et al.
Publicado: (2024)
por: Muhtar, Dilxat, et al.
Publicado: (2024)
Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network
por: Yang, Jiaxing, et al.
Publicado: (2025)
por: Yang, Jiaxing, et al.
Publicado: (2025)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
por: Li, Xiang, et al.
Publicado: (2023)
por: Li, Xiang, et al.
Publicado: (2023)
RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering
por: Lin, Hui, et al.
Publicado: (2024)
por: Lin, Hui, et al.
Publicado: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
por: Zhang, Jielu, et al.
Publicado: (2023)
por: Zhang, Jielu, et al.
Publicado: (2023)
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation
por: Li, Shuyang, et al.
Publicado: (2025)
por: Li, Shuyang, et al.
Publicado: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
por: Zhang, Zilun, et al.
Publicado: (2024)
por: Zhang, Zilun, et al.
Publicado: (2024)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
por: Wang, Shanwen, et al.
Publicado: (2026)
por: Wang, Shanwen, et al.
Publicado: (2026)
DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models
por: Dong, Zhe, et al.
Publicado: (2025)
por: Dong, Zhe, et al.
Publicado: (2025)
Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification
por: Xu, Wenjia, et al.
Publicado: (2024)
por: Xu, Wenjia, et al.
Publicado: (2024)
Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model
por: Wen, Congcong, et al.
Publicado: (2025)
por: Wen, Congcong, et al.
Publicado: (2025)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
por: Zhen, Yihao, et al.
Publicado: (2025)
por: Zhen, Yihao, et al.
Publicado: (2025)
RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance
por: Hou, Xianbao, et al.
Publicado: (2026)
por: Hou, Xianbao, et al.
Publicado: (2026)
Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models
por: Ghatkesar, Aarti, et al.
Publicado: (2025)
por: Ghatkesar, Aarti, et al.
Publicado: (2025)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
por: Hua, Chunliang, et al.
Publicado: (2026)
por: Hua, Chunliang, et al.
Publicado: (2026)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
por: Zhang, Fei, et al.
Publicado: (2025)
por: Zhang, Fei, et al.
Publicado: (2025)
Efficient Adaptation For Remote Sensing Visual Grounding
por: Moughnieh, Hasan, et al.
Publicado: (2025)
por: Moughnieh, Hasan, et al.
Publicado: (2025)
Open-Vocabulary Remote Sensing Image Semantic Segmentation
por: Cao, Qinglong, et al.
Publicado: (2024)
por: Cao, Qinglong, et al.
Publicado: (2024)
Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation
por: Dong, Zhe, et al.
Publicado: (2024)
por: Dong, Zhe, et al.
Publicado: (2024)
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
por: Liu, Cencen, et al.
Publicado: (2026)
por: Liu, Cencen, et al.
Publicado: (2026)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2025)
por: Zhang, Zilun, et al.
Publicado: (2025)
FedRSClip: Federated Learning for Remote Sensing Scene Classification Using Vision-Language Models
por: Lin, Hui, et al.
Publicado: (2025)
por: Lin, Hui, et al.
Publicado: (2025)
RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images
por: Li, Ke, et al.
Publicado: (2025)
por: Li, Ke, et al.
Publicado: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
por: Luo, Junwei, et al.
Publicado: (2024)
por: Luo, Junwei, et al.
Publicado: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
por: Luo, Zhiming, et al.
Publicado: (2026)
por: Luo, Zhiming, et al.
Publicado: (2026)
EMRA-proxy: Enhancing Multi-Class Region Semantic Segmentation in Remote Sensing Images with Attention Proxy
por: Yu, Yichun, et al.
Publicado: (2025)
por: Yu, Yichun, et al.
Publicado: (2025)
Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval
por: Xiao, J., et al.
Publicado: (2025)
por: Xiao, J., et al.
Publicado: (2025)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
Remote Sensing Image Classification Using Deep Ensemble Learning
por: Islam, Niful, et al.
Publicado: (2026)
por: Islam, Niful, et al.
Publicado: (2026)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
por: Lu, Meng, et al.
Publicado: (2026)
por: Lu, Meng, et al.
Publicado: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
por: Chen, Weizhi, et al.
Publicado: (2025)
por: Chen, Weizhi, et al.
Publicado: (2025)
Ejemplares similares
-
Aquila-plus: Prompt-Driven Visual-Language Models for Pixel-Level Remote Sensing Image Understanding
por: Lu, Kaixuan
Publicado: (2024) -
Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing
por: Lu, Kaixuan, et al.
Publicado: (2024) -
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
por: Zhang, Xinyu, et al.
Publicado: (2026) -
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
por: Liu, Yi, et al.
Publicado: (2025) -
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
por: Zhong, Chen, et al.
Publicado: (2026)