Salvato in:
| Autori principali: | Zhan, Yang, Xiong, Zhitong, Yuan, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2401.09712 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024)
di: Luo, Junwei, et al.
Pubblicazione: (2024)
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
di: Yuan, Zhenghang, et al.
Pubblicazione: (2024)
di: Yuan, Zhenghang, et al.
Pubblicazione: (2024)
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
di: Li, Yujie, et al.
Pubblicazione: (2024)
di: Li, Yujie, et al.
Pubblicazione: (2024)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
di: Guo, Haonan, et al.
Pubblicazione: (2024)
di: Guo, Haonan, et al.
Pubblicazione: (2024)
Hierarchical Semi-Supervised Active Learning for Remote Sensing
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
di: Bai, Yang, et al.
Pubblicazione: (2024)
di: Bai, Yang, et al.
Pubblicazione: (2024)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
di: Xiong, Zhitong, et al.
Pubblicazione: (2024)
di: Xiong, Zhitong, et al.
Pubblicazione: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following
di: Kang, Myeongkyun, et al.
Pubblicazione: (2026)
di: Kang, Myeongkyun, et al.
Pubblicazione: (2026)
UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding
di: Zhan, Yang, et al.
Pubblicazione: (2026)
di: Zhan, Yang, et al.
Pubblicazione: (2026)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
di: An, Xiao, et al.
Pubblicazione: (2024)
di: An, Xiao, et al.
Pubblicazione: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
di: Park, Dongmin, et al.
Pubblicazione: (2024)
di: Park, Dongmin, et al.
Pubblicazione: (2024)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
di: Zhang, Shilong, et al.
Pubblicazione: (2023)
di: Zhang, Shilong, et al.
Pubblicazione: (2023)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts
di: Liu, Xu, et al.
Pubblicazione: (2024)
di: Liu, Xu, et al.
Pubblicazione: (2024)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
di: Liu, Fan, et al.
Pubblicazione: (2023)
di: Liu, Fan, et al.
Pubblicazione: (2023)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2023)
di: Wang, Xunguang, et al.
Pubblicazione: (2023)
DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation
di: Xiong, Zhitong, et al.
Pubblicazione: (2025)
di: Xiong, Zhitong, et al.
Pubblicazione: (2025)
LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
SkySense V2: A Unified Foundation Model for Multi-modal Remote Sensing
di: Zhang, Yingying, et al.
Pubblicazione: (2025)
di: Zhang, Yingying, et al.
Pubblicazione: (2025)
GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing
di: Ou, Ruizhe, et al.
Pubblicazione: (2025)
di: Ou, Ruizhe, et al.
Pubblicazione: (2025)
Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization
di: Shen, Yang, et al.
Pubblicazione: (2024)
di: Shen, Yang, et al.
Pubblicazione: (2024)
HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
di: Lin, Tianwei, et al.
Pubblicazione: (2025)
di: Lin, Tianwei, et al.
Pubblicazione: (2025)
Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models
di: Li, Xiaohe, et al.
Pubblicazione: (2026)
di: Li, Xiaohe, et al.
Pubblicazione: (2026)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
ChangeChat: An Interactive Model for Remote Sensing Change Analysis via Multimodal Instruction Tuning
di: Deng, Pei, et al.
Pubblicazione: (2024)
di: Deng, Pei, et al.
Pubblicazione: (2024)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
di: Weng, Xingxing, et al.
Pubblicazione: (2025)
di: Weng, Xingxing, et al.
Pubblicazione: (2025)
GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing
di: Elgendy, Hosam, et al.
Pubblicazione: (2024)
di: Elgendy, Hosam, et al.
Pubblicazione: (2024)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
di: Yan, Qiao, et al.
Pubblicazione: (2025)
di: Yan, Qiao, et al.
Pubblicazione: (2025)
SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
di: Si, Dongchen, et al.
Pubblicazione: (2025)
di: Si, Dongchen, et al.
Pubblicazione: (2025)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
di: Dang, Yunkai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024) -
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
di: Yuan, Zhenghang, et al.
Pubblicazione: (2024) -
UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models
di: Li, Yujie, et al.
Pubblicazione: (2024) -
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
di: Zhou, Yue, et al.
Pubblicazione: (2024) -
Vision-Language Models in Remote Sensing: Current Progress and Future Trends
di: Li, Xiang, et al.
Pubblicazione: (2023)