Towards Vision-Language Geo-Foundation Model: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yue, Zhong, Zhihang, Yang, Xue |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Explainability for Vision Foundation Models: A Survey
par: Kazmierczak, Rémi, et autres
Publié: (2025)
par: Kazmierczak, Rémi, et autres
Publié: (2025)
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
par: Xu, Zhen, et autres
Publié: (2025)
par: Xu, Zhen, et autres
Publié: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation
par: Yu, Wenjun, et autres
Publié: (2025)
par: Yu, Wenjun, et autres
Publié: (2025)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
par: Zhang, Jinjin, et autres
Publié: (2025)
par: Zhang, Jinjin, et autres
Publié: (2025)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
par: Huang, Ziyue, et autres
Publié: (2025)
par: Huang, Ziyue, et autres
Publié: (2025)
Towards Unifying Understanding and Generation in the Era of Vision Foundation Models: A Survey from the Autoregression Perspective
par: Xie, Shenghao, et autres
Publié: (2024)
par: Xie, Shenghao, et autres
Publié: (2024)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
par: Liu, Fan, et autres
Publié: (2023)
par: Liu, Fan, et autres
Publié: (2023)
UniVBench: Towards Unified Evaluation for Video Foundation Models
par: Wei, Jianhui, et autres
Publié: (2026)
par: Wei, Jianhui, et autres
Publié: (2026)
Vision-Language Models for Vision Tasks: A Survey
par: Zhang, Jingyi, et autres
Publié: (2023)
par: Zhang, Jingyi, et autres
Publié: (2023)
Towards Cross-View Point Correspondence in Vision-Language Models
par: Wang, Yipu, et autres
Publié: (2025)
par: Wang, Yipu, et autres
Publié: (2025)
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
par: Xue, Xizhe, et autres
Publié: (2025)
par: Xue, Xizhe, et autres
Publié: (2025)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
par: Liu, Daizong, et autres
Publié: (2024)
par: Liu, Daizong, et autres
Publié: (2024)
CanViT: Toward Active-Vision Foundation Models
par: Berreby, Yohaï-Eliel, et autres
Publié: (2026)
par: Berreby, Yohaï-Eliel, et autres
Publié: (2026)
Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation Model
par: Le, Long, et autres
Publié: (2024)
par: Le, Long, et autres
Publié: (2024)
A Survey on Efficient Vision-Language Models
par: Shinde, Gaurav, et autres
Publié: (2025)
par: Shinde, Gaurav, et autres
Publié: (2025)
Fooling Polarization-based Vision using Locally Controllable Polarizing Projection
par: Li, Zhuoxiao, et autres
Publié: (2023)
par: Li, Zhuoxiao, et autres
Publié: (2023)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
par: Liu, Yuanqing, et autres
Publié: (2026)
par: Liu, Yuanqing, et autres
Publié: (2026)
EVLF-FM: Explainable Vision Language Foundation Model for Medicine
par: Bai, Yang, et autres
Publié: (2025)
par: Bai, Yang, et autres
Publié: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Vision Foundation Models in Remote Sensing: A Survey
par: Lu, Siqi, et autres
Publié: (2024)
par: Lu, Siqi, et autres
Publié: (2024)
Survey of Multimodal Geospatial Foundation Models: Techniques, Applications, and Challenges
par: Yang, Liling, et autres
Publié: (2025)
par: Yang, Liling, et autres
Publié: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
par: Xiong, Zhitong, et autres
Publié: (2024)
par: Xiong, Zhitong, et autres
Publié: (2024)
Towards a Unified Copernicus Foundation Model for Earth Vision
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
A Vision-Language Foundation Model for Leaf Disease Identification
par: Quoc, Khang Nguyen, et autres
Publié: (2025)
par: Quoc, Khang Nguyen, et autres
Publié: (2025)
A Survey on Segment Anything Model (SAM): Vision Foundation Model Meets Prompt Engineering
par: Zhang, Chaoning, et autres
Publié: (2023)
par: Zhang, Chaoning, et autres
Publié: (2023)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
par: Zhang, Jianshu, et autres
Publié: (2026)
par: Zhang, Jianshu, et autres
Publié: (2026)
Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)
par: Yao, Kelu, et autres
Publié: (2025)
par: Yao, Kelu, et autres
Publié: (2025)
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
par: Yuan, Zhenghang, et autres
Publié: (2024)
par: Yuan, Zhenghang, et autres
Publié: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
par: Truong, Thanh-Dat, et autres
Publié: (2025)
par: Truong, Thanh-Dat, et autres
Publié: (2025)
Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
Implicit Modeling for Transferability Estimation of Vision Foundation Models
par: Zheng, Yaoyan, et autres
Publié: (2025)
par: Zheng, Yaoyan, et autres
Publié: (2025)
Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
par: Liu, Jiaxin, et autres
Publié: (2026)
par: Liu, Jiaxin, et autres
Publié: (2026)
Towards Foundation Models for 3D Vision: How Close Are We?
par: Zuo, Yiming, et autres
Publié: (2024)
par: Zuo, Yiming, et autres
Publié: (2024)
Image Segmentation in Foundation Model Era: A Survey
par: Zhou, Tianfei, et autres
Publié: (2024)
par: Zhou, Tianfei, et autres
Publié: (2024)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
Documents similaires
-
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024) -
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024) -
Explainability for Vision Foundation Models: A Survey
par: Kazmierczak, Rémi, et autres
Publié: (2025) -
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
par: Xu, Zhen, et autres
Publié: (2025) -
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)