GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiaqi, Fu, Ronghao, Liu, Haoran, Sun, Lang, Yang, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
di: Fu, Ronghao, et al.
Pubblicazione: (2026)
di: Fu, Ronghao, et al.
Pubblicazione: (2026)
GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis
di: Sastry, Srikumar, et al.
Pubblicazione: (2026)
di: Sastry, Srikumar, et al.
Pubblicazione: (2026)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
di: Sun, Lang, et al.
Pubblicazione: (2026)
di: Sun, Lang, et al.
Pubblicazione: (2026)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
di: Zhu, Jiashun, et al.
Pubblicazione: (2026)
di: Zhu, Jiashun, et al.
Pubblicazione: (2026)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
di: Xin, Yi, et al.
Pubblicazione: (2025)
di: Xin, Yi, et al.
Pubblicazione: (2025)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Can Generative Geospatial Diffusion Models Excel as Discriminative Geospatial Foundation Models?
di: Jia, Yuru, et al.
Pubblicazione: (2025)
di: Jia, Yuru, et al.
Pubblicazione: (2025)
RAU: Reference-based Anatomical Understanding with Vision Language Models
di: Li, Yiwei, et al.
Pubblicazione: (2025)
di: Li, Yiwei, et al.
Pubblicazione: (2025)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
di: Liu, Ruixun, et al.
Pubblicazione: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2024)
di: Danish, Muhammad Sohail, et al.
Pubblicazione: (2024)
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
di: Tsujimoto, Mai, et al.
Pubblicazione: (2025)
di: Tsujimoto, Mai, et al.
Pubblicazione: (2025)
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
di: Zhang, Ning, et al.
Pubblicazione: (2026)
di: Zhang, Ning, et al.
Pubblicazione: (2026)
GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
di: Wang, Di, et al.
Pubblicazione: (2025)
di: Wang, Di, et al.
Pubblicazione: (2025)
MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation
di: Zuo, Ronglai, et al.
Pubblicazione: (2026)
di: Zuo, Ronglai, et al.
Pubblicazione: (2026)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
di: Li, Zhimin, et al.
Pubblicazione: (2024)
di: Li, Zhimin, et al.
Pubblicazione: (2024)
EraserDiT: Fast Video Inpainting with Diffusion Transformer Model
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation
di: Liu, Yuhao, et al.
Pubblicazione: (2026)
di: Liu, Yuhao, et al.
Pubblicazione: (2026)
DiCache: Let Diffusion Model Determine Its Own Cache
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
SpatialBot: Precise Spatial Understanding with Vision Language Models
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
Can 3D Vision-Language Models Truly Understand Natural Language?
di: Deng, Weipeng, et al.
Pubblicazione: (2024)
di: Deng, Weipeng, et al.
Pubblicazione: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models
di: Zhang, Zhifang, et al.
Pubblicazione: (2025)
di: Zhang, Zhifang, et al.
Pubblicazione: (2025)
Understanding Degradation with Vision Language Model
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
di: Gong, Ziyang, et al.
Pubblicazione: (2024)
di: Gong, Ziyang, et al.
Pubblicazione: (2024)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
di: Zhu, Hongyang, et al.
Pubblicazione: (2025)
di: Zhu, Hongyang, et al.
Pubblicazione: (2025)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
di: Wu, Xian, et al.
Pubblicazione: (2025)
di: Wu, Xian, et al.
Pubblicazione: (2025)
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
di: Fu, Luxuan, et al.
Pubblicazione: (2026)
di: Fu, Luxuan, et al.
Pubblicazione: (2026)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
di: Liu, Jiaqi, et al.
Pubblicazione: (2025) -
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
di: Liu, Jiaqi, et al.
Pubblicazione: (2025) -
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
di: Fu, Ronghao, et al.
Pubblicazione: (2026) -
GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis
di: Sastry, Srikumar, et al.
Pubblicazione: (2026) -
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
di: Sun, Lang, et al.
Pubblicazione: (2026)