Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jiaqi, Sun, Lang, Fu, Ronghao, Yang, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
por: Sun, Lang, et al.
Publicado: (2026)
por: Sun, Lang, et al.
Publicado: (2026)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026)
por: Zhu, Jiashun, et al.
Publicado: (2026)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
por: Man, Yunze, et al.
Publicado: (2025)
por: Man, Yunze, et al.
Publicado: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing
por: Koksal, Aybora, et al.
Publicado: (2025)
por: Koksal, Aybora, et al.
Publicado: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
por: Chen, Wei, et al.
Publicado: (2026)
por: Chen, Wei, et al.
Publicado: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
por: Lv, Weijiang, et al.
Publicado: (2026)
por: Lv, Weijiang, et al.
Publicado: (2026)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
por: Qin, Luozheng, et al.
Publicado: (2025)
por: Qin, Luozheng, et al.
Publicado: (2025)
RemoteCLIP: A Vision Language Foundation Model for Remote Sensing
por: Liu, Fan, et al.
Publicado: (2023)
por: Liu, Fan, et al.
Publicado: (2023)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing
por: Hasan, Maram, et al.
Publicado: (2026)
por: Hasan, Maram, et al.
Publicado: (2026)
RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning
por: Huang, Shiqi, et al.
Publicado: (2026)
por: Huang, Shiqi, et al.
Publicado: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
por: Fu, Ronghao, et al.
Publicado: (2026)
por: Fu, Ronghao, et al.
Publicado: (2026)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
por: Luo, Zhiming, et al.
Publicado: (2026)
por: Luo, Zhiming, et al.
Publicado: (2026)
X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning
por: Ng, Chee, et al.
Publicado: (2025)
por: Ng, Chee, et al.
Publicado: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing
por: Zhang, Weiyu, et al.
Publicado: (2026)
por: Zhang, Weiyu, et al.
Publicado: (2026)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
por: Li, Wenshuai, et al.
Publicado: (2026)
por: Li, Wenshuai, et al.
Publicado: (2026)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
por: An, Xiao, et al.
Publicado: (2024)
por: An, Xiao, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
por: Shabbir, Akashah, et al.
Publicado: (2025)
por: Shabbir, Akashah, et al.
Publicado: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)
por: Rajabi, Navid, et al.
Publicado: (2023)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
por: Li, Xiping, et al.
Publicado: (2025)
por: Li, Xiping, et al.
Publicado: (2025)
Vision-Language Memory for Spatial Reasoning
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
por: Toker, Aysim, et al.
Publicado: (2025)
por: Toker, Aysim, et al.
Publicado: (2025)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
por: Lee, Jonathan, et al.
Publicado: (2025)
por: Lee, Jonathan, et al.
Publicado: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
Ejemplares similares
-
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
por: Liu, Jiaqi, et al.
Publicado: (2025) -
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
por: Sun, Lang, et al.
Publicado: (2026) -
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
por: Yang, Xiao, et al.
Publicado: (2026) -
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026) -
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
por: Yang, Xiao, et al.
Publicado: (2026)