SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Xiao, Fu, Ronghao, Lin, Zhiwen, Duan, Zhuoran, Zhu, Jiashun, Hu, Jiasen, Sun, Lang, Zhang, Weipeng, Liu, Jiaqi, Na, Xu, Liu, Haoran, Zhang, Weijie, Yang, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
par: Zhu, Jiashun, et autres
Publié: (2026)
par: Zhu, Jiashun, et autres
Publié: (2026)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
par: Sun, Lang, et autres
Publié: (2026)
par: Sun, Lang, et autres
Publié: (2026)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
par: Fu, Ronghao, et autres
Publié: (2026)
par: Fu, Ronghao, et autres
Publié: (2026)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Boosting Multimodal Remote Sensing Image Classification with Transformer-based Heterogeneously Salient Graph Representation
par: Yang, Jiaqi, et autres
Publié: (2023)
par: Yang, Jiaqi, et autres
Publié: (2023)
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
par: Bazi, Yakoub, et autres
Publié: (2026)
par: Bazi, Yakoub, et autres
Publié: (2026)
Native Audio-Visual Alignment for Generation
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
par: Liu, Zhiheng, et autres
Publié: (2025)
par: Liu, Zhiheng, et autres
Publié: (2025)
STAR-Net: An Interpretable Model-Aided Network for Remote Sensing Image Denoising
par: Liu, Jingjing, et autres
Publié: (2025)
par: Liu, Jingjing, et autres
Publié: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
par: Zhang, Zhengbo, et autres
Publié: (2026)
par: Zhang, Zhengbo, et autres
Publié: (2026)
RescueADI: Adaptive Disaster Interpretation in Remote Sensing Images with Autonomous Agents
par: Liu, Zhuoran, et autres
Publié: (2024)
par: Liu, Zhuoran, et autres
Publié: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
par: Wang, Yuanfu, et autres
Publié: (2026)
par: Wang, Yuanfu, et autres
Publié: (2026)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
Toward Native Multimodal Modeling: A Roadmap
par: An, Siyu, et autres
Publié: (2026)
par: An, Siyu, et autres
Publié: (2026)
Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model
par: Liu, Yuze, et autres
Publié: (2025)
par: Liu, Yuze, et autres
Publié: (2025)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
par: He, Zefeng, et autres
Publié: (2026)
par: He, Zefeng, et autres
Publié: (2026)
NativeTok: Native Visual Tokenization for Improved Image Generation
par: Wu, Bin, et autres
Publié: (2026)
par: Wu, Bin, et autres
Publié: (2026)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Computing in the Era of Large Generative Models: From Cloud-Native to AI-Native
par: Lu, Yao, et autres
Publié: (2024)
par: Lu, Yao, et autres
Publié: (2024)
Symbolic Analysis of Grover Search Algorithm via Chain-of-Thought Reasoning and Quantum-Native Tokenization
par: Chen, Min, et autres
Publié: (2025)
par: Chen, Min, et autres
Publié: (2025)
FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
Aria: An Open Multimodal Native Mixture-of-Experts Model
par: Li, Dongxu, et autres
Publié: (2024)
par: Li, Dongxu, et autres
Publié: (2024)
Emu3.5: Native Multimodal Models are World Learners
par: Cui, Yufeng, et autres
Publié: (2025)
par: Cui, Yufeng, et autres
Publié: (2025)
Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images
par: Yuan, Bo, et autres
Publié: (2024)
par: Yuan, Bo, et autres
Publié: (2024)
Show-o2: Improved Native Unified Multimodal Models
par: Xie, Jinheng, et autres
Publié: (2025)
par: Xie, Jinheng, et autres
Publié: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
par: Wang, Fengxiang, et autres
Publié: (2026)
par: Wang, Fengxiang, et autres
Publié: (2026)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
par: Zhou, Weilin, et autres
Publié: (2026)
par: Zhou, Weilin, et autres
Publié: (2026)
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
par: V Team, et autres
Publié: (2026)
par: V Team, et autres
Publié: (2026)
Interpretable by AI Mother Tongue: Native Symbolic Reasoning in Neural Models
par: Liu, Hung Ming
Publié: (2025)
par: Liu, Hung Ming
Publié: (2025)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
par: Huang, Ziyue, et autres
Publié: (2025)
par: Huang, Ziyue, et autres
Publié: (2025)
Scaling Laws for Native Multimodal Models
par: Shukor, Mustafa, et autres
Publié: (2025)
par: Shukor, Mustafa, et autres
Publié: (2025)
FinRL-X: An AI-Native Modular Infrastructure for Quantitative Trading
par: Yang, Hongyang, et autres
Publié: (2026)
par: Yang, Hongyang, et autres
Publié: (2026)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
par: Guo, Haonan, et autres
Publié: (2024)
par: Guo, Haonan, et autres
Publié: (2024)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
par: Huang, Shijue, et autres
Publié: (2026)
par: Huang, Shijue, et autres
Publié: (2026)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Documents similaires
-
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
par: Zhu, Jiashun, et autres
Publié: (2026) -
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
par: Liu, Jiaqi, et autres
Publié: (2025) -
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
par: Sun, Lang, et autres
Publié: (2026) -
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025) -
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026)