SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Xiao, Fu, Ronghao, Lin, Zhiwen, Duan, Zhuoran, Zhu, Jiashun, Hu, Jiasen, Sun, Lang, Zhang, Weipeng, Liu, Jiaqi, Na, Xu, Liu, Haoran, Zhang, Weijie, Yang, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026)
por: Zhu, Jiashun, et al.
Publicado: (2026)
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
por: Sun, Lang, et al.
Publicado: (2026)
por: Sun, Lang, et al.
Publicado: (2026)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
por: Fu, Ronghao, et al.
Publicado: (2026)
por: Fu, Ronghao, et al.
Publicado: (2026)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Boosting Multimodal Remote Sensing Image Classification with Transformer-based Heterogeneously Salient Graph Representation
por: Yang, Jiaqi, et al.
Publicado: (2023)
por: Yang, Jiaqi, et al.
Publicado: (2023)
Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
por: Bazi, Yakoub, et al.
Publicado: (2026)
por: Bazi, Yakoub, et al.
Publicado: (2026)
Native Audio-Visual Alignment for Generation
por: Ji, Longbin, et al.
Publicado: (2026)
por: Ji, Longbin, et al.
Publicado: (2026)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
por: Liu, Yuhang, et al.
Publicado: (2025)
por: Liu, Yuhang, et al.
Publicado: (2025)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
por: Liu, Zhiheng, et al.
Publicado: (2025)
por: Liu, Zhiheng, et al.
Publicado: (2025)
STAR-Net: An Interpretable Model-Aided Network for Remote Sensing Image Denoising
por: Liu, Jingjing, et al.
Publicado: (2025)
por: Liu, Jingjing, et al.
Publicado: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
por: Zhang, Zhengbo, et al.
Publicado: (2026)
por: Zhang, Zhengbo, et al.
Publicado: (2026)
RescueADI: Adaptive Disaster Interpretation in Remote Sensing Images with Autonomous Agents
por: Liu, Zhuoran, et al.
Publicado: (2024)
por: Liu, Zhuoran, et al.
Publicado: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
por: Wang, Yuanfu, et al.
Publicado: (2026)
por: Wang, Yuanfu, et al.
Publicado: (2026)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
por: Wu, Tong, et al.
Publicado: (2025)
por: Wu, Tong, et al.
Publicado: (2025)
Toward Native Multimodal Modeling: A Roadmap
por: An, Siyu, et al.
Publicado: (2026)
por: An, Siyu, et al.
Publicado: (2026)
Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model
por: Liu, Yuze, et al.
Publicado: (2025)
por: Liu, Yuze, et al.
Publicado: (2025)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
por: He, Zefeng, et al.
Publicado: (2026)
por: He, Zefeng, et al.
Publicado: (2026)
NativeTok: Native Visual Tokenization for Improved Image Generation
por: Wu, Bin, et al.
Publicado: (2026)
por: Wu, Bin, et al.
Publicado: (2026)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
Computing in the Era of Large Generative Models: From Cloud-Native to AI-Native
por: Lu, Yao, et al.
Publicado: (2024)
por: Lu, Yao, et al.
Publicado: (2024)
Symbolic Analysis of Grover Search Algorithm via Chain-of-Thought Reasoning and Quantum-Native Tokenization
por: Chen, Min, et al.
Publicado: (2025)
por: Chen, Min, et al.
Publicado: (2025)
FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
Aria: An Open Multimodal Native Mixture-of-Experts Model
por: Li, Dongxu, et al.
Publicado: (2024)
por: Li, Dongxu, et al.
Publicado: (2024)
Emu3.5: Native Multimodal Models are World Learners
por: Cui, Yufeng, et al.
Publicado: (2025)
por: Cui, Yufeng, et al.
Publicado: (2025)
Continual Panoptic Perception: Towards Multi-modal Incremental Interpretation of Remote Sensing Images
por: Yuan, Bo, et al.
Publicado: (2024)
por: Yuan, Bo, et al.
Publicado: (2024)
Show-o2: Improved Native Unified Multimodal Models
por: Xie, Jinheng, et al.
Publicado: (2025)
por: Xie, Jinheng, et al.
Publicado: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
por: Zhou, Weilin, et al.
Publicado: (2026)
por: Zhou, Weilin, et al.
Publicado: (2026)
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
por: V Team, et al.
Publicado: (2026)
por: V Team, et al.
Publicado: (2026)
Interpretable by AI Mother Tongue: Native Symbolic Reasoning in Neural Models
por: Liu, Hung Ming
Publicado: (2025)
por: Liu, Hung Ming
Publicado: (2025)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
por: Huang, Ziyue, et al.
Publicado: (2025)
por: Huang, Ziyue, et al.
Publicado: (2025)
Scaling Laws for Native Multimodal Models
por: Shukor, Mustafa, et al.
Publicado: (2025)
por: Shukor, Mustafa, et al.
Publicado: (2025)
FinRL-X: An AI-Native Modular Infrastructure for Quantitative Trading
por: Yang, Hongyang, et al.
Publicado: (2026)
por: Yang, Hongyang, et al.
Publicado: (2026)
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models
por: Guo, Haonan, et al.
Publicado: (2024)
por: Guo, Haonan, et al.
Publicado: (2024)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
por: Liu, Yi, et al.
Publicado: (2026)
por: Liu, Yi, et al.
Publicado: (2026)
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
por: Huang, Shijue, et al.
Publicado: (2026)
por: Huang, Shijue, et al.
Publicado: (2026)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Ejemplares similares
-
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
por: Zhu, Jiashun, et al.
Publicado: (2026) -
SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts
por: Liu, Jiaqi, et al.
Publicado: (2025) -
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
por: Sun, Lang, et al.
Publicado: (2026) -
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
por: Liu, Jiaqi, et al.
Publicado: (2025) -
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
por: Yang, Xiao, et al.
Publicado: (2026)