Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zilun, Guan, Zian, Zhao, Tiancheng, Shen, Haozhan, Li, Tianyu, Cai, Yuxiang, Su, Zhonggen, Liu, Zhaojun, Yin, Jianwei, Li, Xiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024)
par: Shen, Haozhan, et autres
Publié: (2024)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023)
par: Zhang, Zilun, et autres
Publié: (2023)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
Talking to Yourself: Defying Forgetting in Large Language Models
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
SGPT: Few-Shot Prompt Tuning for Signed Graphs
par: Zhai, Zian, et autres
Publié: (2024)
par: Zhai, Zian, et autres
Publié: (2024)
Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning
par: Dong, Fuyu, et autres
Publié: (2025)
par: Dong, Fuyu, et autres
Publié: (2025)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
Active Few-Shot Fine-Tuning
par: Hübotter, Jonas, et autres
Publié: (2024)
par: Hübotter, Jonas, et autres
Publié: (2024)
In-Context Learning Distillation for Efficient Few-Shot Fine-Tuning
par: Duan, Yifei, et autres
Publié: (2024)
par: Duan, Yifei, et autres
Publié: (2024)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
par: Guo, Yulong, et autres
Publié: (2025)
par: Guo, Yulong, et autres
Publié: (2025)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
par: Zhang, Zilun, et autres
Publié: (2022)
par: Zhang, Zilun, et autres
Publié: (2022)
Dynamic and Low-Rank Fine-Tuning of Large Language Models for Robust Few-Shot Learning
par: Cai, Guohui, et autres
Publié: (2025)
par: Cai, Guohui, et autres
Publié: (2025)
Hyperbolic Coarse-to-Fine Few-Shot Class-Incremental Learning
par: Dai, Jiaxin, et autres
Publié: (2025)
par: Dai, Jiaxin, et autres
Publié: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
par: Jiang, Yankai, et autres
Publié: (2026)
par: Jiang, Yankai, et autres
Publié: (2026)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025)
par: Liu, Peng, et autres
Publié: (2025)
Diverse Instance Generation via Diffusion Models for Enhanced Few-Shot Object Detection in Remote Sensing Images
par: Liu, Yanxing, et autres
Publié: (2025)
par: Liu, Yanxing, et autres
Publié: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
par: Li, Pengyi, et autres
Publié: (2025)
par: Li, Pengyi, et autres
Publié: (2025)
Convergence rate of randomized midpoint Langevin Monte Carlo
par: Li, Ruinan, et autres
Publié: (2025)
par: Li, Ruinan, et autres
Publié: (2025)
Fine-Grained Zero-Shot Learning with Attribute-Centric Representations
par: Chen, Zhi, et autres
Publié: (2025)
par: Chen, Zhi, et autres
Publié: (2025)
Three-Parameter Approximations of Sums of Locally Dependent Random Variables via Stein's Method
par: Su, Zhonggen, et autres
Publié: (2023)
par: Su, Zhonggen, et autres
Publié: (2023)
Uniform Hanson-Wright Type Deviation Inequalities for $α$-Subexponential Random Vectors
par: Dai, Guozheng, et autres
Publié: (2024)
par: Dai, Guozheng, et autres
Publié: (2024)
Non-asymptotic Analysis of Poisson randomized midpoint Langevin Monte Carlo
par: Shen, Tian, et autres
Publié: (2025)
par: Shen, Tian, et autres
Publié: (2025)
Deviation Inequalities for the Spectral Norm of Structured Random Matrices
par: Dai, Guozheng, et autres
Publié: (2024)
par: Dai, Guozheng, et autres
Publié: (2024)
Enhancing Few-Shot Out-of-Distribution Detection via the Refinement of Foreground and Background
par: Li, Tianyu, et autres
Publié: (2026)
par: Li, Tianyu, et autres
Publié: (2026)
Few-Shot Domain Adaptation for Learned Image Compression
par: Zhang, Tianyu, et autres
Publié: (2024)
par: Zhang, Tianyu, et autres
Publié: (2024)
HyperFlow: Gradient-Free Emulation of Few-Shot Fine-Tuning
par: Kim, Donggyun, et autres
Publié: (2025)
par: Kim, Donggyun, et autres
Publié: (2025)
COFT-AD: COntrastive Fine-Tuning for Few-Shot Anomaly Detection
par: Liao, Jingyi, et autres
Publié: (2024)
par: Liao, Jingyi, et autres
Publié: (2024)
Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation
par: Tang, Haozhan, et autres
Publié: (2026)
par: Tang, Haozhan, et autres
Publié: (2026)
Quantum-Inspired Fine-Tuning for Few-Shot AIGC Detection via Phase-Structured Reparameterization
par: Xing, Kaiyang, et autres
Publié: (2026)
par: Xing, Kaiyang, et autres
Publié: (2026)
Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection
par: Wang, Wanqi, et autres
Publié: (2026)
par: Wang, Wanqi, et autres
Publié: (2026)
Few-Shot Adversarial Low-Rank Fine-Tuning of Vision-Language Models
par: Ghiasvand, Sajjad, et autres
Publié: (2025)
par: Ghiasvand, Sajjad, et autres
Publié: (2025)
Leveraging Large Language Models for Node Generation in Few-Shot Learning on Text-Attributed Graphs
par: Yu, Jianxiang, et autres
Publié: (2023)
par: Yu, Jianxiang, et autres
Publié: (2023)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
par: Shen, Haozhan, et autres
Publié: (2025)
par: Shen, Haozhan, et autres
Publié: (2025)
FlashMol: High-Quality Molecule Generation in as Few as Four Steps
par: Wei, Xinyuan, et autres
Publié: (2026)
par: Wei, Xinyuan, et autres
Publié: (2026)
Few-Shot Recalibration of Language Models
par: Li, Xiang Lisa, et autres
Publié: (2024)
par: Li, Xiang Lisa, et autres
Publié: (2024)
Documents similaires
-
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
par: Zhang, Zilun, et autres
Publié: (2024) -
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024) -
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023) -
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026)