UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Jiajin, Mei, Haibo, Zhang, Bonan, Liu, Dan, Fu, Yuanshuang, Zhang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026)
di: Li, Yujun, et al.
Pubblicazione: (2026)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning
di: Sautenkov, Oleg, et al.
Pubblicazione: (2025)
di: Sautenkov, Oleg, et al.
Pubblicazione: (2025)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
di: Xu, Boyue, et al.
Pubblicazione: (2026)
di: Xu, Boyue, et al.
Pubblicazione: (2026)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
di: Xu, Yanchen, et al.
Pubblicazione: (2025)
di: Xu, Yanchen, et al.
Pubblicazione: (2025)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
di: Sun, Jintao, et al.
Pubblicazione: (2026)
di: Sun, Jintao, et al.
Pubblicazione: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
di: Varma, Maya, et al.
Pubblicazione: (2024)
di: Varma, Maya, et al.
Pubblicazione: (2024)
Safe Path Planning and Observation Quality Enhancement Strategy for Unmanned Aerial Vehicles in Water Quality Monitoring Tasks
di: Fu, Yuanshuang, et al.
Pubblicazione: (2025)
di: Fu, Yuanshuang, et al.
Pubblicazione: (2025)
UAUTrack: Towards Unified Multimodal Anti-UAV Visual Tracking
di: Ren, Qionglin, et al.
Pubblicazione: (2025)
di: Ren, Qionglin, et al.
Pubblicazione: (2025)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
di: Liu, Youzhi, et al.
Pubblicazione: (2024)
di: Liu, Youzhi, et al.
Pubblicazione: (2024)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition
di: Xia, Yu, et al.
Pubblicazione: (2026)
di: Xia, Yu, et al.
Pubblicazione: (2026)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
di: Li, Xueheng, et al.
Pubblicazione: (2026)
di: Li, Xueheng, et al.
Pubblicazione: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
di: Zhou, Yue, et al.
Pubblicazione: (2026)
di: Zhou, Yue, et al.
Pubblicazione: (2026)
Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks
di: Xu, Yunting, et al.
Pubblicazione: (2026)
di: Xu, Yunting, et al.
Pubblicazione: (2026)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments
di: Liu, Xu, et al.
Pubblicazione: (2025)
di: Liu, Xu, et al.
Pubblicazione: (2025)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
di: li, Bonan, et al.
Pubblicazione: (2025)
di: li, Bonan, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning of Vision Foundation Model for Forest Floor Segmentation from UAV Imagery
di: Wasil, Mohammad, et al.
Pubblicazione: (2025)
di: Wasil, Mohammad, et al.
Pubblicazione: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
di: Cai, Xinyan, et al.
Pubblicazione: (2025)
15,500 Seconds: Lean UAV Classification Using EfficientNet and Lightweight Fine-Tuning
di: Berg, Andrew P., et al.
Pubblicazione: (2025)
di: Berg, Andrew P., et al.
Pubblicazione: (2025)
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
di: Zhao, Hanyang, et al.
Pubblicazione: (2025)
UAV-VLRR: Vision-Language Informed NMPC for Rapid Response in UAV Search and Rescue
di: Yaqoot, Yasheerah, et al.
Pubblicazione: (2025)
di: Yaqoot, Yasheerah, et al.
Pubblicazione: (2025)
AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
di: Sun, Xiaolou, et al.
Pubblicazione: (2026)
di: Sun, Xiaolou, et al.
Pubblicazione: (2026)
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
Multi-Task Bayesian Optimization for Tuning Decentralized Trajectory Generation in Multi-UAV Systems
di: Manzoni, Marta, et al.
Pubblicazione: (2025)
di: Manzoni, Marta, et al.
Pubblicazione: (2025)
CollabOD: Collaborative Multi-Backbone with Cross-scale Vision for UAV Small Object Detection
di: Bai, Xuecheng, et al.
Pubblicazione: (2026)
di: Bai, Xuecheng, et al.
Pubblicazione: (2026)
First‐Principle Prediction of Hydrogen Diffusion Path in Titanium Alloy Passivation Film
di: Yuanshuang Liu, et al.
Pubblicazione: (2025)
di: Yuanshuang Liu, et al.
Pubblicazione: (2025)
A Learning Framework For Cooperative Collision Avoidance of UAV Swarms Leveraging Domain Knowledge
di: Huang, Shuangyao, et al.
Pubblicazione: (2025)
di: Huang, Shuangyao, et al.
Pubblicazione: (2025)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
DanceGRPO: Unleashing GRPO on Visual Generation
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
di: Xue, Zeyue, et al.
Pubblicazione: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
di: Kapuriya, Janak, et al.
Pubblicazione: (2025)
Skeleton2Stage: Reward-Guided Fine-Tuning for Physically Plausible Dance Generation
di: Jia, Jidong, et al.
Pubblicazione: (2026)
di: Jia, Jidong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026) -
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
di: Yao, Huanjin, et al.
Pubblicazione: (2025) -
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
di: Wei, Zhixiang, et al.
Pubblicazione: (2026) -
UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning
di: Sautenkov, Oleg, et al.
Pubblicazione: (2025) -
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
di: Xu, Boyue, et al.
Pubblicazione: (2026)