Fine-Tuning Vision-Language Models for Visual Navigation Assistance
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xiao, Gandhi, Bharat, Zhan, Ming, Nehra, Mohit, Zhang, Zhicheng, Sun, Yuchen, Song, Meijia, Zhang, Naisheng, Wang, Xi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
di: Gu, Zijian, et al.
Pubblicazione: (2025)
di: Gu, Zijian, et al.
Pubblicazione: (2025)
Fine-Tuning Without Forgetting: Adaptation of YOLOv8 Preserves COCO Performance
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
MERGETUNE: Continued Fine-Tuning of Vision-Language Models
di: Wang, Wenqing, et al.
Pubblicazione: (2026)
di: Wang, Wenqing, et al.
Pubblicazione: (2026)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
di: Zhang, Zezhou, et al.
Pubblicazione: (2026)
di: Zhang, Zezhou, et al.
Pubblicazione: (2026)
Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
di: Oh, Changdae, et al.
Pubblicazione: (2023)
di: Oh, Changdae, et al.
Pubblicazione: (2023)
UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning
di: Guan, Jiajin, et al.
Pubblicazione: (2025)
di: Guan, Jiajin, et al.
Pubblicazione: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
Generalizable Prompt Tuning for Vision-Language Models
di: Zhang, Qian
Pubblicazione: (2024)
di: Zhang, Qian
Pubblicazione: (2024)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
di: Ming, Yifei, et al.
Pubblicazione: (2023)
di: Ming, Yifei, et al.
Pubblicazione: (2023)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
di: Zhu, Beier, et al.
Pubblicazione: (2023)
di: Zhu, Beier, et al.
Pubblicazione: (2023)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
di: Li, Jiayu, et al.
Pubblicazione: (2025)
di: Li, Jiayu, et al.
Pubblicazione: (2025)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
di: Cui, Yibo, et al.
Pubblicazione: (2025)
di: Cui, Yibo, et al.
Pubblicazione: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
HouseTune: Two-Stage Floorplan Generation with LLM Assistance
di: Zong, Ziyang, et al.
Pubblicazione: (2024)
di: Zong, Ziyang, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
di: Jie, Shibo, et al.
Pubblicazione: (2024)
di: Jie, Shibo, et al.
Pubblicazione: (2024)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
di: Liu, Yaohua, et al.
Pubblicazione: (2025)
di: Liu, Yaohua, et al.
Pubblicazione: (2025)
Visual Variational Autoencoder Prompt Tuning
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
Data-Efficient Fine-Tuning of Vision-Language Models for Diagnosis of Alzheimer's Disease
di: Cheng, Fangqi, et al.
Pubblicazione: (2025)
di: Cheng, Fangqi, et al.
Pubblicazione: (2025)
A Closer Look at Conditional Prompt Tuning for Vision-Language Models
di: Zhang, Ji, et al.
Pubblicazione: (2025)
di: Zhang, Ji, et al.
Pubblicazione: (2025)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
di: Xu, Ming, et al.
Pubblicazione: (2024)
di: Xu, Ming, et al.
Pubblicazione: (2024)
MapLocNet: Coarse-to-Fine Feature Registration for Visual Re-Localization in Navigation Maps
di: Wu, Hang, et al.
Pubblicazione: (2024)
di: Wu, Hang, et al.
Pubblicazione: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
SEP: Self-Enhanced Prompt Tuning for Visual-Language Model
di: Yao, Hantao, et al.
Pubblicazione: (2024)
di: Yao, Hantao, et al.
Pubblicazione: (2024)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
di: Zheng, Weiying, et al.
Pubblicazione: (2025)
di: Zheng, Weiying, et al.
Pubblicazione: (2025)
SemPT: Semantic Prompt Tuning for Vision-Language Models
di: Shi, Xiao, et al.
Pubblicazione: (2025)
di: Shi, Xiao, et al.
Pubblicazione: (2025)
Layer-Specific Fine-Tuning for Improved Negation Handling in Medical Vision-Language Models
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
BronchOpt : Vision-Based Pose Optimization with Fine-Tuned Foundation Models for Accurate Bronchoscopy Navigation
di: Shu, Hongchao, et al.
Pubblicazione: (2025)
di: Shu, Hongchao, et al.
Pubblicazione: (2025)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
di: Zhan, Yang, et al.
Pubblicazione: (2024)
di: Zhan, Yang, et al.
Pubblicazione: (2024)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
di: Zhang, Jinrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025) -
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025) -
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025) -
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
di: Gu, Zijian, et al.
Pubblicazione: (2025) -
Fine-Tuning Without Forgetting: Adaptation of YOLOv8 Preserves COCO Performance
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)