Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yaohua, Song, Xinyuan, Deng, Yunfu, Xie, Yifan, Ou, Binkai, Zhong, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
di: Cui, Yibo, et al.
Pubblicazione: (2025)
di: Cui, Yibo, et al.
Pubblicazione: (2025)
FILA: Fine-Grained Vision Language Models
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
di: Demidov, Dmitry, et al.
Pubblicazione: (2023)
di: Demidov, Dmitry, et al.
Pubblicazione: (2023)
ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval
di: Nguyen, Tien-Huy, et al.
Pubblicazione: (2026)
di: Nguyen, Tien-Huy, et al.
Pubblicazione: (2026)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024)
di: Luo, Junwei, et al.
Pubblicazione: (2024)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
di: Yue, Junrong, et al.
Pubblicazione: (2025)
di: Yue, Junrong, et al.
Pubblicazione: (2025)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
di: Liu, Junming, et al.
Pubblicazione: (2025)
di: Liu, Junming, et al.
Pubblicazione: (2025)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
di: Wang, Zehao, et al.
Pubblicazione: (2024)
di: Wang, Zehao, et al.
Pubblicazione: (2024)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
di: Ding, Hao, et al.
Pubblicazione: (2026)
di: Ding, Hao, et al.
Pubblicazione: (2026)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
di: Lan, Long, et al.
Pubblicazione: (2024)
di: Lan, Long, et al.
Pubblicazione: (2024)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
di: Wang, Chenhao, et al.
Pubblicazione: (2026)
di: Wang, Chenhao, et al.
Pubblicazione: (2026)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
Semantic-Topological Graph Reasoning for Language-Guided Pulmonary Screening
di: Xue, Chenyu, et al.
Pubblicazione: (2026)
di: Xue, Chenyu, et al.
Pubblicazione: (2026)
ProtoDCS: Towards Robust and Efficient Open-Set Test-Time Adaptation for Vision-Language Models
di: Luo, Wei, et al.
Pubblicazione: (2026)
di: Luo, Wei, et al.
Pubblicazione: (2026)
doScenes: An Autonomous Driving Dataset with Natural Language Instruction for Human Interaction and Vision-Language Navigation
di: Roy, Parthib, et al.
Pubblicazione: (2024)
di: Roy, Parthib, et al.
Pubblicazione: (2024)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
di: Sheng, Kai, et al.
Pubblicazione: (2026)
di: Sheng, Kai, et al.
Pubblicazione: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
di: Jiang, Wen, et al.
Pubblicazione: (2026)
di: Jiang, Wen, et al.
Pubblicazione: (2026)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
di: Yu, Bo, et al.
Pubblicazione: (2026)
di: Yu, Bo, et al.
Pubblicazione: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
Saccadic Vision for Fine-Grained Visual Classification
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Fine-Grained Representation for Lane Topology Reasoning
di: Xu, Guoqing, et al.
Pubblicazione: (2025)
di: Xu, Guoqing, et al.
Pubblicazione: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
di: Xu, Yunzhe, et al.
Pubblicazione: (2025)
di: Xu, Yunzhe, et al.
Pubblicazione: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
di: Xu, Ming, et al.
Pubblicazione: (2024)
di: Xu, Ming, et al.
Pubblicazione: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
di: Xiang, Yifan, et al.
Pubblicazione: (2025)
di: Xiang, Yifan, et al.
Pubblicazione: (2025)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
di: Zou, Shu, et al.
Pubblicazione: (2025)
di: Zou, Shu, et al.
Pubblicazione: (2025)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
di: Wang, Chun, et al.
Pubblicazione: (2025)
di: Wang, Chun, et al.
Pubblicazione: (2025)
PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection
di: Yan, Teng, et al.
Pubblicazione: (2026)
di: Yan, Teng, et al.
Pubblicazione: (2026)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
Continual Vision-and-Language Navigation
di: Jeong, Seongjun, et al.
Pubblicazione: (2024)
di: Jeong, Seongjun, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models
di: Roger, Alexis, et al.
Pubblicazione: (2025)
di: Roger, Alexis, et al.
Pubblicazione: (2025)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
di: Wang, Daming, et al.
Pubblicazione: (2025)
di: Wang, Daming, et al.
Pubblicazione: (2025)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
di: Cui, Yibo, et al.
Pubblicazione: (2025) -
FILA: Fine-Grained Vision Language Models
di: Zhu, Shiding, et al.
Pubblicazione: (2024) -
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025) -
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
di: Demidov, Dmitry, et al.
Pubblicazione: (2023) -
ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval
di: Nguyen, Tien-Huy, et al.
Pubblicazione: (2026)