Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Dongsheng, Yu, Yinfeng, Wang, Liejun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
by: Li, Yahui, et al.
Published: (2026)
by: Li, Yahui, et al.
Published: (2026)
VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledge
by: Li, Zihan, et al.
Published: (2024)
by: Li, Zihan, et al.
Published: (2024)
A Disease-Centric Vision-Language Foundation Model for Precision Oncology in Kidney Cancer
by: Tao, Yuhui, et al.
Published: (2025)
by: Tao, Yuhui, et al.
Published: (2025)
Brain-Adapter: Enhancing Neurological Disorder Analysis with Adapter-Tuning Multimodal Large Language Models
by: Zhang, Jing, et al.
Published: (2025)
by: Zhang, Jing, et al.
Published: (2025)
Mammo-CLIP: Leveraging Contrastive Language-Image Pre-training (CLIP) for Enhanced Breast Cancer Diagnosis with Multi-view Mammography
by: Chen, Xuxin, et al.
Published: (2024)
by: Chen, Xuxin, et al.
Published: (2024)
Semi-Supervised Medical Image Segmentation via Knowledge Mining from Large Models
by: Mao, Yuchen, et al.
Published: (2025)
by: Mao, Yuchen, et al.
Published: (2025)
A Versatile Pathology Co-pilot via Reasoning Enhanced Multimodal Large Language Model
by: Xu, Zhe, et al.
Published: (2025)
by: Xu, Zhe, et al.
Published: (2025)
Explainable Knowledge Distillation for Efficient Medical Image Classification
by: Mir, Aqib Nazir, et al.
Published: (2025)
by: Mir, Aqib Nazir, et al.
Published: (2025)
Efficient Knowledge Distillation of SAM for Medical Image Segmentation
by: Patil, Kunal Dasharath, et al.
Published: (2025)
by: Patil, Kunal Dasharath, et al.
Published: (2025)
Uncovering Latent Pathological Signatures in Pulmonary CT via Cross-Window Knowledge Distillation
by: Peng, Bo, et al.
Published: (2026)
by: Peng, Bo, et al.
Published: (2026)
Leveraging Multimodal CycleGAN for the Generation of Anatomically Accurate Synthetic CT Scans from MRIs
by: Crespi, Leonardo, et al.
Published: (2024)
by: Crespi, Leonardo, et al.
Published: (2024)
Leveraging Video Vision Transformer for Alzheimer's Disease Diagnosis from 3D Brain MRI
by: Akan, Taymaz, et al.
Published: (2025)
by: Akan, Taymaz, et al.
Published: (2025)
Ultrasound Report Generation with Multimodal Large Language Models for Standardized Texts
by: Ge, Peixuan, et al.
Published: (2025)
by: Ge, Peixuan, et al.
Published: (2025)
Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion
by: Zhou, Meng, et al.
Published: (2024)
by: Zhou, Meng, et al.
Published: (2024)
Replace-then-Perturb: Targeted Adversarial Attacks With Visual Reasoning for Vision-Language Models
by: Jang, Jonggyu, et al.
Published: (2024)
by: Jang, Jonggyu, et al.
Published: (2024)
Enhancing Community Vision Screening -- AI Driven Retinal Photography for Early Disease Detection and Patient Trust
by: Lei, Xiaofeng, et al.
Published: (2024)
by: Lei, Xiaofeng, et al.
Published: (2024)
Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance
by: Zhang, Weiyi, et al.
Published: (2024)
by: Zhang, Weiyi, et al.
Published: (2024)
Leveraging Scene Geometry and Depth Information for Robust Image Deraining
by: Xu, Ningning, et al.
Published: (2024)
by: Xu, Ningning, et al.
Published: (2024)
Reinforced Correlation Between Vision and Language for Precise Medical AI Assistant
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
SCKD: Semi-Supervised Cross-Modality Knowledge Distillation for 4D Radar Object Detection
by: Xu, Ruoyu, et al.
Published: (2024)
by: Xu, Ruoyu, et al.
Published: (2024)
Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
FD-SOS: Vision-Language Open-Set Detectors for Bone Fenestration and Dehiscence Detection from Intraoral Images
by: Elbatel, Marawan, et al.
Published: (2024)
by: Elbatel, Marawan, et al.
Published: (2024)
Enhancing Diagnostic Accuracy in Rare and Common Fundus Diseases with a Knowledge-Rich Vision-Language Model
by: Wang, Meng, et al.
Published: (2024)
by: Wang, Meng, et al.
Published: (2024)
Multimodal Fusion and Coherence Modeling for Video Topic Segmentation
by: Yu, Hai, et al.
Published: (2024)
by: Yu, Hai, et al.
Published: (2024)
Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative
by: Wang, Li, et al.
Published: (2026)
by: Wang, Li, et al.
Published: (2026)
LangMamba: A Language-driven Mamba Framework for Low-dose CT Denoising with Vision-language Models
by: Chen, Zhihao, et al.
Published: (2025)
by: Chen, Zhihao, et al.
Published: (2025)
SFT-KD-Recon: Learning a Student-friendly Teacher for Knowledge Distillation in Magnetic Resonance Image Reconstruction
by: Gayathri, Matcha Naga, et al.
Published: (2023)
by: Gayathri, Matcha Naga, et al.
Published: (2023)
Enhancing Synthetic CT from CBCT via Multimodal Fusion and End-To-End Registration
by: Tschuchnig, Maximilian, et al.
Published: (2025)
by: Tschuchnig, Maximilian, et al.
Published: (2025)
Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning
by: Suresh, Yogesh Thakku, et al.
Published: (2025)
by: Suresh, Yogesh Thakku, et al.
Published: (2025)
AMRG: Extend Vision Language Models for Automatic Mammography Report Generation
by: Sung, Nak-Jun, et al.
Published: (2025)
by: Sung, Nak-Jun, et al.
Published: (2025)
DINO-LG: Enhancing Vision Transformers with Label Guidance for Coronary Artery Calcium Detection
by: Gokmen, Mahmut S., et al.
Published: (2024)
by: Gokmen, Mahmut S., et al.
Published: (2024)
Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference
by: Yang, Yunxiang, et al.
Published: (2025)
by: Yang, Yunxiang, et al.
Published: (2025)
OrthoDoc: Multimodal Large Language Model for Assisting Diagnosis in Computed Tomography
by: Jin, Youzhu, et al.
Published: (2024)
by: Jin, Youzhu, et al.
Published: (2024)
Enhanced MRI Representation via Cross-series Masking
by: Wang, Churan, et al.
Published: (2024)
by: Wang, Churan, et al.
Published: (2024)
TexLiverNet: Leveraging Medical Knowledge and Spatial-Frequency Perception for Enhanced Liver Tumor Segmentation
by: Jiang, Xiaoyan, et al.
Published: (2024)
by: Jiang, Xiaoyan, et al.
Published: (2024)
Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model
by: Ramirez, David F., et al.
Published: (2026)
by: Ramirez, David F., et al.
Published: (2026)
DMVFC: Deep Learning Based Functionally Consistent Tractography Fiber Clustering Using Multimodal Diffusion MRI and Functional MRI
by: Guo, Bocheng, et al.
Published: (2025)
by: Guo, Bocheng, et al.
Published: (2025)
Potential of Multimodal Large Language Models for Data Mining of Medical Images and Free-text Reports
by: Zhang, Yutong, et al.
Published: (2024)
by: Zhang, Yutong, et al.
Published: (2024)
$ρ$-NeRF: Leveraging Attenuation Priors in Neural Radiance Field for 3D Computed Tomography Reconstruction
by: Zhou, Li, et al.
Published: (2024)
by: Zhou, Li, et al.
Published: (2024)
Leveraging Machine Learning for Early Detection of Lung Diseases
by: Rahmani, Bahareh, et al.
Published: (2025)
by: Rahmani, Bahareh, et al.
Published: (2025)
Similar Items
-
EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
by: Li, Yahui, et al.
Published: (2026) -
VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledge
by: Li, Zihan, et al.
Published: (2024) -
A Disease-Centric Vision-Language Foundation Model for Precision Oncology in Kidney Cancer
by: Tao, Yuhui, et al.
Published: (2025) -
Brain-Adapter: Enhancing Neurological Disorder Analysis with Adapter-Tuning Multimodal Large Language Models
by: Zhang, Jing, et al.
Published: (2025) -
Mammo-CLIP: Leveraging Contrastive Language-Image Pre-training (CLIP) for Enhanced Breast Cancer Diagnosis with Multi-view Mammography
by: Chen, Xuxin, et al.
Published: (2024)