Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Ruoyu, Yu, Tong, Wu, Junda, Liu, Yao, McAuley, Julian, Yao, Lina |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
by: Wu, Junda, et al.
Published: (2025)
by: Wu, Junda, et al.
Published: (2025)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026)
by: Wang, Chuhan, et al.
Published: (2026)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
by: Gu, Shutian, et al.
Published: (2026)
by: Gu, Shutian, et al.
Published: (2026)
PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior
by: Wu, Junda, et al.
Published: (2025)
by: Wu, Junda, et al.
Published: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
by: Jeon, Hyunsik, et al.
Published: (2025)
by: Jeon, Hyunsik, et al.
Published: (2025)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
by: Li, Xintong, et al.
Published: (2025)
by: Li, Xintong, et al.
Published: (2025)
LVCHAT: Facilitating Long Video Comprehension
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Imagery as Inquiry: Exploring A Multimodal Dataset for Conversational Recommendation
by: Yoon, Se-eun, et al.
Published: (2024)
by: Yoon, Se-eun, et al.
Published: (2024)
Compositional Zero-Shot Learning with Contextualized Cues and Adaptive Contrastive Training
by: Li, Yun, et al.
Published: (2024)
by: Li, Yun, et al.
Published: (2024)
Navigation with VLM framework: Towards Going to Any Language
by: Yin, Zecheng, et al.
Published: (2024)
by: Yin, Zecheng, et al.
Published: (2024)
Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model
by: Wang, Shijian, et al.
Published: (2024)
by: Wang, Shijian, et al.
Published: (2024)
Weakly Supervised Contrastive Adversarial Training for Learning Robust Features from Semi-supervised Data
by: Zhang, Lilin, et al.
Published: (2025)
by: Zhang, Lilin, et al.
Published: (2025)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
by: Yan, An, et al.
Published: (2024)
by: Yan, An, et al.
Published: (2024)
Knowledge-guided Causal Intervention for Weakly-supervised Object Localization
by: Shao, Feifei, et al.
Published: (2023)
by: Shao, Feifei, et al.
Published: (2023)
Multi-agent Traffic Prediction via Denoised Endpoint Distribution
by: Liu, Yao, et al.
Published: (2024)
by: Liu, Yao, et al.
Published: (2024)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
by: Zhao, Xunyi, et al.
Published: (2025)
by: Zhao, Xunyi, et al.
Published: (2025)
Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning
by: Wang, Wentao, et al.
Published: (2025)
by: Wang, Wentao, et al.
Published: (2025)
Weakly-supervised Contrastive Learning with Quantity Prompts for Moving Infrared Small Target Detection
by: Duan, Weiwei, et al.
Published: (2025)
by: Duan, Weiwei, et al.
Published: (2025)
Generalizable Synthetic Image Detection via Language-guided Contrastive Learning
by: Wu, Haiwei, et al.
Published: (2023)
by: Wu, Haiwei, et al.
Published: (2023)
Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation
by: Wang, Qian-Wei, et al.
Published: (2025)
by: Wang, Qian-Wei, et al.
Published: (2025)
CATALOG: A Camera Trap Language-guided Contrastive Learning Model
by: Santamaria, Julian D., et al.
Published: (2024)
by: Santamaria, Julian D., et al.
Published: (2024)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
by: Khaki, Samir, et al.
Published: (2025)
by: Khaki, Samir, et al.
Published: (2025)
Language-guided Open-world Video Anomaly Detection under Weak Supervision
by: Liu, Zihao, et al.
Published: (2025)
by: Liu, Zihao, et al.
Published: (2025)
Mutual Information guided Visual Contrastive Learning
by: Chen, Hanyang, et al.
Published: (2025)
by: Chen, Hanyang, et al.
Published: (2025)
Contrast-Phys+: Unsupervised and Weakly-supervised Video-based Remote Physiological Measurement via Spatiotemporal Contrast
by: Sun, Zhaodong, et al.
Published: (2023)
by: Sun, Zhaodong, et al.
Published: (2023)
Weakly-supervised Semantic Segmentation via Dual-stream Contrastive Learning of Cross-image Contextual Information
by: Lai, Qi, et al.
Published: (2024)
by: Lai, Qi, et al.
Published: (2024)
AdaFV: Rethinking of Visual-Language alignment for VLM acceleration
by: Han, Jiayi, et al.
Published: (2025)
by: Han, Jiayi, et al.
Published: (2025)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
by: Jha, Saurav, et al.
Published: (2024)
by: Jha, Saurav, et al.
Published: (2024)
CogVLM: Visual Expert for Pretrained Language Models
by: Wang, Weihan, et al.
Published: (2023)
by: Wang, Weihan, et al.
Published: (2023)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
Interactive Mars Image Content-Based Search with Interpretable Machine Learning
by: Vasu, Bhavan, et al.
Published: (2024)
by: Vasu, Bhavan, et al.
Published: (2024)
HCVP: Leveraging Hierarchical Contrastive Visual Prompt for Domain Generalization
by: Zhou, Guanglin, et al.
Published: (2024)
by: Zhou, Guanglin, et al.
Published: (2024)
A Fashion Item Recommendation Model in Hyperbolic Space
by: Shimizu, Ryotaro, et al.
Published: (2024)
by: Shimizu, Ryotaro, et al.
Published: (2024)
Contrastive Learning with Diffusion Features for Weakly Supervised Medical Image Segmentation
by: Zeng, Dewen, et al.
Published: (2025)
by: Zeng, Dewen, et al.
Published: (2025)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
by: Liu, Jiaxing, et al.
Published: (2026)
by: Liu, Jiaxing, et al.
Published: (2026)
Slimmable Networks for Contrastive Self-supervised Learning
by: Zhao, Shuai, et al.
Published: (2022)
by: Zhao, Shuai, et al.
Published: (2022)
TeaserGen: Generating Teasers for Long Documentaries
by: Xu, Weihan, et al.
Published: (2024)
by: Xu, Weihan, et al.
Published: (2024)
CogVLM2: Visual Language Models for Image and Video Understanding
by: Hong, Wenyi, et al.
Published: (2024)
by: Hong, Wenyi, et al.
Published: (2024)
SMC-NCA: Semantic-guided Multi-level Contrast for Semi-supervised Temporal Action Segmentation
by: Zhou, Feixiang, et al.
Published: (2023)
by: Zhou, Feixiang, et al.
Published: (2023)
Similar Items
-
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
by: Wu, Junda, et al.
Published: (2025) -
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026) -
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
by: Gu, Shutian, et al.
Published: (2026) -
PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior
by: Wu, Junda, et al.
Published: (2025) -
Visual Prompting in Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)