Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yuhan, Fu, Jingwen, Wu, Yang, Wu, Kangyi, Li, Pengna, Wu, Jiayi, Zhou, Sanping, Xin, Jingmin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
REGNav: Room Expert Guided Image-Goal Navigation
by: Li, Pengna, et al.
Published: (2025)
by: Li, Pengna, et al.
Published: (2025)
Camera-aware Label Refinement for Unsupervised Person Re-identification
by: Li, Pengna, et al.
Published: (2024)
by: Li, Pengna, et al.
Published: (2024)
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
by: Wu, Kangyi, et al.
Published: (2026)
by: Wu, Kangyi, et al.
Published: (2026)
SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation
by: Li, Pengna, et al.
Published: (2026)
by: Li, Pengna, et al.
Published: (2026)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
by: Wu, Kangyi, et al.
Published: (2025)
by: Wu, Kangyi, et al.
Published: (2025)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
by: Wu, Rining, et al.
Published: (2024)
by: Wu, Rining, et al.
Published: (2024)
Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
PromptMID: Modal Invariant Descriptors Based on Diffusion and Vision Foundation Models for Optical-SAR Image Matching
by: Nie, Han, et al.
Published: (2025)
by: Nie, Han, et al.
Published: (2025)
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
by: Lyu, Kailin, et al.
Published: (2026)
by: Lyu, Kailin, et al.
Published: (2026)
DAMap: Distance-aware MapNet for High Quality HD Map Construction
by: Dong, Jinpeng, et al.
Published: (2025)
by: Dong, Jinpeng, et al.
Published: (2025)
StructVPR++: Distill Structural and Semantic Knowledge with Weighting Samples for Visual Place Recognition
by: Shen, Yanqing, et al.
Published: (2025)
by: Shen, Yanqing, et al.
Published: (2025)
DistillMatch: Leveraging Knowledge Distillation from Vision Foundation Model for Multimodal Image Matching
by: Yang, Meng, et al.
Published: (2025)
by: Yang, Meng, et al.
Published: (2025)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
by: Wu, Yuxuan, et al.
Published: (2025)
by: Wu, Yuxuan, et al.
Published: (2025)
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
by: Liu, Zhen, et al.
Published: (2026)
by: Liu, Zhen, et al.
Published: (2026)
Bridge the Gap between SNN and ANN for Image Restoration
by: Su, Xin, et al.
Published: (2025)
by: Su, Xin, et al.
Published: (2025)
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
by: Wang, Sen, et al.
Published: (2025)
by: Wang, Sen, et al.
Published: (2025)
SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation
by: Wu, Yonghuang, et al.
Published: (2025)
by: Wu, Yonghuang, et al.
Published: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
Semantic-aware Representation Learning for Homography Estimation
by: Liu, Yuhan, et al.
Published: (2024)
by: Liu, Yuhan, et al.
Published: (2024)
CosmicMan: A Text-to-Image Foundation Model for Humans
by: Li, Shikai, et al.
Published: (2024)
by: Li, Shikai, et al.
Published: (2024)
VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
by: Sargent, Kyle, et al.
Published: (2025)
by: Sargent, Kyle, et al.
Published: (2025)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
by: Zhou, Jingyi, et al.
Published: (2024)
by: Zhou, Jingyi, et al.
Published: (2024)
Recurrent Aligned Network for Generalized Pedestrian Trajectory Prediction
by: Dong, Yonghao, et al.
Published: (2024)
by: Dong, Yonghao, et al.
Published: (2024)
Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification
by: Mahbod, Amirreza, et al.
Published: (2025)
by: Mahbod, Amirreza, et al.
Published: (2025)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
by: Jiang, Songtao, et al.
Published: (2025)
by: Jiang, Songtao, et al.
Published: (2025)
Mind the Gap: Continuous Magnification Sampling for Pathology Foundation Models
by: Möllers, Alexander, et al.
Published: (2026)
by: Möllers, Alexander, et al.
Published: (2026)
Categorical Knowledge Fused Recognition: Fusing Hierarchical Knowledge with Image Classification through Aligning and Deep Metric Learning
by: Zhao, Yunfeng, et al.
Published: (2024)
by: Zhao, Yunfeng, et al.
Published: (2024)
LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
by: Liang, Zhanhao, et al.
Published: (2026)
by: Liang, Zhanhao, et al.
Published: (2026)
Advancing Video Self-Supervised Learning via Image Foundation Models
by: Wu, Jingwei, et al.
Published: (2025)
by: Wu, Jingwei, et al.
Published: (2025)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
by: Chen, Zhe, et al.
Published: (2023)
by: Chen, Zhe, et al.
Published: (2023)
MM-Retinal: Knowledge-Enhanced Foundational Pretraining with Fundus Image-Text Expertise
by: Wu, Ruiqi, et al.
Published: (2024)
by: Wu, Ruiqi, et al.
Published: (2024)
Leveraging Diffusion Model and Image Foundation Model for Improved Correspondence Matching in Coronary Angiography
by: Zhao, Lin, et al.
Published: (2025)
by: Zhao, Lin, et al.
Published: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
by: Jiang, Dongzhi, et al.
Published: (2024)
by: Jiang, Dongzhi, et al.
Published: (2024)
Mind the Gap Between Prototypes and Images in Cross-domain Finetuning
by: Tian, Hongduan, et al.
Published: (2024)
by: Tian, Hongduan, et al.
Published: (2024)
TextRegion: Text-Aligned Region Tokens from Frozen Image-Text Models
by: Xiao, Yao, et al.
Published: (2025)
by: Xiao, Yao, et al.
Published: (2025)
Advancing Pre-trained Teacher: Towards Robust Feature Discrepancy for Anomaly Detection
by: Tang, Canhui, et al.
Published: (2024)
by: Tang, Canhui, et al.
Published: (2024)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
by: Gao, Ning, et al.
Published: (2024)
by: Gao, Ning, et al.
Published: (2024)
Labeled-to-Unlabeled Distribution Alignment for Partially-Supervised Multi-Organ Medical Image Segmentation
by: Jiang, Xixi, et al.
Published: (2024)
by: Jiang, Xixi, et al.
Published: (2024)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
by: Wei, Hao, et al.
Published: (2024)
by: Wei, Hao, et al.
Published: (2024)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
by: Wu, Daiqing, et al.
Published: (2025)
by: Wu, Daiqing, et al.
Published: (2025)
Similar Items
-
REGNav: Room Expert Guided Image-Goal Navigation
by: Li, Pengna, et al.
Published: (2025) -
Camera-aware Label Refinement for Unsupervised Person Re-identification
by: Li, Pengna, et al.
Published: (2024) -
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
by: Wu, Kangyi, et al.
Published: (2026) -
SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation
by: Li, Pengna, et al.
Published: (2026) -
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
by: Wu, Kangyi, et al.
Published: (2025)