Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiaxi, Hu, Wenhui, Liu, Xueyang, Wu, Beihu, Qiu, Yuting, Cai, YingYing |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
par: Kritikos, Antonios, et autres
Publié: (2026)
par: Kritikos, Antonios, et autres
Publié: (2026)
Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix
par: Liu, Peng
Publié: (2021)
par: Liu, Peng
Publié: (2021)
Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion
par: Mistretta, Marco, et autres
Publié: (2025)
par: Mistretta, Marco, et autres
Publié: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
Distilling Cross-Modal Knowledge via Feature Disentanglement
par: Liu, Junhong, et autres
Publié: (2025)
par: Liu, Junhong, et autres
Publié: (2025)
CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation
par: Govindarajan, Hariprasath, et autres
Publié: (2025)
par: Govindarajan, Hariprasath, et autres
Publié: (2025)
Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality
par: Wang, Hu, et autres
Publié: (2023)
par: Wang, Hu, et autres
Publié: (2023)
Preserving Cross-Modal Stability for Visual Unlearning in Multimodal Scenarios
par: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Publié: (2025)
par: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Publié: (2025)
CCSD: Cross-Modal Compositional Self-Distillation for Robust Brain Tumor Segmentation with Missing Modalities
par: Xie, Dongqing, et autres
Publié: (2025)
par: Xie, Dongqing, et autres
Publié: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
par: Liu, Tengfei, et autres
Publié: (2024)
par: Liu, Tengfei, et autres
Publié: (2024)
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
par: Zhang, Mengmeng, et autres
Publié: (2026)
par: Zhang, Mengmeng, et autres
Publié: (2026)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
DOGR: Towards Versatile Visual Document Grounding and Referring
par: Zhou, Yinan, et autres
Publié: (2024)
par: Zhou, Yinan, et autres
Publié: (2024)
Difficulty-guided Sampling: Bridging the Target Gap between Dataset Distillation and Downstream Tasks
par: Li, Mingzhuo, et autres
Publié: (2026)
par: Li, Mingzhuo, et autres
Publié: (2026)
Asymmetric Cross-Modal Knowledge Distillation: Bridging Modalities with Weak Semantic Consistency
par: Wei, Riling, et autres
Publié: (2025)
par: Wei, Riling, et autres
Publié: (2025)
VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition
par: Yu, Ying, et autres
Publié: (2025)
par: Yu, Ying, et autres
Publié: (2025)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
par: Lei, Youbo, et autres
Publié: (2023)
par: Lei, Youbo, et autres
Publié: (2023)
Bridging the Gap in Missing Modalities: Leveraging Knowledge Distillation and Style Matching for Brain Tumor Segmentation
par: Zhu, Shenghao, et autres
Publié: (2025)
par: Zhu, Shenghao, et autres
Publié: (2025)
Bridging the Intent Gap: Knowledge-Enhanced Visual Generation
par: Cheng, Yi, et autres
Publié: (2024)
par: Cheng, Yi, et autres
Publié: (2024)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
par: Liu, Yufang, et autres
Publié: (2025)
par: Liu, Yufang, et autres
Publié: (2025)
Bridging the Gap: Multi-Level Cross-Modality Joint Alignment for Visible-Infrared Person Re-Identification
par: Liang, Tengfei, et autres
Publié: (2023)
par: Liang, Tengfei, et autres
Publié: (2023)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
par: Dai, Ming, et autres
Publié: (2024)
par: Dai, Ming, et autres
Publié: (2024)
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
par: Lu, Wenting, et autres
Publié: (2026)
par: Lu, Wenting, et autres
Publié: (2026)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
par: Xu, Dunyuan, et autres
Publié: (2024)
par: Xu, Dunyuan, et autres
Publié: (2024)
Bridging the Visual-to-Physical Gap: Physically Aligned Representations for Fall Risk Analysis
par: Zhang, Xianqi
Publié: (2026)
par: Zhang, Xianqi
Publié: (2026)
Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning
par: Jia, Haonan, et autres
Publié: (2026)
par: Jia, Haonan, et autres
Publié: (2026)
Doctoral Thesis: Geometric Deep Learning For Camera Pose Prediction, Registration, Depth Estimation, and 3D Reconstruction
par: Kang, Xueyang
Publié: (2025)
par: Kang, Xueyang
Publié: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)
par: Li, Zejun, et autres
Publié: (2024)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
par: Feng, Qianhan, et autres
Publié: (2024)
par: Feng, Qianhan, et autres
Publié: (2024)
Depth-Guided Self-Supervised Human Keypoint Detection via Cross-Modal Distillation
par: Anand, Aman, et autres
Publié: (2024)
par: Anand, Aman, et autres
Publié: (2024)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
par: Zhao, Haoyu, et autres
Publié: (2024)
par: Zhao, Haoyu, et autres
Publié: (2024)
Diffusion Features to Bridge Domain Gap for Semantic Segmentation
par: Ji, Yuxiang, et autres
Publié: (2024)
par: Ji, Yuxiang, et autres
Publié: (2024)
Variational Adapter for Cross-modal Similarity Representation
par: Wei, WenZhang, et autres
Publié: (2026)
par: Wei, WenZhang, et autres
Publié: (2026)
AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
par: Man, Yuanbin, et autres
Publié: (2024)
par: Man, Yuanbin, et autres
Publié: (2024)
xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR
par: Pathmanathan, Thenukan, et autres
Publié: (2026)
par: Pathmanathan, Thenukan, et autres
Publié: (2026)
VLA-Mark: A cross modal watermark for large vision-language alignment model
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection
par: Ning, Kanglin, et autres
Publié: (2026)
par: Ning, Kanglin, et autres
Publié: (2026)
CoMoTo: Unpaired Cross-Modal Lesion Distillation Improves Breast Lesion Detection in Tomosynthesis
par: Alberb, Muhammad, et autres
Publié: (2024)
par: Alberb, Muhammad, et autres
Publié: (2024)
Documents similaires
-
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
par: Kritikos, Antonios, et autres
Publié: (2026) -
Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix
par: Liu, Peng
Publié: (2021) -
Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion
par: Mistretta, Marco, et autres
Publié: (2025) -
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025) -
Distilling Cross-Modal Knowledge via Feature Disentanglement
par: Liu, Junhong, et autres
Publié: (2025)