CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Zhiyuan, Li, Jianjun, Li, Guohui, Huang, Kaiyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024)
por: Huang, Zilong, et al.
Publicado: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024)
por: Ma, Wenxuan, et al.
Publicado: (2024)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025)
por: Wu, Kepeng, et al.
Publicado: (2025)
CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation
por: Du, Yuxuan, et al.
Publicado: (2025)
por: Du, Yuxuan, et al.
Publicado: (2025)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
por: Pan, Jiadong, et al.
Publicado: (2025)
por: Pan, Jiadong, et al.
Publicado: (2025)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
EventLens: Leveraging Event-Aware Pretraining and Cross-modal Linking Enhances Visual Commonsense Reasoning
por: Ma, Mingjie, et al.
Publicado: (2024)
por: Ma, Mingjie, et al.
Publicado: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
por: Jiang, Haojun, et al.
Publicado: (2022)
por: Jiang, Haojun, et al.
Publicado: (2022)
Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
por: Yang, Juncheng, et al.
Publicado: (2024)
por: Yang, Juncheng, et al.
Publicado: (2024)
Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
por: Ma, Zhiyuan, et al.
Publicado: (2025)
por: Ma, Zhiyuan, et al.
Publicado: (2025)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
por: Zheng, Xuhui, et al.
Publicado: (2025)
por: Zheng, Xuhui, et al.
Publicado: (2025)
MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training
por: He, Xingyi, et al.
Publicado: (2025)
por: He, Xingyi, et al.
Publicado: (2025)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
por: Shen, Lefei, et al.
Publicado: (2025)
por: Shen, Lefei, et al.
Publicado: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025)
por: Jiang, Lei, et al.
Publicado: (2025)
Quantifying Cross-Modality Memorization in Vision-Language Models
por: Wen, Yuxin, et al.
Publicado: (2025)
por: Wen, Yuxin, et al.
Publicado: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
por: Bhaila, Karuna, et al.
Publicado: (2025)
por: Bhaila, Karuna, et al.
Publicado: (2025)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
por: Bakkali, Souhail, et al.
Publicado: (2023)
por: Bakkali, Souhail, et al.
Publicado: (2023)
Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification
por: Li, Yiqiao, et al.
Publicado: (2026)
por: Li, Yiqiao, et al.
Publicado: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
por: Kim, Sanghwan, et al.
Publicado: (2024)
por: Kim, Sanghwan, et al.
Publicado: (2024)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
por: Yao, Yuang, et al.
Publicado: (2025)
por: Yao, Yuang, et al.
Publicado: (2025)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
por: Hu, Panwen, et al.
Publicado: (2024)
por: Hu, Panwen, et al.
Publicado: (2024)
AttenST: A Training-Free Attention-Driven Style Transfer Framework with Pre-Trained Diffusion Models
por: Huang, Bo, et al.
Publicado: (2025)
por: Huang, Bo, et al.
Publicado: (2025)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
por: Liu, Han, et al.
Publicado: (2026)
por: Liu, Han, et al.
Publicado: (2026)
Adapting Pre-Trained Vision Models for Novel Instance Detection and Segmentation
por: Lu, Yangxiao, et al.
Publicado: (2024)
por: Lu, Yangxiao, et al.
Publicado: (2024)
Cross-Modal Few-Shot Learning: a Generative Transfer Learning Framework
por: Yang, Zhengwei, et al.
Publicado: (2024)
por: Yang, Zhengwei, et al.
Publicado: (2024)
Collaborative Low-Rank Adaptation for Pre-Trained Vision Transformers
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
MultiMedVision: Multi-Modal Medical Vision Framework
por: Li, Frank, et al.
Publicado: (2026)
por: Li, Frank, et al.
Publicado: (2026)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
por: Mi, Yachun, et al.
Publicado: (2025)
por: Mi, Yachun, et al.
Publicado: (2025)
Cross-Modal Conditioned Reconstruction for Language-guided Medical Image Segmentation
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
por: Huang, Xiaoshuang, et al.
Publicado: (2024)
Scaling Vision Pre-Training to 4K Resolution
por: Shi, Baifeng, et al.
Publicado: (2025)
por: Shi, Baifeng, et al.
Publicado: (2025)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
por: Wan, Zhongwei, et al.
Publicado: (2023)
por: Wan, Zhongwei, et al.
Publicado: (2023)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
por: Zhou, Yiyun, et al.
Publicado: (2025)
por: Zhou, Yiyun, et al.
Publicado: (2025)
Ejemplares similares
-
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024) -
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024) -
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026) -
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025) -
CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation
por: Du, Yuxuan, et al.
Publicado: (2025)