Turbo your multi-modal classification with contrastive learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhiyu, Liu, Da, Liu, Shengqiang, Wang, Anna, Gao, Jie, Li, Yali |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
by: Wang, Anna, et al.
Published: (2024)
by: Wang, Anna, et al.
Published: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
by: Liu, Shengqiang, et al.
Published: (2024)
by: Liu, Shengqiang, et al.
Published: (2024)
Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion
by: Zhang, Ying, et al.
Published: (2025)
by: Zhang, Ying, et al.
Published: (2025)
Copycat vs. Original: Multi-modal Pretraining and Variable Importance in Box-office Prediction
by: Chao, Qin, et al.
Published: (2025)
by: Chao, Qin, et al.
Published: (2025)
Token-Level Contrastive Learning with Modality-Aware Prompting for Multimodal Intent Recognition
by: Zhou, Qianrui, et al.
Published: (2023)
by: Zhou, Qianrui, et al.
Published: (2023)
Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention
by: Liu, Moyang, et al.
Published: (2025)
by: Liu, Moyang, et al.
Published: (2025)
Exploring Modality Disruption in Multimodal Fake News Detection
by: Liu, Moyang, et al.
Published: (2025)
by: Liu, Moyang, et al.
Published: (2025)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Bipartite Patient-Modality Graph Learning with Event-Conditional Modelling of Censoring for Cancer Survival Prediction
by: Yue, Hailin, et al.
Published: (2025)
by: Yue, Hailin, et al.
Published: (2025)
Explore the Limits of Omni-modal Pretraining at Scale
by: Zhang, Yiyuan, et al.
Published: (2024)
by: Zhang, Yiyuan, et al.
Published: (2024)
M3ST-DTI: A multi-task learning model for drug-target interactions based on multi-modal features and multi-stage alignment
by: Li, Xiangyu, et al.
Published: (2025)
by: Li, Xiangyu, et al.
Published: (2025)
PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
by: Wnag, Zining, et al.
Published: (2024)
by: Wnag, Zining, et al.
Published: (2024)
MCIGLE: Multimodal Exemplar-Free Class-Incremental Graph Learning
by: You, Haochen, et al.
Published: (2025)
by: You, Haochen, et al.
Published: (2025)
Balanced Multimodal Learning: An Unidirectional Dynamic Interaction Perspective
by: Wang, Shijie, et al.
Published: (2025)
by: Wang, Shijie, et al.
Published: (2025)
VDCook:DIY video data cook your MLLMs
by: Wu, Chengwei
Published: (2026)
by: Wu, Chengwei
Published: (2026)
FlexCache: Flexible Approximate Cache System for Video Diffusion
by: Sun, Desen, et al.
Published: (2024)
by: Sun, Desen, et al.
Published: (2024)
Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering
by: Sato, Yugen, et al.
Published: (2025)
by: Sato, Yugen, et al.
Published: (2025)
DS-HGCN: A Dual-Stream Hypergraph Convolutional Network for Predicting Student Engagement via Social Contagion
by: Fan, Ziyang, et al.
Published: (2025)
by: Fan, Ziyang, et al.
Published: (2025)
A Unified Evaluation Framework for Multi-Annotator Tendency Learning
by: Zhang, Liyun, et al.
Published: (2025)
by: Zhang, Liyun, et al.
Published: (2025)
OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models
by: Chen, Shengkai, et al.
Published: (2025)
by: Chen, Shengkai, et al.
Published: (2025)
CAMERA: Adapting to Semantic Camouflage in Unsupervised Text-Attributed Graph Fraud Detection
by: Pan, Junjun, et al.
Published: (2026)
by: Pan, Junjun, et al.
Published: (2026)
Federated Multi-Task Clustering
by: Dai, Suyan, et al.
Published: (2025)
by: Dai, Suyan, et al.
Published: (2025)
Vlogger: Make Your Dream A Vlog
by: Zhuang, Shaobin, et al.
Published: (2024)
by: Zhuang, Shaobin, et al.
Published: (2024)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
ReFiNe: Recursive Field Networks for Cross-modal Multi-scene Representation
by: Zakharov, Sergey, et al.
Published: (2024)
by: Zakharov, Sergey, et al.
Published: (2024)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
by: Fan, Yunfeng, et al.
Published: (2023)
by: Fan, Yunfeng, et al.
Published: (2023)
Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation
by: Lyu, Xiaosen, et al.
Published: (2025)
by: Lyu, Xiaosen, et al.
Published: (2025)
Zero-Shot Relational Learning for Multimodal Knowledge Graphs
by: Cai, Rui, et al.
Published: (2024)
by: Cai, Rui, et al.
Published: (2024)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
by: Fang, Wanlong, et al.
Published: (2025)
by: Fang, Wanlong, et al.
Published: (2025)
MultiWay-Adapater: Adapting large-scale multi-modal models for scalable image-text retrieval
by: Long, Zijun, et al.
Published: (2023)
by: Long, Zijun, et al.
Published: (2023)
Hybrid Feedback-Guided Optimal Learning for Wireless Interactive Panoramic Scene Delivery
by: Wu, Xiaoyi, et al.
Published: (2026)
by: Wu, Xiaoyi, et al.
Published: (2026)
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
by: Qian, Wenhao, et al.
Published: (2025)
by: Qian, Wenhao, et al.
Published: (2025)
Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design
by: Yang, Yuxuan, et al.
Published: (2026)
by: Yang, Yuxuan, et al.
Published: (2026)
OOD-GraphLLM: Graph Large Language Model for Out-of-Distribution Generalized Drug Synergy Prediction
by: Wang, Xin, et al.
Published: (2026)
by: Wang, Xin, et al.
Published: (2026)
Domain-Skewed Federated Learning with Feature Decoupling and Calibration
by: Wang, Huan, et al.
Published: (2026)
by: Wang, Huan, et al.
Published: (2026)
Detecting Multimedia Generated by Large AI Models: A Survey
by: Lin, Li, et al.
Published: (2024)
by: Lin, Li, et al.
Published: (2024)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection
by: Fan, Yunfeng, et al.
Published: (2023)
by: Fan, Yunfeng, et al.
Published: (2023)
Group Benefits Instances Selection for Data Purification
by: Cai, Zhenhuang, et al.
Published: (2024)
by: Cai, Zhenhuang, et al.
Published: (2024)
Training Data Efficiency in Multimodal Process Reward Models
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
Similar Items
-
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
by: Wang, Anna, et al.
Published: (2024) -
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
by: Liu, Shengqiang, et al.
Published: (2024) -
Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion
by: Zhang, Ying, et al.
Published: (2025) -
Copycat vs. Original: Multi-modal Pretraining and Variable Importance in Box-office Prediction
by: Chao, Qin, et al.
Published: (2025) -
Token-Level Contrastive Learning with Modality-Aware Prompting for Multimodal Intent Recognition
by: Zhou, Qianrui, et al.
Published: (2023)