Self-Supervised Multimodal Learning: A Survey
Fuente:
arXiv
Saved in:
| Main Authors: | Zong, Yongshuo, Mac Aodha, Oisin, Hospedales, Timothy |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
by: Zhao, Bingchen, et al.
Published: (2024)
by: Zhao, Bingchen, et al.
Published: (2024)
Memorized Images in Diffusion Models share a Subspace that can be Located and Deleted
by: Chavhan, Ruchika, et al.
Published: (2024)
by: Chavhan, Ruchika, et al.
Published: (2024)
VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning
by: Zong, Yongshuo, et al.
Published: (2024)
by: Zong, Yongshuo, et al.
Published: (2024)
Vision Learners Meet Web Image-Text Pairs
by: Zhao, Bingchen, et al.
Published: (2023)
by: Zhao, Bingchen, et al.
Published: (2023)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
by: Saha, Anisha, et al.
Published: (2026)
by: Saha, Anisha, et al.
Published: (2026)
Representational Difference Explanations
by: Kondapaneni, Neehar, et al.
Published: (2025)
by: Kondapaneni, Neehar, et al.
Published: (2025)
The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
by: Tsagkas, Nikolaos, et al.
Published: (2025)
by: Tsagkas, Nikolaos, et al.
Published: (2025)
Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
by: Wang, Ru, et al.
Published: (2025)
by: Wang, Ru, et al.
Published: (2025)
Self-Supervised Prompt Optimization
by: Xiang, Jinyu, et al.
Published: (2025)
by: Xiang, Jinyu, et al.
Published: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
by: Wang, Zhen, et al.
Published: (2025)
by: Wang, Zhen, et al.
Published: (2025)
Adaptive Self-Supervised Learning Strategies for Dynamic On-Device LLM Personalization
by: Mendoza, Rafael, et al.
Published: (2024)
by: Mendoza, Rafael, et al.
Published: (2024)
Large Multimodal Models for Low-Resource Languages: A Survey
by: Lupascu, Marian, et al.
Published: (2025)
by: Lupascu, Marian, et al.
Published: (2025)
RobustSentEmbed: Robust Sentence Embeddings Using Adversarial Self-Supervised Contrastive Learning
by: Asl, Javad Rafiei, et al.
Published: (2024)
by: Asl, Javad Rafiei, et al.
Published: (2024)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
by: Chuang, Yung-Sung, et al.
Published: (2025)
by: Chuang, Yung-Sung, et al.
Published: (2025)
Query-Guided Self-Supervised Summarization of Nursing Notes
by: Gao, Ya, et al.
Published: (2024)
by: Gao, Ya, et al.
Published: (2024)
Guided Self-Evolving LLMs with Minimal Human Supervision
by: Yu, Wenhao, et al.
Published: (2025)
by: Yu, Wenhao, et al.
Published: (2025)
Linear Complexity Self-Supervised Learning for Music Understanding with Random Quantizer
by: Vavaroutsos, Petros, et al.
Published: (2026)
by: Vavaroutsos, Petros, et al.
Published: (2026)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
by: Ding, Fei, et al.
Published: (2026)
by: Ding, Fei, et al.
Published: (2026)
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods
by: Sharma, Raghav, et al.
Published: (2025)
by: Sharma, Raghav, et al.
Published: (2025)
Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques
by: An, Jisu, et al.
Published: (2025)
by: An, Jisu, et al.
Published: (2025)
The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements
by: Zhao, Bingchen, et al.
Published: (2025)
by: Zhao, Bingchen, et al.
Published: (2025)
Guarding the Meaning: Self-Supervised Training for Semantic Robustness in Guard Models
by: Pinneri, Cristina, et al.
Published: (2025)
by: Pinneri, Cristina, et al.
Published: (2025)
Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination
by: Akter, Syeda Nahida, et al.
Published: (2024)
by: Akter, Syeda Nahida, et al.
Published: (2024)
From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary
by: Zheng, Qirui, et al.
Published: (2025)
by: Zheng, Qirui, et al.
Published: (2025)
Sample-efficient Integration of New Modalities into Large Language Models
by: İnce, Osman Batur, et al.
Published: (2025)
by: İnce, Osman Batur, et al.
Published: (2025)
Self-Supervised Time-Series Anomaly Detection Using Learnable Data Augmentation
by: Choi, Kukjin, et al.
Published: (2024)
by: Choi, Kukjin, et al.
Published: (2024)
Selection-p: Self-Supervised Task-Agnostic Prompt Compression for Faithfulness and Transferability
by: Chung, Tsz Ting, et al.
Published: (2024)
by: Chung, Tsz Ting, et al.
Published: (2024)
Factor Augmented Supervised Learning with Text Embeddings
by: Luo, Zhanye, et al.
Published: (2025)
by: Luo, Zhanye, et al.
Published: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
by: Sun, Hao
Published: (2024)
by: Sun, Hao
Published: (2024)
Reinforcement Learning Enhanced LLMs: A Survey
by: Wang, Shuhe, et al.
Published: (2024)
by: Wang, Shuhe, et al.
Published: (2024)
SuPreME: A Supervised Pre-training Framework for Multimodal ECG Representation Learning
by: Cai, Mingsheng, et al.
Published: (2025)
by: Cai, Mingsheng, et al.
Published: (2025)
MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection
by: Saha, Anisha, et al.
Published: (2025)
by: Saha, Anisha, et al.
Published: (2025)
Understanding World or Predicting Future? A Comprehensive Survey of World Models
by: Ding, Jingtao, et al.
Published: (2024)
by: Ding, Jingtao, et al.
Published: (2024)
Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning
by: Gundem, Korel, et al.
Published: (2025)
by: Gundem, Korel, et al.
Published: (2025)
Distantly-Supervised Joint Extraction with Noise-Robust Learning
by: Li, Yufei, et al.
Published: (2023)
by: Li, Yufei, et al.
Published: (2023)
Auto-ICL: In-Context Learning without Human Supervision
by: Yang, Jinghan, et al.
Published: (2023)
by: Yang, Jinghan, et al.
Published: (2023)
Investigating Semi-Supervised Learning Algorithms in Text Datasets
by: Kesgin, Himmet Toprak, et al.
Published: (2024)
by: Kesgin, Himmet Toprak, et al.
Published: (2024)
Aligning Human and Machine Attention for Enhanced Supervised Learning
by: Chriqui, Avihay, et al.
Published: (2025)
by: Chriqui, Avihay, et al.
Published: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
by: Zhang, Kaiyan, et al.
Published: (2025)
by: Zhang, Kaiyan, et al.
Published: (2025)
JTCSE: Joint Tensor-Modulus Constraints and Cross-Attention for Unsupervised Contrastive Learning of Sentence Embeddings
by: Zong, Tianyu, et al.
Published: (2025)
by: Zong, Tianyu, et al.
Published: (2025)
Similar Items
-
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
by: Zhao, Bingchen, et al.
Published: (2024) -
Memorized Images in Diffusion Models share a Subspace that can be Located and Deleted
by: Chavhan, Ruchika, et al.
Published: (2024) -
VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning
by: Zong, Yongshuo, et al.
Published: (2024) -
Vision Learners Meet Web Image-Text Pairs
by: Zhao, Bingchen, et al.
Published: (2023) -
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
by: Saha, Anisha, et al.
Published: (2026)