Advancing Video Self-Supervised Learning via Image Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Jingwei, Huang, Zhewei, Liu, Chang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ARCON: Advancing Auto-Regressive Continuation for Driving Videos
by: Ming, Ruibo, et al.
Published: (2024)
by: Ming, Ruibo, et al.
Published: (2024)
VideoSSR: Video Self-Supervised Reinforcement Learning
by: He, Zefeng, et al.
Published: (2025)
by: He, Zefeng, et al.
Published: (2025)
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
by: Wang, Zhao, et al.
Published: (2023)
by: Wang, Zhao, et al.
Published: (2023)
CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders
by: Ahamed, Shihab Aaqil, et al.
Published: (2025)
by: Ahamed, Shihab Aaqil, et al.
Published: (2025)
FSFM: A Generalizable Face Security Foundation Model via Self-Supervised Facial Representation Learning
by: Wang, Gaojian, et al.
Published: (2024)
by: Wang, Gaojian, et al.
Published: (2024)
Learning Robust Correlation with Foundation Model for Weakly-Supervised Few-Shot Segmentation
by: Huang, Xinyang, et al.
Published: (2024)
by: Huang, Xinyang, et al.
Published: (2024)
Self-Supervised Learning of Synapse Types from EM Images
by: Shetty, Aarav, et al.
Published: (2025)
by: Shetty, Aarav, et al.
Published: (2025)
SelfHVD: Self-Supervised Handheld Video Deblurring
by: Xu, Honglei, et al.
Published: (2025)
by: Xu, Honglei, et al.
Published: (2025)
EVDI++: Event-based Video Deblurring and Interpolation via Self-Supervised Learning
by: Zhang, Chi, et al.
Published: (2025)
by: Zhang, Chi, et al.
Published: (2025)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
by: Wang, Chenting, et al.
Published: (2025)
by: Wang, Chenting, et al.
Published: (2025)
Representing Part-Whole Hierarchies in Foundation Models by Learning Localizability, Composability, and Decomposability from Anatomy via Self-Supervision
by: Taher, Mohammad Reza Hosseinzadeh, et al.
Published: (2024)
by: Taher, Mohammad Reza Hosseinzadeh, et al.
Published: (2024)
Anomaly Detection in Electrocardiograms: Advancing Clinical Diagnosis Through Self-Supervised Learning
by: Jiang, Aofan, et al.
Published: (2024)
by: Jiang, Aofan, et al.
Published: (2024)
Detection of Underwater Multi-Targets Based on Self-Supervised Learning and Deformable Path Aggregation Feature Pyramid Network
by: Liu, Chang
Published: (2025)
by: Liu, Chang
Published: (2025)
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
by: Lin, Sihao, et al.
Published: (2025)
by: Lin, Sihao, et al.
Published: (2025)
MIRepNet: A Pipeline and Foundation Model for EEG-Based Motor Imagery Classification
by: Liu, Dingkun, et al.
Published: (2025)
by: Liu, Dingkun, et al.
Published: (2025)
Self-Supervised Video Desmoking for Laparoscopic Surgery
by: Wu, Renlong, et al.
Published: (2024)
by: Wu, Renlong, et al.
Published: (2024)
Self-Supervised Learning of Plant Image Representations
by: Moummad, Ilyass, et al.
Published: (2026)
by: Moummad, Ilyass, et al.
Published: (2026)
Equivariant Representation Learning for Augmentation-based Self-Supervised Learning via Image Reconstruction
by: Wang, Qin, et al.
Published: (2024)
by: Wang, Qin, et al.
Published: (2024)
Enhanced Self-Supervised Multi-Image Super-Resolution for Camera Array Images
by: Chen, Yating, et al.
Published: (2026)
by: Chen, Yating, et al.
Published: (2026)
BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis
by: Liu, Jiarun, et al.
Published: (2025)
by: Liu, Jiarun, et al.
Published: (2025)
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
by: Yang, Shu, et al.
Published: (2025)
by: Yang, Shu, et al.
Published: (2025)
Learning to Efficiently Adapt Foundation Models for Self-Supervised Endoscopic 3D Scene Reconstruction from Any Cameras
by: Cui, Beilei, et al.
Published: (2025)
by: Cui, Beilei, et al.
Published: (2025)
Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge
by: Liu, Jiaming, et al.
Published: (2026)
by: Liu, Jiaming, et al.
Published: (2026)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
by: Ren, Sucheng, et al.
Published: (2024)
by: Ren, Sucheng, et al.
Published: (2024)
ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders
by: Hernandez, Jefferson, et al.
Published: (2023)
by: Hernandez, Jefferson, et al.
Published: (2023)
Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models
by: Rafaeli, Osher, et al.
Published: (2026)
by: Rafaeli, Osher, et al.
Published: (2026)
Efficient Transfer Learning for Video-language Foundation Models
by: Chen, Haoxing, et al.
Published: (2024)
by: Chen, Haoxing, et al.
Published: (2024)
Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models
by: Saporta, Antoine, et al.
Published: (2026)
by: Saporta, Antoine, et al.
Published: (2026)
Vision Foundation Models in Medical Image Analysis: Advances and Challenges
by: Liang, Pengchen, et al.
Published: (2025)
by: Liang, Pengchen, et al.
Published: (2025)
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
by: Jiang, Haoyi, et al.
Published: (2024)
by: Jiang, Haoyi, et al.
Published: (2024)
VideoSAVi: Self-Aligned Video Language Models without Human Supervision
by: Kulkarni, Yogesh, et al.
Published: (2024)
by: Kulkarni, Yogesh, et al.
Published: (2024)
Generalized Semi-Supervised Learning via Self-Supervised Feature Adaptation
by: Liang, Jiachen, et al.
Published: (2024)
by: Liang, Jiachen, et al.
Published: (2024)
A Survey on Future Frame Synthesis: Bridging Deterministic and Generative Approaches
by: Ming, Ruibo, et al.
Published: (2024)
by: Ming, Ruibo, et al.
Published: (2024)
How Effective are Self-Supervised Models for Contact Identification in Videos
by: Gunawardhana, Malitha, et al.
Published: (2024)
by: Gunawardhana, Malitha, et al.
Published: (2024)
Self-Supervised Contrastive Learning for Multi-Label Images
by: Chen, Jiale
Published: (2025)
by: Chen, Jiale
Published: (2025)
Self-Supervised Alignment Learning for Medical Image Segmentation
by: Li, Haofeng, et al.
Published: (2024)
by: Li, Haofeng, et al.
Published: (2024)
Harnessing Text-to-Image Diffusion Models for Point Cloud Self-Supervised Learning
by: Chen, Yiyang, et al.
Published: (2025)
by: Chen, Yiyang, et al.
Published: (2025)
Advancing Weakly-Supervised Change Detection in Satellite Images via Adversarial Class Prompting
by: Zhao, Zhenghui, et al.
Published: (2025)
by: Zhao, Zhenghui, et al.
Published: (2025)
VibeFlow: Versatile Video Chroma-Lux Editing through Self-Supervised Learning
by: Li, Yifan, et al.
Published: (2026)
by: Li, Yifan, et al.
Published: (2026)
ViSS-R1: Self-Supervised Reinforcement Video Reasoning
by: Fang, Bo, et al.
Published: (2025)
by: Fang, Bo, et al.
Published: (2025)
Similar Items
-
ARCON: Advancing Auto-Regressive Continuation for Driving Videos
by: Ming, Ruibo, et al.
Published: (2024) -
VideoSSR: Video Self-Supervised Reinforcement Learning
by: He, Zefeng, et al.
Published: (2025) -
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
by: Wang, Zhao, et al.
Published: (2023) -
CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders
by: Ahamed, Shihab Aaqil, et al.
Published: (2025) -
FSFM: A Generalizable Face Security Foundation Model via Self-Supervised Facial Representation Learning
by: Wang, Gaojian, et al.
Published: (2024)