A Two-Stage Progressive Pre-training using Multi-Modal Contrastive Masked Autoencoders
Fuente:
arXiv
Salvato in:
| Autori principali: | Jamal, Muhammad Abdullah, Mohareri, Omid |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking RGB-D Fusion for Semantic Segmentation in Surgical Datasets
di: Jamal, Muhammad Abdullah, et al.
Pubblicazione: (2024)
di: Jamal, Muhammad Abdullah, et al.
Pubblicazione: (2024)
VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery
di: Honarmand, Mohammadmahdi, et al.
Pubblicazione: (2024)
di: Honarmand, Mohammadmahdi, et al.
Pubblicazione: (2024)
On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training
di: Han, John J., et al.
Pubblicazione: (2026)
di: Han, John J., et al.
Pubblicazione: (2026)
Multi-view Video-Pose Pretraining for Operating Room Surgical Activity Recognition
di: Hamoud, Idris, et al.
Pubblicazione: (2025)
di: Hamoud, Idris, et al.
Pubblicazione: (2025)
SurgLaVi: Large-Scale Hierarchical Dataset for Surgical Vision-Language Representation Learning
di: Perez, Alejandra, et al.
Pubblicazione: (2025)
di: Perez, Alejandra, et al.
Pubblicazione: (2025)
AdaEmbed: Semi-supervised Domain Adaptation in the Embedding Space
di: Mottaghi, Ali, et al.
Pubblicazione: (2024)
di: Mottaghi, Ali, et al.
Pubblicazione: (2024)
SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning
di: Perez, Alejandra, et al.
Pubblicazione: (2026)
di: Perez, Alejandra, et al.
Pubblicazione: (2026)
A Two-Stage Masked Autoencoder Based Network for Indoor Depth Completion
di: Sun, Kailai, et al.
Pubblicazione: (2024)
di: Sun, Kailai, et al.
Pubblicazione: (2024)
Pan-cancer Histopathology WSI Pre-training with Position-aware Masked Autoencoder
di: Wu, Kun, et al.
Pubblicazione: (2024)
di: Wu, Kun, et al.
Pubblicazione: (2024)
$\mathsf{CSMAE~}$:~Cataract Surgical Masked Autoencoder (MAE) based Pre-training
di: Shah, Nisarg A., et al.
Pubblicazione: (2025)
di: Shah, Nisarg A., et al.
Pubblicazione: (2025)
Self Pre-training with Adaptive Mask Autoencoders for Variable-Contrast 3D Medical Imaging
di: Das, Badhan Kumar, et al.
Pubblicazione: (2025)
di: Das, Badhan Kumar, et al.
Pubblicazione: (2025)
MultiMAE Meets Earth Observation: Pre-training Multi-modal Multi-task Masked Autoencoders for Earth Observation Tasks
di: Sosa, Jose, et al.
Pubblicazione: (2025)
di: Sosa, Jose, et al.
Pubblicazione: (2025)
Multimodal Masked Autoencoder Pre-training for 3D MRI-Based Brain Tumor Analysis with Missing Modalities
di: Robinet, Lucas, et al.
Pubblicazione: (2025)
di: Robinet, Lucas, et al.
Pubblicazione: (2025)
How Effective is Pre-training of Large Masked Autoencoders for Downstream Earth Observation Tasks?
di: Sosa, Jose, et al.
Pubblicazione: (2024)
di: Sosa, Jose, et al.
Pubblicazione: (2024)
Contrastive Masked Autoencoders are Stronger Vision Learners
di: Huang, Zhicheng, et al.
Pubblicazione: (2022)
di: Huang, Zhicheng, et al.
Pubblicazione: (2022)
Surgical Tattoos in Infrared: A Dataset for Quantifying Tissue Tracking and Mapping
di: Schmidt, Adam, et al.
Pubblicazione: (2023)
di: Schmidt, Adam, et al.
Pubblicazione: (2023)
Multi-Modal Soccer Scene Analysis with Masked Pre-Training
di: Peral, Marc, et al.
Pubblicazione: (2025)
di: Peral, Marc, et al.
Pubblicazione: (2025)
MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2025)
di: Erdur, Ayhan Can, et al.
Pubblicazione: (2025)
Self-supervised Learning via Cluster Distance Prediction for Operating Room Context Awareness
di: Hamoud, Idris, et al.
Pubblicazione: (2024)
di: Hamoud, Idris, et al.
Pubblicazione: (2024)
Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception
di: Lu, Jingpei, et al.
Pubblicazione: (2026)
di: Lu, Jingpei, et al.
Pubblicazione: (2026)
Learning from the Right Patches: A Two-Stage Wavelet-Driven Masked Autoencoder for Histopathology Representation Learning
di: Younis, Raneen, et al.
Pubblicazione: (2025)
di: Younis, Raneen, et al.
Pubblicazione: (2025)
Code and Pixels: Multi-Modal Contrastive Pre-training for Enhanced Tabular Data Analysis
di: Roy, Kankana, et al.
Pubblicazione: (2025)
di: Roy, Kankana, et al.
Pubblicazione: (2025)
BEV-MAE: Bird's Eye View Masked Autoencoders for Point Cloud Pre-training in Autonomous Driving Scenarios
di: Lin, Zhiwei, et al.
Pubblicazione: (2022)
di: Lin, Zhiwei, et al.
Pubblicazione: (2022)
SelfMedHPM: Self Pre-training With Hard Patches Mining Masked Autoencoders For Medical Image Segmentation
di: Lv, Yunhao, et al.
Pubblicazione: (2025)
di: Lv, Yunhao, et al.
Pubblicazione: (2025)
MIMIC: Mask Image Pre-training with Mix Contrastive Fine-tuning for Facial Expression Recognition
di: Zhang, Fan, et al.
Pubblicazione: (2024)
di: Zhang, Fan, et al.
Pubblicazione: (2024)
Focus on Texture: Rethinking Pre-training in Masked Autoencoders for Medical Image Classification
di: Madan, Chetan, et al.
Pubblicazione: (2025)
di: Madan, Chetan, et al.
Pubblicazione: (2025)
Masked Autoencoder Self Pre-Training for Defect Detection in Microelectronics
di: Röhrich, Nikolai, et al.
Pubblicazione: (2025)
di: Röhrich, Nikolai, et al.
Pubblicazione: (2025)
P3P: Pseudo-3D Pre-training for Scaling 3D Voxel-based Masked Autoencoders
di: Chen, Xuechao, et al.
Pubblicazione: (2024)
di: Chen, Xuechao, et al.
Pubblicazione: (2024)
Tracking and Mapping in Medical Computer Vision: A Review
di: Schmidt, Adam, et al.
Pubblicazione: (2023)
di: Schmidt, Adam, et al.
Pubblicazione: (2023)
Self Pre-training with Topology- and Spatiality-aware Masked Autoencoders for 3D Medical Image Segmentation
di: Gu, Pengfei, et al.
Pubblicazione: (2024)
di: Gu, Pengfei, et al.
Pubblicazione: (2024)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
di: Zheng, Xuhui, et al.
Pubblicazione: (2025)
di: Zheng, Xuhui, et al.
Pubblicazione: (2025)
Emerging Property of Masked Token for Effective Pre-training
di: Choi, Hyesong, et al.
Pubblicazione: (2024)
di: Choi, Hyesong, et al.
Pubblicazione: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
SCARED-C: Corrected Camera Poses for Endoscopic Depth Estimation
di: Han, John J., et al.
Pubblicazione: (2026)
di: Han, John J., et al.
Pubblicazione: (2026)
Dataset Ownership Verification for Pre-trained Masked Models
di: Xie, Yuechen, et al.
Pubblicazione: (2025)
di: Xie, Yuechen, et al.
Pubblicazione: (2025)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
CMViM: Contrastive Masked Vim Autoencoder for 3D Multi-modal Representation Learning for AD classification
di: Yang, Guangqian, et al.
Pubblicazione: (2024)
di: Yang, Guangqian, et al.
Pubblicazione: (2024)
Contrastive Language Video Time Pre-training
di: Liu, Hengyue, et al.
Pubblicazione: (2024)
di: Liu, Hengyue, et al.
Pubblicazione: (2024)
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
di: Peng, Bowen, et al.
Pubblicazione: (2026)
di: Peng, Bowen, et al.
Pubblicazione: (2026)
Multi-hop Relational Contrastive Learning: Extending Spatial Contrastive Pre-training Beyond Pairwise Relations
di: Ahmed, Sheikh Tanvir, et al.
Pubblicazione: (2026)
di: Ahmed, Sheikh Tanvir, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Rethinking RGB-D Fusion for Semantic Segmentation in Surgical Datasets
di: Jamal, Muhammad Abdullah, et al.
Pubblicazione: (2024) -
VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery
di: Honarmand, Mohammadmahdi, et al.
Pubblicazione: (2024) -
On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training
di: Han, John J., et al.
Pubblicazione: (2026) -
Multi-view Video-Pose Pretraining for Operating Room Surgical Activity Recognition
di: Hamoud, Idris, et al.
Pubblicazione: (2025) -
SurgLaVi: Large-Scale Hierarchical Dataset for Surgical Vision-Language Representation Learning
di: Perez, Alejandra, et al.
Pubblicazione: (2025)