Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Wenyu, Liu, Sidun, Qiao, Peng, Dou, Yong, Hu, Tongrui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mono3R: Exploiting Monocular Cues for Geometric 3D Reconstruction
by: Li, Wenyu, et al.
Published: (2025)
by: Li, Wenyu, et al.
Published: (2025)
Regist3R: Incremental Registration with Stereo Foundation Model
by: Liu, Sidun, et al.
Published: (2025)
by: Liu, Sidun, et al.
Published: (2025)
AbsGS: Recovering Fine Details for 3D Gaussian Splatting
by: Ye, Zongxin, et al.
Published: (2024)
by: Ye, Zongxin, et al.
Published: (2024)
DistGrid: Scalable Scene Reconstruction with Distributed Multi-resolution Hash Grid
by: Liu, Sidun, et al.
Published: (2024)
by: Liu, Sidun, et al.
Published: (2024)
VoxNeuS: Enhancing Voxel-Based Neural Surface Reconstruction via Gradient Interpolation
by: Liu, Sidun, et al.
Published: (2024)
by: Liu, Sidun, et al.
Published: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
by: Liu, Haowei, et al.
Published: (2024)
by: Liu, Haowei, et al.
Published: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
by: Zhu, Lei, et al.
Published: (2025)
by: Zhu, Lei, et al.
Published: (2025)
P3P: Pseudo-3D Pre-training for Scaling 3D Voxel-based Masked Autoencoders
by: Chen, Xuechao, et al.
Published: (2024)
by: Chen, Xuechao, et al.
Published: (2024)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
by: Liu, Jiarun, et al.
Published: (2024)
by: Liu, Jiarun, et al.
Published: (2024)
Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
by: Sun, Peng, et al.
Published: (2026)
by: Sun, Peng, et al.
Published: (2026)
Efficient Vision-Language Pre-training by Cluster Masking
by: Wei, Zihao, et al.
Published: (2024)
by: Wei, Zihao, et al.
Published: (2024)
Multi-view Image Prompted Multi-view Diffusion for Improved 3D Generation
by: Kim, Seungwook, et al.
Published: (2024)
by: Kim, Seungwook, et al.
Published: (2024)
Universal Image Restoration Pre-training via Masked Degradation Classification
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
3D Scene Graph Guided Vision-Language Pre-training
by: Liu, Hao, et al.
Published: (2024)
by: Liu, Hao, et al.
Published: (2024)
MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis
by: Zhuang, Jiaxin, et al.
Published: (2024)
by: Zhuang, Jiaxin, et al.
Published: (2024)
360-Degree Full-view Image Segmentation by Spherical Convolution compatible with Large-scale Planar Pre-trained Models
by: Liu, Jingguo, et al.
Published: (2025)
by: Liu, Jingguo, et al.
Published: (2025)
MaskHOI: Robust 3D Hand-Object Interaction Estimation via Masked Pre-training
by: Xie, Yuechen, et al.
Published: (2025)
by: Xie, Yuechen, et al.
Published: (2025)
MIMIC: Mask Image Pre-training with Mix Contrastive Fine-tuning for Facial Expression Recognition
by: Zhang, Fan, et al.
Published: (2024)
by: Zhang, Fan, et al.
Published: (2024)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
by: Gao, Jin, et al.
Published: (2024)
by: Gao, Jin, et al.
Published: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
by: Yang, Chenyu, et al.
Published: (2024)
by: Yang, Chenyu, et al.
Published: (2024)
Dataset Ownership Verification for Pre-trained Masked Models
by: Xie, Yuechen, et al.
Published: (2025)
by: Xie, Yuechen, et al.
Published: (2025)
Boosting 3D Neuron Segmentation with 2D Vision Transformer Pre-trained on Natural Images
by: Cheng, Yik San, et al.
Published: (2024)
by: Cheng, Yik San, et al.
Published: (2024)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
by: Zou, Jialv, et al.
Published: (2024)
by: Zou, Jialv, et al.
Published: (2024)
Self Pre-training with Topology- and Spatiality-aware Masked Autoencoders for 3D Medical Image Segmentation
by: Gu, Pengfei, et al.
Published: (2024)
by: Gu, Pengfei, et al.
Published: (2024)
SM$^3$: Self-Supervised Multi-task Modeling with Multi-view 2D Images for Articulated Objects
by: Wang, Haowen, et al.
Published: (2024)
by: Wang, Haowen, et al.
Published: (2024)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
by: Liu, Jihao, et al.
Published: (2024)
by: Liu, Jihao, et al.
Published: (2024)
SyncHuman: Synchronizing 2D and 3D Generative Models for Single-view Human Reconstruction
by: Chen, Wenyue, et al.
Published: (2025)
by: Chen, Wenyue, et al.
Published: (2025)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
by: Zhang, Ziyang, et al.
Published: (2025)
by: Zhang, Ziyang, et al.
Published: (2025)
Self Pre-training with Adaptive Mask Autoencoders for Variable-Contrast 3D Medical Imaging
by: Das, Badhan Kumar, et al.
Published: (2025)
by: Das, Badhan Kumar, et al.
Published: (2025)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
by: Zhang, Duzhen, et al.
Published: (2025)
by: Zhang, Duzhen, et al.
Published: (2025)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
by: Tian, Yuxin, et al.
Published: (2024)
by: Tian, Yuxin, et al.
Published: (2024)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
by: Ren, Bin, et al.
Published: (2025)
by: Ren, Bin, et al.
Published: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
by: Zhou, Hantao, et al.
Published: (2024)
by: Zhou, Hantao, et al.
Published: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
by: Ma, Shuailei, et al.
Published: (2023)
by: Ma, Shuailei, et al.
Published: (2023)
Masked Two-channel Decoupling Framework for Incomplete Multi-view Weak Multi-label Learning
by: Liu, Chengliang, et al.
Published: (2024)
by: Liu, Chengliang, et al.
Published: (2024)
LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency
by: Guo, Zhongbin, et al.
Published: (2025)
by: Guo, Zhongbin, et al.
Published: (2025)
Data-efficient Event Camera Pre-training via Disentangled Masked Modeling
by: Huang, Zhenpeng, et al.
Published: (2024)
by: Huang, Zhenpeng, et al.
Published: (2024)
Efficient Transferability Assessment for Selection of Pre-trained Detectors
by: Wang, Zhao, et al.
Published: (2024)
by: Wang, Zhao, et al.
Published: (2024)
Boosting Image Restoration via Priors from Pre-trained Models
by: Xu, Xiaogang, et al.
Published: (2024)
by: Xu, Xiaogang, et al.
Published: (2024)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
by: Liu, Kangcheng, et al.
Published: (2023)
by: Liu, Kangcheng, et al.
Published: (2023)
Similar Items
-
Mono3R: Exploiting Monocular Cues for Geometric 3D Reconstruction
by: Li, Wenyu, et al.
Published: (2025) -
Regist3R: Incremental Registration with Stereo Foundation Model
by: Liu, Sidun, et al.
Published: (2025) -
AbsGS: Recovering Fine Details for 3D Gaussian Splatting
by: Ye, Zongxin, et al.
Published: (2024) -
DistGrid: Scalable Scene Reconstruction with Distributed Multi-resolution Hash Grid
by: Liu, Sidun, et al.
Published: (2024) -
VoxNeuS: Enhancing Voxel-Based Neural Surface Reconstruction via Gradient Interpolation
by: Liu, Sidun, et al.
Published: (2024)