PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zhong-Yu, Li, Yunheng, Fan, Deng-Ping, Cheng, Ming-Ming |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
by: Zeng, Quan-Sheng, et al.
Published: (2024)
by: Zeng, Quan-Sheng, et al.
Published: (2024)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
by: Li, Yunheng, et al.
Published: (2024)
by: Li, Yunheng, et al.
Published: (2024)
SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation
by: Yuan, Yike, et al.
Published: (2024)
by: Yuan, Yike, et al.
Published: (2024)
VasoMIM: Vascular Anatomy-Aware Masked Image Modeling for Vessel Segmentation
by: Huang, De-Xing, et al.
Published: (2025)
by: Huang, De-Xing, et al.
Published: (2025)
HybridMIM: A Hybrid Masked Image Modeling Framework for 3D Medical Image Segmentation
by: Xing, Zhaohu, et al.
Published: (2023)
by: Xing, Zhaohu, et al.
Published: (2023)
CtxMIM: Context-Enhanced Masked Image Modeling for Remote Sensing Image Understanding
by: Zhang, Mingming, et al.
Published: (2023)
by: Zhang, Mingming, et al.
Published: (2023)
AdvMIM: Adversarial Masked Image Modeling for Semi-Supervised Medical Image Segmentation
by: Zhu, Lei, et al.
Published: (2025)
by: Zhu, Lei, et al.
Published: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
by: Xie, Zequn, et al.
Published: (2026)
by: Xie, Zequn, et al.
Published: (2026)
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
by: Li, Yuxuan, et al.
Published: (2026)
by: Li, Yuxuan, et al.
Published: (2026)
Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature Alignment
by: Zhang, Shi-Chen, et al.
Published: (2025)
by: Zhang, Shi-Chen, et al.
Published: (2025)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
by: Li, Yunheng, et al.
Published: (2024)
by: Li, Yunheng, et al.
Published: (2024)
PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling
by: Lee, Junmyeong, et al.
Published: (2025)
by: Lee, Junmyeong, et al.
Published: (2025)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
by: Li, Yunheng, et al.
Published: (2025)
by: Li, Yunheng, et al.
Published: (2025)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
by: Shaker, Abdelrahman, et al.
Published: (2022)
by: Shaker, Abdelrahman, et al.
Published: (2022)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
by: Gao, Shanghua, et al.
Published: (2023)
by: Gao, Shanghua, et al.
Published: (2023)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
by: Chen, Jun, et al.
Published: (2022)
by: Chen, Jun, et al.
Published: (2022)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
by: Zeng, Quan-Sheng, et al.
Published: (2025)
by: Zeng, Quan-Sheng, et al.
Published: (2025)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
by: Li, Yunheng, et al.
Published: (2026)
by: Li, Yunheng, et al.
Published: (2026)
RAM++: Robust Representation Learning via Adaptive Mask for All-in-One Image Restoration
by: Zhang, Zilong, et al.
Published: (2025)
by: Zhang, Zilong, et al.
Published: (2025)
Concealed Object Detection
by: Fan, Deng-Ping, et al.
Published: (2021)
by: Fan, Deng-Ping, et al.
Published: (2021)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
by: Zou, Jialv, et al.
Published: (2024)
by: Zou, Jialv, et al.
Published: (2024)
DebSDF: Delving into the Details and Bias of Neural Indoor Scene Reconstruction
by: Xiao, Yuting, et al.
Published: (2023)
by: Xiao, Yuting, et al.
Published: (2023)
Salient Objects in Clutter
by: Fan, Deng-Ping, et al.
Published: (2021)
by: Fan, Deng-Ping, et al.
Published: (2021)
LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
by: Li, Yunheng, et al.
Published: (2026)
by: Li, Yunheng, et al.
Published: (2026)
Reconstruction Target Matters in Masked Image Modeling for Cross-Domain Few-Shot Learning
by: Ma, Ran, et al.
Published: (2024)
by: Ma, Ran, et al.
Published: (2024)
Context-measure: Contextualizing Metric for Camouflage
by: Wang, Chen-Yang, et al.
Published: (2025)
by: Wang, Chen-Yang, et al.
Published: (2025)
BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything Model
by: Song, Yiran, et al.
Published: (2024)
by: Song, Yiran, et al.
Published: (2024)
Delving into the Trajectory Long-tail Distribution for Muti-object Tracking
by: Chen, Sijia, et al.
Published: (2024)
by: Chen, Sijia, et al.
Published: (2024)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
by: Wang, Jiayu, et al.
Published: (2024)
by: Wang, Jiayu, et al.
Published: (2024)
Multi-Token Enhancing for Vision Representation Learning
by: Li, Zhong-Yu, et al.
Published: (2024)
by: Li, Zhong-Yu, et al.
Published: (2024)
Referring Camouflaged Object Detection
by: Zhang, Xuying, et al.
Published: (2023)
by: Zhang, Xuying, et al.
Published: (2023)
InstaInpaint: Instant 3D-Scene Inpainting with Masked Large Reconstruction Model
by: You, Junqi, et al.
Published: (2025)
by: You, Junqi, et al.
Published: (2025)
Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
by: Lai, Yuxiang, et al.
Published: (2025)
by: Lai, Yuxiang, et al.
Published: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
by: Zhao, Kai, et al.
Published: (2025)
by: Zhao, Kai, et al.
Published: (2025)
Enhancing Representations through Heterogeneous Self-Supervised Learning
by: Li, Zhong-Yu, et al.
Published: (2023)
by: Li, Zhong-Yu, et al.
Published: (2023)
Interactive Masked Image Modeling for Multimodal Object Detection in Remote Sensing
by: Vu, Minh-Duc, et al.
Published: (2024)
by: Vu, Minh-Duc, et al.
Published: (2024)
MARMOT: Masked Autoencoder for Modeling Transient Imaging
by: Shen, Siyuan, et al.
Published: (2025)
by: Shen, Siyuan, et al.
Published: (2025)
Exploring Deeper! Segment Anything Model with Depth Perception for Camouflaged Object Detection
by: Yu, Zhenni, et al.
Published: (2024)
by: Yu, Zhenni, et al.
Published: (2024)
Similar Items
-
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
by: Zeng, Quan-Sheng, et al.
Published: (2024) -
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
by: Li, Yunheng, et al.
Published: (2024) -
SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation
by: Yuan, Yike, et al.
Published: (2024) -
VasoMIM: Vascular Anatomy-Aware Masked Image Modeling for Vessel Segmentation
by: Huang, De-Xing, et al.
Published: (2025) -
HybridMIM: A Hybrid Masked Image Modeling Framework for 3D Medical Image Segmentation
by: Xing, Zhaohu, et al.
Published: (2023)