Understanding Self-Supervised Pretraining with Part-Aware Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Jie, Qi, Jiyang, Ding, Mingyu, Chen, Xiaokang, Luo, Ping, Wang, Xinggang, Liu, Wenyu, Wang, Leye, Wang, Jingdong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoLE: Enhancing Human-centric Text-to-image Diffusion via Mixture of Low-rank Experts
di: Zhu, Jie, et al.
Pubblicazione: (2024)
di: Zhu, Jie, et al.
Pubblicazione: (2024)
A Unified Membership Inference Method for Visual Self-supervised Encoder via Part-aware Capability
di: Zhu, Jie, et al.
Pubblicazione: (2024)
di: Zhu, Jie, et al.
Pubblicazione: (2024)
A Unified and Scalable Membership Inference Method for Visual Self-supervised Encoder via Part-aware Capability
di: Zhu, Jie, et al.
Pubblicazione: (2025)
di: Zhu, Jie, et al.
Pubblicazione: (2025)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
di: Zhang, Wenrui, et al.
Pubblicazione: (2025)
di: Zhang, Wenrui, et al.
Pubblicazione: (2025)
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
di: Jiang, Haoyi, et al.
Pubblicazione: (2024)
di: Jiang, Haoyi, et al.
Pubblicazione: (2024)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
di: Hu, Bin, et al.
Pubblicazione: (2024)
di: Hu, Bin, et al.
Pubblicazione: (2024)
Auditing Data Provenance in Real-world Text-to-Image Diffusion Models for Privacy and Copyright Protection
di: Zhu, Jie, et al.
Pubblicazione: (2025)
di: Zhu, Jie, et al.
Pubblicazione: (2025)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
di: Zhu, Lianghui, et al.
Pubblicazione: (2024)
di: Zhu, Lianghui, et al.
Pubblicazione: (2024)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
di: Zou, Jialv, et al.
Pubblicazione: (2024)
di: Zou, Jialv, et al.
Pubblicazione: (2024)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
USP: Unified Self-Supervised Pretraining for Image Generation and Understanding
di: Chu, Xiangxiang, et al.
Pubblicazione: (2025)
di: Chu, Xiangxiang, et al.
Pubblicazione: (2025)
Causality-inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
di: Xiong, Haijun, et al.
Pubblicazione: (2024)
di: Xiong, Haijun, et al.
Pubblicazione: (2024)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
di: Zou, Jialv, et al.
Pubblicazione: (2025)
di: Zou, Jialv, et al.
Pubblicazione: (2025)
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
di: Zhao, Zhengqi, et al.
Pubblicazione: (2024)
di: Zhao, Zhengqi, et al.
Pubblicazione: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
DeltaMIL: Gated Memory Integration for Efficient and Discriminative Whole Slide Image Analysis
di: Zhu, Yueting, et al.
Pubblicazione: (2025)
di: Zhu, Yueting, et al.
Pubblicazione: (2025)
GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
di: Xu, Ziyang, et al.
Pubblicazione: (2024)
di: Xu, Ziyang, et al.
Pubblicazione: (2024)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
di: Li, Yingyue, et al.
Pubblicazione: (2025)
di: Li, Yingyue, et al.
Pubblicazione: (2025)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
di: Cheng, Tianheng, et al.
Pubblicazione: (2026)
di: Cheng, Tianheng, et al.
Pubblicazione: (2026)
GaitGS: Temporal Feature Learning in Granularity and Span Dimension for Gait Recognition
di: Xiong, Haijun, et al.
Pubblicazione: (2023)
di: Xiong, Haijun, et al.
Pubblicazione: (2023)
TriC-Motion: Tri-Domain Causal Modeling Grounded Text-to-Motion Generation
di: Cao, Yiyang, et al.
Pubblicazione: (2026)
di: Cao, Yiyang, et al.
Pubblicazione: (2026)
EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
di: Yao, Jingfeng, et al.
Pubblicazione: (2024)
Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
di: Xiong, Haijun, et al.
Pubblicazione: (2025)
di: Xiong, Haijun, et al.
Pubblicazione: (2025)
Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis
di: Huang, Chaoqin, et al.
Pubblicazione: (2026)
di: Huang, Chaoqin, et al.
Pubblicazione: (2026)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
di: Jiang, Bo, et al.
Pubblicazione: (2025)
di: Jiang, Bo, et al.
Pubblicazione: (2025)
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
di: Zhu, Jie, et al.
Pubblicazione: (2026)
di: Zhu, Jie, et al.
Pubblicazione: (2026)
SuperCLIP: CLIP with Simple Classification Supervision
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
di: Zhao, Weiheng, et al.
Pubblicazione: (2025)
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
di: Gao, Hao, et al.
Pubblicazione: (2026)
di: Gao, Hao, et al.
Pubblicazione: (2026)
SSPFormer: Self-Supervised Pretrained Transformer for MRI Images
di: Li, Jingkai, et al.
Pubblicazione: (2026)
di: Li, Jingkai, et al.
Pubblicazione: (2026)
Multiview Self-Representation Learning across Heterogeneous Views
di: Chen, Jie, et al.
Pubblicazione: (2026)
di: Chen, Jie, et al.
Pubblicazione: (2026)
Self-Supervised Facial Representation Learning with Facial Region Awareness
di: Gao, Zheng, et al.
Pubblicazione: (2024)
di: Gao, Zheng, et al.
Pubblicazione: (2024)
Seeing the Whole in the Parts in Self-Supervised Representation Learning
di: Aubret, Arthur, et al.
Pubblicazione: (2025)
di: Aubret, Arthur, et al.
Pubblicazione: (2025)
STP4D: Spatio-Temporal-Prompt Consistent Modeling for Text-to-4D Gaussian Splatting
di: Deng, Yunze, et al.
Pubblicazione: (2025)
di: Deng, Yunze, et al.
Pubblicazione: (2025)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
di: Li, Yongkang, et al.
Pubblicazione: (2024)
di: Li, Yongkang, et al.
Pubblicazione: (2024)
MS-DETR: Efficient DETR Training with Mixed Supervision
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
di: Zhao, Chuyang, et al.
Pubblicazione: (2024)
Self-Supervised Representation Learning with Meta Comprehensive Regularization
di: Guo, Huijie, et al.
Pubblicazione: (2024)
di: Guo, Huijie, et al.
Pubblicazione: (2024)
Image Clustering Algorithm Based on Self-Supervised Pretrained Models and Latent Feature Distribution Optimization
di: Zhu, Qiuyu, et al.
Pubblicazione: (2024)
di: Zhu, Qiuyu, et al.
Pubblicazione: (2024)
VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
di: Du, Sinan, et al.
Pubblicazione: (2025)
di: Du, Sinan, et al.
Pubblicazione: (2025)
Equivariant Representation Learning for Augmentation-based Self-Supervised Learning via Image Reconstruction
di: Wang, Qin, et al.
Pubblicazione: (2024)
di: Wang, Qin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MoLE: Enhancing Human-centric Text-to-image Diffusion via Mixture of Low-rank Experts
di: Zhu, Jie, et al.
Pubblicazione: (2024) -
A Unified Membership Inference Method for Visual Self-supervised Encoder via Part-aware Capability
di: Zhu, Jie, et al.
Pubblicazione: (2024) -
A Unified and Scalable Membership Inference Method for Visual Self-supervised Encoder via Part-aware Capability
di: Zhu, Jie, et al.
Pubblicazione: (2025) -
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
di: Zhang, Wenrui, et al.
Pubblicazione: (2025) -
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
di: Jiang, Haoyi, et al.
Pubblicazione: (2024)