Contrastive Masked Autoencoders are Stronger Vision Learners
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Zhicheng, Jin, Xiaojie, Lu, Chengze, Hou, Qibin, Cheng, Ming-Ming, Fu, Dongmei, Shen, Xiaohui, Feng, Jiashi |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
par: Zhou, Yupeng, et autres
Publié: (2024)
par: Zhou, Yupeng, et autres
Publié: (2024)
PixelLM: Pixel Reasoning with Large Multimodal Model
par: Ren, Zhongwei, et autres
Publié: (2023)
par: Ren, Zhongwei, et autres
Publié: (2023)
SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners
par: Liang, Feng, et autres
Publié: (2022)
par: Liang, Feng, et autres
Publié: (2022)
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
par: Zeng, Quan-Sheng, et autres
Publié: (2024)
par: Zeng, Quan-Sheng, et autres
Publié: (2024)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
Learning with Unmasked Tokens Drives Stronger Vision Learners
par: Kim, Taekyung, et autres
Publié: (2023)
par: Kim, Taekyung, et autres
Publié: (2023)
Masked Autoencoders are Parameter-Efficient Federated Continual Learners
par: He, Yuchen, et autres
Publié: (2024)
par: He, Yuchen, et autres
Publié: (2024)
DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation
par: Yin, Bo-Wen, et autres
Publié: (2025)
par: Yin, Bo-Wen, et autres
Publié: (2025)
Traffic Scene Parsing through the TSP6K Dataset
par: Jiang, Peng-Tao, et autres
Publié: (2023)
par: Jiang, Peng-Tao, et autres
Publié: (2023)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
Masked Autoencoders for Microscopy are Scalable Learners of Cellular Biology
par: Kraus, Oren, et autres
Publié: (2024)
par: Kraus, Oren, et autres
Publié: (2024)
Efficient Masked Autoencoders with Self-Consistency
par: Li, Zhaowen, et autres
Publié: (2023)
par: Li, Zhaowen, et autres
Publié: (2023)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation
par: Yin, Bowen, et autres
Publié: (2023)
par: Yin, Bowen, et autres
Publié: (2023)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
Zone Evaluation: Revealing Spatial Bias in Object Detection
par: Zheng, Zhaohui, et autres
Publié: (2023)
par: Zheng, Zhaohui, et autres
Publié: (2023)
Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature Alignment
par: Zhang, Shi-Chen, et autres
Publié: (2025)
par: Zhang, Shi-Chen, et autres
Publié: (2025)
CrossKD: Cross-Head Knowledge Distillation for Object Detection
par: Wang, Jiabao, et autres
Publié: (2023)
par: Wang, Jiabao, et autres
Publié: (2023)
Sora Generates Videos with Stunning Geometrical Consistency
par: Li, Xuanyi, et autres
Publié: (2024)
par: Li, Xuanyi, et autres
Publié: (2024)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
par: Li, Yunheng, et autres
Publié: (2025)
par: Li, Yunheng, et autres
Publié: (2025)
Generative Multi-modal Models are Good Class-Incremental Learners
par: Cao, Xusheng, et autres
Publié: (2024)
par: Cao, Xusheng, et autres
Publié: (2024)
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
par: Zhou, Yupeng, et autres
Publié: (2023)
par: Zhou, Yupeng, et autres
Publié: (2023)
Referring Camouflaged Object Detection
par: Zhang, Xuying, et autres
Publié: (2023)
par: Zhang, Xuying, et autres
Publié: (2023)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
par: Ma, Fan, et autres
Publié: (2023)
par: Ma, Fan, et autres
Publié: (2023)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
par: Zhang, Haoji, et autres
Publié: (2025)
par: Zhang, Haoji, et autres
Publié: (2025)
Re-Aligning Language to Visual Objects with an Agentic Workflow
par: Chen, Yuming, et autres
Publié: (2025)
par: Chen, Yuming, et autres
Publié: (2025)
KAC: Kolmogorov-Arnold Classifier for Continual Learning
par: Hu, Yusong, et autres
Publié: (2025)
par: Hu, Yusong, et autres
Publié: (2025)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
par: Li, Yunheng, et autres
Publié: (2026)
par: Li, Yunheng, et autres
Publié: (2026)
OmniSegmentor: A Flexible Multi-Modal Learning Framework for Semantic Segmentation
par: Yin, Bo-Wen, et autres
Publié: (2025)
par: Yin, Bo-Wen, et autres
Publié: (2025)
YOLO-MS: Rethinking Multi-Scale Representation Learning for Real-time Object Detection
par: Chen, Yuming, et autres
Publié: (2023)
par: Chen, Yuming, et autres
Publié: (2023)
Towards Stable 3D Object Detection
par: Wang, Jiabao, et autres
Publié: (2024)
par: Wang, Jiabao, et autres
Publié: (2024)
Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
par: Shen, Tiancheng, et autres
Publié: (2024)
par: Shen, Tiancheng, et autres
Publié: (2024)
Initialize to Generalize: A Stronger Initialization Pipeline for Sparse-View 3DGS
par: Zhou, Feng, et autres
Publié: (2025)
par: Zhou, Feng, et autres
Publié: (2025)
Extending Video Masked Autoencoders to 128 frames
par: Gundavarapu, Nitesh Bharadwaj, et autres
Publié: (2024)
par: Gundavarapu, Nitesh Bharadwaj, et autres
Publié: (2024)
Classification Done Right for Vision-Language Pre-Training
par: Huang, Zilong, et autres
Publié: (2024)
par: Huang, Zilong, et autres
Publié: (2024)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
par: Liu, Jiazhen, et autres
Publié: (2025)
par: Liu, Jiazhen, et autres
Publié: (2025)
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
par: Ouyang, Ziheng, et autres
Publié: (2025)
par: Ouyang, Ziheng, et autres
Publié: (2025)
ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution
par: Wan, Yuhao, et autres
Publié: (2024)
par: Wan, Yuhao, et autres
Publié: (2024)
Rethinking Patch Dependence for Masked Autoencoders
par: Fu, Letian, et autres
Publié: (2024)
par: Fu, Letian, et autres
Publié: (2024)
VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
par: Ren, Zhongwei, et autres
Publié: (2025)
par: Ren, Zhongwei, et autres
Publié: (2025)
Documents similaires
-
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
par: Zhou, Yupeng, et autres
Publié: (2024) -
PixelLM: Pixel Reasoning with Large Multimodal Model
par: Ren, Zhongwei, et autres
Publié: (2023) -
SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners
par: Liang, Feng, et autres
Publié: (2022) -
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
par: Zeng, Quan-Sheng, et autres
Publié: (2024) -
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
par: Li, Yunheng, et autres
Publié: (2024)