Masked Autoencoders Are Effective Tokenizers for Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Hao, Han, Yujin, Chen, Fangyi, Li, Xiang, Wang, Yidong, Wang, Jindong, Wang, Ze, Liu, Zicheng, Zou, Difan, Raj, Bhiksha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Slight Corruption in Pre-training Data Makes Better Diffusion Models
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
por: Maduabuchi, Chika, et al.
Publicado: (2025)
por: Maduabuchi, Chika, et al.
Publicado: (2025)
An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning
por: Chen, Hao, et al.
Publicado: (2022)
por: Chen, Hao, et al.
Publicado: (2022)
Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?
por: Han, Yujin, et al.
Publicado: (2025)
por: Han, Yujin, et al.
Publicado: (2025)
ImageFolder: Autoregressive Image Generation with Folded Tokens
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Imprecise Label Learning: A Unified Framework for Learning with Various Imprecise Label Configurations
por: Chen, Hao, et al.
Publicado: (2023)
por: Chen, Hao, et al.
Publicado: (2023)
Completing Visual Objects via Bridging Generation and Segmentation
por: Li, Xiang, et al.
Publicado: (2023)
por: Li, Xiang, et al.
Publicado: (2023)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
por: Zhang, An, et al.
Publicado: (2024)
por: Zhang, An, et al.
Publicado: (2024)
Improving Masked Autoencoders by Learning Where to Mask
por: Chen, Haijian, et al.
Publicado: (2023)
por: Chen, Haijian, et al.
Publicado: (2023)
SIDE: Surrogate Conditional Data Extraction from Diffusion Models
por: Chen, Yunhao, et al.
Publicado: (2024)
por: Chen, Yunhao, et al.
Publicado: (2024)
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
por: Wei, Yujie, et al.
Publicado: (2025)
por: Wei, Yujie, et al.
Publicado: (2025)
Image Tokenizer Needs Post-Training
por: Qiu, Kai, et al.
Publicado: (2025)
por: Qiu, Kai, et al.
Publicado: (2025)
Impact of Noisy Supervision in Foundation Model Learning
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Diffusion Autoencoders are Scalable Image Tokenizers
por: Chen, Yinbo, et al.
Publicado: (2025)
por: Chen, Yinbo, et al.
Publicado: (2025)
Geometric Autoencoder for Diffusion Models
por: Liu, Hangyu, et al.
Publicado: (2026)
por: Liu, Hangyu, et al.
Publicado: (2026)
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
por: Miao, Zichen, et al.
Publicado: (2024)
por: Miao, Zichen, et al.
Publicado: (2024)
$\text{R}^2$-Bench: Benchmarking the Robustness of Referring Perception Models under Perturbations
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction
por: Chen, Weiming, et al.
Publicado: (2026)
por: Chen, Weiming, et al.
Publicado: (2026)
Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks
por: Chen, Hao, et al.
Publicado: (2023)
por: Chen, Hao, et al.
Publicado: (2023)
Efficient Masked Autoencoders with Self-Consistency
por: Li, Zhaowen, et al.
Publicado: (2023)
por: Li, Zhaowen, et al.
Publicado: (2023)
Conv-Adapter: Exploring Parameter Efficient Transfer Learning for ConvNets
por: Chen, Hao, et al.
Publicado: (2022)
por: Chen, Hao, et al.
Publicado: (2022)
HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal Model
por: Wang, Tao, et al.
Publicado: (2025)
por: Wang, Tao, et al.
Publicado: (2025)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
MARMOT: Masked Autoencoder for Modeling Transient Imaging
por: Shen, Siyuan, et al.
Publicado: (2025)
por: Shen, Siyuan, et al.
Publicado: (2025)
SARMAE: Masked Autoencoder for SAR Representation Learning
por: Liu, Danxu, et al.
Publicado: (2025)
por: Liu, Danxu, et al.
Publicado: (2025)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Rethinking Patch Dependence for Masked Autoencoders
por: Fu, Letian, et al.
Publicado: (2024)
por: Fu, Letian, et al.
Publicado: (2024)
Parallelized Autoregressive Visual Generation
por: Wang, Yuqing, et al.
Publicado: (2024)
por: Wang, Yuqing, et al.
Publicado: (2024)
ED-SAM: An Efficient Diffusion Sampling Approach to Domain Generalization in Vision-Language Foundation Models
por: Truong, Thanh-Dat, et al.
Publicado: (2024)
por: Truong, Thanh-Dat, et al.
Publicado: (2024)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
por: Wang, Xiaofeng, et al.
Publicado: (2024)
por: Wang, Xiaofeng, et al.
Publicado: (2024)
On the robustness of multimodal language model towards distractions
por: Liu, Ming, et al.
Publicado: (2025)
por: Liu, Ming, et al.
Publicado: (2025)
Medical Referring Image Segmentation via Next-Token Mask Prediction
por: Chen, Xinyu, et al.
Publicado: (2025)
por: Chen, Xinyu, et al.
Publicado: (2025)
ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
por: Wang, Lingfeng, et al.
Publicado: (2025)
por: Wang, Lingfeng, et al.
Publicado: (2025)
Masked Autoencoders are Parameter-Efficient Federated Continual Learners
por: He, Yuchen, et al.
Publicado: (2024)
por: He, Yuchen, et al.
Publicado: (2024)
V3D: Video Diffusion Models are Effective 3D Generators
por: Chen, Zilong, et al.
Publicado: (2024)
por: Chen, Zilong, et al.
Publicado: (2024)
Text-Guided Video Masked Autoencoder
por: Fan, David, et al.
Publicado: (2024)
por: Fan, David, et al.
Publicado: (2024)
Extracting Training Data from Unconditional Diffusion Models
por: Chen, Yunhao, et al.
Publicado: (2024)
por: Chen, Yunhao, et al.
Publicado: (2024)
MAEDiff: Masked Autoencoder-enhanced Diffusion Models for Unsupervised Anomaly Detection in Brain Images
por: Xu, Rui, et al.
Publicado: (2024)
por: Xu, Rui, et al.
Publicado: (2024)
Ejemplares similares
-
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
por: Chen, Hao, et al.
Publicado: (2024) -
Slight Corruption in Pre-training Data Makes Better Diffusion Models
por: Chen, Hao, et al.
Publicado: (2024) -
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
por: Li, Xiang, et al.
Publicado: (2024) -
Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
por: Maduabuchi, Chika, et al.
Publicado: (2025) -
An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning
por: Chen, Hao, et al.
Publicado: (2022)