WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhuang, Shaobin, Guo, Yiwei, Fu, Canmiao, Huang, Zhipeng, Tian, Zeyue, Li, Xiaohui, Wang, Fangyikang, Zhang, Ying, Li, Chen, Wang, Yali
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914315160780800
author Zhuang, Shaobin
Guo, Yiwei
Fu, Canmiao
Huang, Zhipeng
Tian, Zeyue
Li, Xiaohui
Wang, Fangyikang
Zhang, Ying
Li, Chen
Wang, Yali
author_facet Zhuang, Shaobin
Guo, Yiwei
Fu, Canmiao
Huang, Zhipeng
Tian, Zeyue
Li, Xiaohui
Wang, Fangyikang
Zhang, Ying
Li, Chen
Wang, Yali
contents Visual tokenizer is a critical component for vision generation. However, the existing tokenizers often face unsatisfactory trade-off between compression ratios and reconstruction fidelity. To fill this gap, we introduce a powerful and concise WeTok tokenizer, which surpasses the previous leading tokenizers via two core innovations. (1) Group-wise lookup-free Quantization (GQ). We partition the latent features into groups, and perform lookup-free quantization for each group. As a result, GQ can efficiently overcome memory and computation limitations of prior tokenizers, while achieving a reconstruction breakthrough with more scalable codebooks. (2) Generative Decoder (GD). Different from prior tokenizers, we introduce a generative decoder with a prior of extra noise variable. In this case, GD can probabilistically model the distribution of visual data conditioned on discrete tokens, allowing WeTok to reconstruct visual details, especially at high compression ratio. On the ImageNet 50k validation set, at a high-fidelity setting, WeTok achieves a record-low zero-shot rFID of 0.12, outperforming leading continuous tokenizers like FLUX-VAE (0.18) and SD-VAE 3.5 (0.19) with 400% compression ratio. Furthermore, in a high-compression regime, WeTok achieves a zero-shot rFID of 3.49 at a 768$\times$ compression ratio, substantially surpassing Cosmos, which scores 4.57 at only 50% our compression ratio. Code and models are available: https://github.com/zhuangshaobin/WeTok.
format Preprint
id arxiv_https___arxiv_org_abs_2508_05599
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
Zhuang, Shaobin
Guo, Yiwei
Fu, Canmiao
Huang, Zhipeng
Tian, Zeyue
Li, Xiaohui
Wang, Fangyikang
Zhang, Ying
Li, Chen
Wang, Yali
Computer Vision and Pattern Recognition
Visual tokenizer is a critical component for vision generation. However, the existing tokenizers often face unsatisfactory trade-off between compression ratios and reconstruction fidelity. To fill this gap, we introduce a powerful and concise WeTok tokenizer, which surpasses the previous leading tokenizers via two core innovations. (1) Group-wise lookup-free Quantization (GQ). We partition the latent features into groups, and perform lookup-free quantization for each group. As a result, GQ can efficiently overcome memory and computation limitations of prior tokenizers, while achieving a reconstruction breakthrough with more scalable codebooks. (2) Generative Decoder (GD). Different from prior tokenizers, we introduce a generative decoder with a prior of extra noise variable. In this case, GD can probabilistically model the distribution of visual data conditioned on discrete tokens, allowing WeTok to reconstruct visual details, especially at high compression ratio. On the ImageNet 50k validation set, at a high-fidelity setting, WeTok achieves a record-low zero-shot rFID of 0.12, outperforming leading continuous tokenizers like FLUX-VAE (0.18) and SD-VAE 3.5 (0.19) with 400% compression ratio. Furthermore, in a high-compression regime, WeTok achieves a zero-shot rFID of 3.49 at a 768$\times$ compression ratio, substantially surpassing Cosmos, which scores 4.57 at only 50% our compression ratio. Code and models are available: https://github.com/zhuangshaobin/WeTok.
title WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2508.05599