NativeTok: Native Visual Tokenization for Improved Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Bin, Huang, Mengqi, Jia, Weinan, Mao, Zhendong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
D$^2$iT: Dynamic Diffusion Transformer for Accurate Image Generation
di: Jia, Weinan, et al.
Pubblicazione: (2025)
di: Jia, Weinan, et al.
Pubblicazione: (2025)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
di: Chen, Cong, et al.
Pubblicazione: (2025)
di: Chen, Cong, et al.
Pubblicazione: (2025)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025)
di: Lin, Yijing, et al.
Pubblicazione: (2025)
DSE-GAN: Dynamic Semantic Evolution Generative Adversarial Network for Text-to-Image Generation
di: Huang, Mengqi, et al.
Pubblicazione: (2022)
di: Huang, Mengqi, et al.
Pubblicazione: (2022)
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
di: Xiong, Tianwei, et al.
Pubblicazione: (2025)
di: Xiong, Tianwei, et al.
Pubblicazione: (2025)
MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
di: Jia, Weinan, et al.
Pubblicazione: (2025)
di: Jia, Weinan, et al.
Pubblicazione: (2025)
Native Audio-Visual Alignment for Generation
di: Ji, Longbin, et al.
Pubblicazione: (2026)
di: Ji, Longbin, et al.
Pubblicazione: (2026)
LongAnimation: Long Animation Generation with Dynamic Global-Local Memory
di: Chen, Nan, et al.
Pubblicazione: (2025)
di: Chen, Nan, et al.
Pubblicazione: (2025)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
di: Yue, Yang, et al.
Pubblicazione: (2026)
di: Yue, Yang, et al.
Pubblicazione: (2026)
DINO-Tok: Adapting DINO for Visual Tokenizers
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
di: Wu, Junfeng, et al.
Pubblicazione: (2025)
di: Wu, Junfeng, et al.
Pubblicazione: (2025)
GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation
di: Zhao, Xuan, et al.
Pubblicazione: (2025)
di: Zhao, Xuan, et al.
Pubblicazione: (2025)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
di: Zhang, Xu, et al.
Pubblicazione: (2026)
di: Zhang, Xu, et al.
Pubblicazione: (2026)
RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization
di: Huang, Mengqi, et al.
Pubblicazione: (2024)
di: Huang, Mengqi, et al.
Pubblicazione: (2024)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
LayerEdit: Disentangled Multi-Object Editing via Conflict-Aware Multi-Layer Learning
di: Fu, Fengyi, et al.
Pubblicazione: (2025)
di: Fu, Fengyi, et al.
Pubblicazione: (2025)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
Strips as Tokens: Artist Mesh Generation with Native UV Segmentation
di: Xu, Rui, et al.
Pubblicazione: (2026)
di: Xu, Rui, et al.
Pubblicazione: (2026)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
RealCustom++: Representing Images as Real Textual Word for Real-Time Customization
di: Mao, Zhendong, et al.
Pubblicazione: (2024)
di: Mao, Zhendong, et al.
Pubblicazione: (2024)
MacTok: Robust Continuous Tokenization for Image Generation
di: Zeng, Hengyu, et al.
Pubblicazione: (2026)
di: Zeng, Hengyu, et al.
Pubblicazione: (2026)
BLIP3o-NEXT: Next Frontier of Native Image Generation
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
Stream-T1: Test-Time Scaling for Streaming Video Generation
di: Tu, Yijing, et al.
Pubblicazione: (2026)
di: Tu, Yijing, et al.
Pubblicazione: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
RefTok: Reference-Based Tokenization for Video Generation
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
di: He, Zefeng, et al.
Pubblicazione: (2026)
di: He, Zefeng, et al.
Pubblicazione: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
di: Chen, Bowei, et al.
Pubblicazione: (2025)
di: Chen, Bowei, et al.
Pubblicazione: (2025)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
di: Chen, Nan, et al.
Pubblicazione: (2024)
di: Chen, Nan, et al.
Pubblicazione: (2024)
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization
di: Wang, Wenchuan, et al.
Pubblicazione: (2025)
di: Wang, Wenchuan, et al.
Pubblicazione: (2025)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
di: He, Ju, et al.
Pubblicazione: (2025)
di: He, Ju, et al.
Pubblicazione: (2025)
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
di: Seedance, Team, et al.
Pubblicazione: (2025)
di: Seedance, Team, et al.
Pubblicazione: (2025)
DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization
di: Yang, Zhengxian, et al.
Pubblicazione: (2026)
di: Yang, Zhengxian, et al.
Pubblicazione: (2026)
Native-Resolution Image Synthesis
di: Wang, Zidong, et al.
Pubblicazione: (2025)
di: Wang, Zidong, et al.
Pubblicazione: (2025)
Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
di: Gong, Lixue, et al.
Pubblicazione: (2025)
di: Gong, Lixue, et al.
Pubblicazione: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
di: Lin, Haokun, et al.
Pubblicazione: (2025)
di: Lin, Haokun, et al.
Pubblicazione: (2025)
Show-o2: Improved Native Unified Multimodal Models
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
D$^2$iT: Dynamic Diffusion Transformer for Accurate Image Generation
di: Jia, Weinan, et al.
Pubblicazione: (2025) -
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026) -
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
di: Chen, Cong, et al.
Pubblicazione: (2025) -
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025) -
DSE-GAN: Dynamic Semantic Evolution Generative Adversarial Network for Text-to-Image Generation
di: Huang, Mengqi, et al.
Pubblicazione: (2022)