Image Understanding Makes for A Good Tokenizer for Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Luting, Zhao, Yang, Zhang, Zijian, Feng, Jiashi, Liu, Si, Kang, Bingyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025)
por: Xiong, Tianwei, et al.
Publicado: (2025)
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
por: Wang, Yuqing, et al.
Publicado: (2024)
por: Wang, Yuqing, et al.
Publicado: (2024)
Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data
por: Yang, Lihe, et al.
Publicado: (2024)
por: Yang, Lihe, et al.
Publicado: (2024)
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024)
por: Huang, Zilong, et al.
Publicado: (2024)
BenchDepth: Are We on the Right Way to Evaluate Depth Foundation Models?
por: Li, Zhenyu, et al.
Publicado: (2025)
por: Li, Zhenyu, et al.
Publicado: (2025)
Depth Anything V2
por: Yang, Lihe, et al.
Publicado: (2024)
por: Yang, Lihe, et al.
Publicado: (2024)
Latent Denoising Makes Good Tokenizers
por: Yang, Jiawei, et al.
Publicado: (2025)
por: Yang, Jiawei, et al.
Publicado: (2025)
How Far is Video Generation from World Model: A Physical Law Perspective
por: Kang, Bingyi, et al.
Publicado: (2024)
por: Kang, Bingyi, et al.
Publicado: (2024)
VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
por: Ren, Zhongwei, et al.
Publicado: (2025)
por: Ren, Zhongwei, et al.
Publicado: (2025)
EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024)
por: Qu, Liao, et al.
Publicado: (2024)
What Makes for Good Image Captions?
por: Chen, Delong, et al.
Publicado: (2024)
por: Chen, Delong, et al.
Publicado: (2024)
What Makes for a Good Stereoscopic Image?
por: Tamir, Netanel Y., et al.
Publicado: (2024)
por: Tamir, Netanel Y., et al.
Publicado: (2024)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
por: Wang, Yuqing, et al.
Publicado: (2025)
por: Wang, Yuqing, et al.
Publicado: (2025)
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
por: Ren, Zhongwei, et al.
Publicado: (2026)
por: Ren, Zhongwei, et al.
Publicado: (2026)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
por: Xiong, Tianwei, et al.
Publicado: (2026)
por: Xiong, Tianwei, et al.
Publicado: (2026)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
por: Xie, Qingsong, et al.
Publicado: (2025)
por: Xie, Qingsong, et al.
Publicado: (2025)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
por: Huang, Ziyuan, et al.
Publicado: (2025)
por: Huang, Ziyuan, et al.
Publicado: (2025)
What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment
por: Parthasarathy, Rishab, et al.
Publicado: (2025)
por: Parthasarathy, Rishab, et al.
Publicado: (2025)
Improving Flexible Image Tokenizers for Autoregressive Image Generation
por: Fu, Zixuan, et al.
Publicado: (2026)
por: Fu, Zixuan, et al.
Publicado: (2026)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
por: Zhou, Yupeng, et al.
Publicado: (2024)
por: Zhou, Yupeng, et al.
Publicado: (2024)
Good Seed Makes a Good Crop: Discovering Secret Seeds in Text-to-Image Diffusion Models
por: Xu, Katherine, et al.
Publicado: (2024)
por: Xu, Katherine, et al.
Publicado: (2024)
Trace Anything: Representing Any Video in 4D via Trajectory Fields
por: Liu, Xinhang, et al.
Publicado: (2025)
por: Liu, Xinhang, et al.
Publicado: (2025)
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
por: Chen, Sili, et al.
Publicado: (2025)
por: Chen, Sili, et al.
Publicado: (2025)
Are Image-to-Video Models Good Zero-Shot Image Editors?
por: Zhang, Zechuan, et al.
Publicado: (2025)
por: Zhang, Zechuan, et al.
Publicado: (2025)
Cambrian-P: Pose-Grounded Video Understanding
por: Yang, Jihan, et al.
Publicado: (2026)
por: Yang, Jihan, et al.
Publicado: (2026)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
A Token-level Text Image Foundation Model for Document Understanding
por: Guan, Tongkun, et al.
Publicado: (2025)
por: Guan, Tongkun, et al.
Publicado: (2025)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
por: Ma, Fan, et al.
Publicado: (2023)
por: Ma, Fan, et al.
Publicado: (2023)
Depth Anything 3: Recovering the Visual Space from Any Views
por: Lin, Haotong, et al.
Publicado: (2025)
por: Lin, Haotong, et al.
Publicado: (2025)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
por: Wang, Yuqing, et al.
Publicado: (2026)
por: Wang, Yuqing, et al.
Publicado: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation
por: Zhao, Xuan, et al.
Publicado: (2025)
por: Zhao, Xuan, et al.
Publicado: (2025)
Hita: Holistic Tokenizer for Autoregressive Image Generation
por: Zheng, Anlin, et al.
Publicado: (2025)
por: Zheng, Anlin, et al.
Publicado: (2025)
Frequency Autoregressive Image Generation with Continuous Tokens
por: Yu, Hu, et al.
Publicado: (2025)
por: Yu, Hu, et al.
Publicado: (2025)
Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation
por: Qu, Yunpeng, et al.
Publicado: (2026)
por: Qu, Yunpeng, et al.
Publicado: (2026)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Good Noise Makes Good Edits: A Training-Free Diffusion-Based Video Editing with Image and Text Prompts
por: Choi, Saemee, et al.
Publicado: (2025)
por: Choi, Saemee, et al.
Publicado: (2025)
ImageFolder: Autoregressive Image Generation with Folded Tokens
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025) -
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
por: Wang, Yuqing, et al.
Publicado: (2024) -
Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data
por: Yang, Lihe, et al.
Publicado: (2024) -
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024) -
BenchDepth: Are We on the Right Way to Evaluate Depth Foundation Models?
por: Li, Zhenyu, et al.
Publicado: (2025)