HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Cong, Huang, Ziyuan, Zou, Cheng, Zhu, Muzhi, Ji, Kaixiang, Liu, Jiajia, Chen, Jingdong, Chen, Hao, Shen, Chunhua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
di: Chen, Cong, et al.
Pubblicazione: (2025)
di: Chen, Cong, et al.
Pubblicazione: (2025)
ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
NativeTok: Native Visual Tokenization for Improved Image Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative Data
di: Fan, Chengxiang, et al.
Pubblicazione: (2024)
di: Fan, Chengxiang, et al.
Pubblicazione: (2024)
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
di: Xiong, Tianwei, et al.
Pubblicazione: (2025)
di: Xiong, Tianwei, et al.
Pubblicazione: (2025)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
di: Yue, Yang, et al.
Pubblicazione: (2026)
di: Yue, Yang, et al.
Pubblicazione: (2026)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
di: Guo, Yansong, et al.
Pubblicazione: (2026)
di: Guo, Yansong, et al.
Pubblicazione: (2026)
A Simple Image Segmentation Framework via In-Context Examples
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Generative Active Learning for Long-tailed Instance Segmentation
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation
di: Zhao, Xuan, et al.
Pubblicazione: (2025)
di: Zhao, Xuan, et al.
Pubblicazione: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching
di: Liu, Yang, et al.
Pubblicazione: (2023)
di: Liu, Yang, et al.
Pubblicazione: (2023)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
di: Zeng, Weili, et al.
Pubblicazione: (2025)
di: Zeng, Weili, et al.
Pubblicazione: (2025)
TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders
di: Li, Teng, et al.
Pubblicazione: (2026)
di: Li, Teng, et al.
Pubblicazione: (2026)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
di: Zhao, Canyu, et al.
Pubblicazione: (2025)
di: Zhao, Canyu, et al.
Pubblicazione: (2025)
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
di: Hansen-Estruch, Philippe, et al.
Pubblicazione: (2025)
di: Hansen-Estruch, Philippe, et al.
Pubblicazione: (2025)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
di: Zhang, Xu, et al.
Pubblicazione: (2026)
di: Zhang, Xu, et al.
Pubblicazione: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
di: Chen, Bowei, et al.
Pubblicazione: (2025)
di: Chen, Bowei, et al.
Pubblicazione: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
An Image is Worth 32 Tokens for Reconstruction and Generation
di: Yu, Qihang, et al.
Pubblicazione: (2024)
di: Yu, Qihang, et al.
Pubblicazione: (2024)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
di: He, Ju, et al.
Pubblicazione: (2025)
di: He, Ju, et al.
Pubblicazione: (2025)
RefTok: Reference-Based Tokenization for Video Generation
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
ElasticTok: Adaptive Tokenization for Image and Video
di: Yan, Wilson, et al.
Pubblicazione: (2024)
di: Yan, Wilson, et al.
Pubblicazione: (2024)
Unified Open-World Segmentation with Multi-Modal Prompts
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
di: Wu, Junfeng, et al.
Pubblicazione: (2025)
di: Wu, Junfeng, et al.
Pubblicazione: (2025)
MacTok: Robust Continuous Tokenization for Image Generation
di: Zeng, Hengyu, et al.
Pubblicazione: (2026)
di: Zeng, Hengyu, et al.
Pubblicazione: (2026)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
di: Shen, Yangyi, et al.
Pubblicazione: (2026)
di: Shen, Yangyi, et al.
Pubblicazione: (2026)
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
di: Zhu, Muzhi, et al.
Pubblicazione: (2024)
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
di: Li, Liyang, et al.
Pubblicazione: (2026)
di: Li, Liyang, et al.
Pubblicazione: (2026)
DINO-Tok: Adapting DINO for Visual Tokenizers
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
di: Jia, Mingkai, et al.
Pubblicazione: (2025)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
StyleTokenizer: Defining Image Style by a Single Instance for Controlling Diffusion Models
di: Li, Wen, et al.
Pubblicazione: (2024)
di: Li, Wen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
di: Chen, Cong, et al.
Pubblicazione: (2025) -
ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
di: Wang, Xiaolong, et al.
Pubblicazione: (2025) -
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
di: Huang, Ziyuan, et al.
Pubblicazione: (2025) -
NativeTok: Native Visual Tokenization for Improved Image Generation
di: Wu, Bin, et al.
Pubblicazione: (2026) -
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
di: Zhu, Muzhi, et al.
Pubblicazione: (2025)