Tokenize Image as a Set
Fuente:
arXiv
Saved in:
| Main Authors: | Geng, Zigang, Xu, Mengde, Hu, Han, Gu, Shuyang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Equivariant Image Modeling
by: Dong, Ruixiao, et al.
Published: (2025)
by: Dong, Ruixiao, et al.
Published: (2025)
Distribution Matching Variational AutoEncoder
by: Ye, Sen, et al.
Published: (2025)
by: Ye, Sen, et al.
Published: (2025)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
by: Ye, Sen, et al.
Published: (2026)
by: Ye, Sen, et al.
Published: (2026)
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
by: Geng, Zigang, et al.
Published: (2025)
by: Geng, Zigang, et al.
Published: (2025)
Optimal Stepsize for Diffusion Sampling
by: Pei, Jianning, et al.
Published: (2025)
by: Pei, Jianning, et al.
Published: (2025)
CCA: Collaborative Competitive Agents for Image Editing
by: Hang, Tiankai, et al.
Published: (2024)
by: Hang, Tiankai, et al.
Published: (2024)
Several questions of visual generation in 2024
by: Gu, Shuyang
Published: (2024)
by: Gu, Shuyang
Published: (2024)
Efficient Diffusion Training via Min-SNR Weighting Strategy
by: Hang, Tiankai, et al.
Published: (2023)
by: Hang, Tiankai, et al.
Published: (2023)
Improved Noise Schedule for Diffusion Training
by: Hang, Tiankai, et al.
Published: (2024)
by: Hang, Tiankai, et al.
Published: (2024)
Image Tokenizer Needs Post-Training
by: Qiu, Kai, et al.
Published: (2025)
by: Qiu, Kai, et al.
Published: (2025)
ImageFolder: Autoregressive Image Generation with Folded Tokens
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
by: Wang, Zhendong, et al.
Published: (2025)
by: Wang, Zhendong, et al.
Published: (2025)
Visual-Word Tokenizer: Beyond Fixed Sets of Tokens in Vision Transformers
by: Gee, Leonidas, et al.
Published: (2024)
by: Gee, Leonidas, et al.
Published: (2024)
A Creative Agent is Worth a 64-Token Template
by: Shi, Ruixiao, et al.
Published: (2026)
by: Shi, Ruixiao, et al.
Published: (2026)
Morphing Tokens Draw Strong Masked Image Models
by: Kim, Taekyung, et al.
Published: (2023)
by: Kim, Taekyung, et al.
Published: (2023)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
by: Liu, Shengyuan, et al.
Published: (2026)
by: Liu, Shengyuan, et al.
Published: (2026)
ATD: Improved Transformer with Adaptive Token Dictionary for Image Restoration
by: Zhang, Leheng, et al.
Published: (2026)
by: Zhang, Leheng, et al.
Published: (2026)
VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
by: Lin, Huawei, et al.
Published: (2025)
by: Lin, Huawei, et al.
Published: (2025)
Open-Set Video-based Facial Expression Recognition with Human Expression-sensitive Prompting
by: Liu, Yuanyuan, et al.
Published: (2024)
by: Liu, Yuanyuan, et al.
Published: (2024)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
by: Li, Ruihang, et al.
Published: (2026)
by: Li, Ruihang, et al.
Published: (2026)
Improved Masked Image Generation with Knowledge-Augmented Token Representations
by: Liang, Guotao, et al.
Published: (2025)
by: Liang, Guotao, et al.
Published: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
by: Qu, Liao, et al.
Published: (2024)
by: Qu, Liao, et al.
Published: (2024)
Vision Foundation Models as Generalist Tokenizers for Image Generation
by: Zheng, Anlin, et al.
Published: (2026)
by: Zheng, Anlin, et al.
Published: (2026)
XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance
by: Wang, Cong, et al.
Published: (2023)
by: Wang, Cong, et al.
Published: (2023)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
by: Wang, Jiahao, et al.
Published: (2026)
by: Wang, Jiahao, et al.
Published: (2026)
Tokenize Image Patches: Global Context Fusion for Effective Haze Removal in Large Images
by: Chen, Jiuchen, et al.
Published: (2025)
by: Chen, Jiuchen, et al.
Published: (2025)
Aligning Text, Images, and 3D Structure Token-by-Token
by: Sahoo, Aadarsh, et al.
Published: (2025)
by: Sahoo, Aadarsh, et al.
Published: (2025)
Importance-Based Token Merging for Efficient Image and Video Generation
by: Wu, Haoyu, et al.
Published: (2024)
by: Wu, Haoyu, et al.
Published: (2024)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
by: Wang, Zirui, et al.
Published: (2023)
by: Wang, Zirui, et al.
Published: (2023)
Safe and Robust Watermark Injection with a Single OoD Image
by: Yu, Shuyang, et al.
Published: (2023)
by: Yu, Shuyang, et al.
Published: (2023)
Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models
by: Ma, Xu, et al.
Published: (2025)
by: Ma, Xu, et al.
Published: (2025)
Token Bottleneck: One Token to Remember Dynamics
by: Kim, Taekyung, et al.
Published: (2025)
by: Kim, Taekyung, et al.
Published: (2025)
OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization
by: Zhu, Feng, et al.
Published: (2026)
by: Zhu, Feng, et al.
Published: (2026)
Unmixing-Guided Spatial-Spectral Mamba with Clustering Tokens for Hyperspectral Image Classification
by: Zhu, Yimin, et al.
Published: (2026)
by: Zhu, Yimin, et al.
Published: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
by: Wang, Junke, et al.
Published: (2024)
by: Wang, Junke, et al.
Published: (2024)
ParseCaps: An Interpretable Parsing Capsule Network for Medical Image Diagnosis
by: Geng, Xinyu, et al.
Published: (2024)
by: Geng, Xinyu, et al.
Published: (2024)
ImageSet2Text: Describing Sets of Images through Text
by: Riccio, Piera, et al.
Published: (2025)
by: Riccio, Piera, et al.
Published: (2025)
Semantic Prompting with Image-Token for Continual Learning
by: Han, Jisu, et al.
Published: (2024)
by: Han, Jisu, et al.
Published: (2024)
Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging
by: Nguyen, Phat, et al.
Published: (2026)
by: Nguyen, Phat, et al.
Published: (2026)
Similar Items
-
Equivariant Image Modeling
by: Dong, Ruixiao, et al.
Published: (2025) -
Distribution Matching Variational AutoEncoder
by: Ye, Sen, et al.
Published: (2025) -
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
by: Ye, Sen, et al.
Published: (2026) -
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
by: Geng, Zigang, et al.
Published: (2025) -
Optimal Stepsize for Diffusion Sampling
by: Pei, Jianning, et al.
Published: (2025)