Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Lijie, Tang, Luming, Qin, Siyang, Li, Tianhong, Yang, Xuan, Qiao, Siyuan, Steiner, Andreas, Sun, Chen, Li, Yuanzhen, Zhu, Tao, Rubinstein, Michael, Raptis, Michalis, Sun, Deqing, Soricut, Radu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
di: Fan, Lijie, et al.
Pubblicazione: (2024)
di: Fan, Lijie, et al.
Pubblicazione: (2024)
Wavelet-Based Image Tokenizer for Vision Transformers
di: Zhu, Zhenhai, et al.
Pubblicazione: (2024)
di: Zhu, Zhenhai, et al.
Pubblicazione: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
di: Ma, Chenglong, et al.
Pubblicazione: (2025)
di: Ma, Chenglong, et al.
Pubblicazione: (2025)
Latent Denoising Makes Good Tokenizers
di: Yang, Jiawei, et al.
Pubblicazione: (2025)
di: Yang, Jiawei, et al.
Pubblicazione: (2025)
Fractal Generative Models
di: Li, Tianhong, et al.
Pubblicazione: (2025)
di: Li, Tianhong, et al.
Pubblicazione: (2025)
Probing the 3D Awareness of Visual Foundation Models
di: Banani, Mohamed El, et al.
Pubblicazione: (2024)
di: Banani, Mohamed El, et al.
Pubblicazione: (2024)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens
di: Li, Zekun, et al.
Pubblicazione: (2026)
di: Li, Zekun, et al.
Pubblicazione: (2026)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
di: Wang, Peiyu, et al.
Pubblicazione: (2025)
di: Wang, Peiyu, et al.
Pubblicazione: (2025)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
di: Chen, Yizhu, et al.
Pubblicazione: (2025)
di: Chen, Yizhu, et al.
Pubblicazione: (2025)
From Sequential to Spatial: Reordering Autoregression for Efficient Visual Generation
di: Wang, Siyang, et al.
Pubblicazione: (2025)
di: Wang, Siyang, et al.
Pubblicazione: (2025)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
di: Zhang, Guiwei, et al.
Pubblicazione: (2025)
di: Zhang, Guiwei, et al.
Pubblicazione: (2025)
Understanding Generalization and Forgetting in In-Context Continual Learning
di: Li, Guangyu, et al.
Pubblicazione: (2026)
di: Li, Guangyu, et al.
Pubblicazione: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
di: Song, Wei, et al.
Pubblicazione: (2025)
di: Song, Wei, et al.
Pubblicazione: (2025)
Autoregressive Image Generation without Vector Quantization
di: Li, Tianhong, et al.
Pubblicazione: (2024)
di: Li, Tianhong, et al.
Pubblicazione: (2024)
Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models
di: Braun, Tobias, et al.
Pubblicazione: (2026)
di: Braun, Tobias, et al.
Pubblicazione: (2026)
FreqPolicy: Frequency Autoregressive Visuomotor Policy with Continuous Tokens
di: Zhong, Yiming, et al.
Pubblicazione: (2025)
di: Zhong, Yiming, et al.
Pubblicazione: (2025)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
di: Wang, Dianyi, et al.
Pubblicazione: (2025)
CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models
di: Li, Junhao, et al.
Pubblicazione: (2026)
di: Li, Junhao, et al.
Pubblicazione: (2026)
CausalLM is not optimal for in-context learning
di: Ding, Nan, et al.
Pubblicazione: (2023)
di: Ding, Nan, et al.
Pubblicazione: (2023)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
di: Wu, Jialin, et al.
Pubblicazione: (2023)
di: Wu, Jialin, et al.
Pubblicazione: (2023)
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
di: Jin, Xin, et al.
Pubblicazione: (2025)
di: Jin, Xin, et al.
Pubblicazione: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
di: Li, Chao, et al.
Pubblicazione: (2026)
di: Li, Chao, et al.
Pubblicazione: (2026)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025)
di: Wang, Bohan, et al.
Pubblicazione: (2025)
Frequency Autoregressive Image Generation with Continuous Tokens
di: Yu, Hu, et al.
Pubblicazione: (2025)
di: Yu, Hu, et al.
Pubblicazione: (2025)
NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
di: NextStep Team, et al.
Pubblicazione: (2025)
di: NextStep Team, et al.
Pubblicazione: (2025)
ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering
di: Lukovnikov, Denis, et al.
Pubblicazione: (2025)
di: Lukovnikov, Denis, et al.
Pubblicazione: (2025)
MARS: Enabling Autoregressive Models Multi-Token Generation
di: Jin, Ziqi, et al.
Pubblicazione: (2026)
di: Jin, Ziqi, et al.
Pubblicazione: (2026)
CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor
di: Sun, Shuyang, et al.
Pubblicazione: (2023)
di: Sun, Shuyang, et al.
Pubblicazione: (2023)
CamCtrl3D: Single-Image Scene Exploration with Precise 3D Camera Control
di: Popov, Stefan, et al.
Pubblicazione: (2025)
di: Popov, Stefan, et al.
Pubblicazione: (2025)
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
On the intimate association between even binary palindromic words and the Collatz-Hailstone iterations
di: Raptis, T.
Pubblicazione: (2024)
di: Raptis, T.
Pubblicazione: (2024)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
di: Chen, Yinda, et al.
Pubblicazione: (2024)
di: Chen, Yinda, et al.
Pubblicazione: (2024)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
di: Yu, Hu, et al.
Pubblicazione: (2025)
di: Yu, Hu, et al.
Pubblicazione: (2025)
Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
di: Ke, Guolin, et al.
Pubblicazione: (2025)
di: Ke, Guolin, et al.
Pubblicazione: (2025)
Fractal Autoregressive Depth Estimation with Continuous Token Diffusion
di: Zhang, Jinchang, et al.
Pubblicazione: (2026)
di: Zhang, Jinchang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
di: Fan, Lijie, et al.
Pubblicazione: (2024) -
Wavelet-Based Image Tokenizer for Vision Transformers
di: Zhu, Zhenhai, et al.
Pubblicazione: (2024) -
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
di: Ma, Chenglong, et al.
Pubblicazione: (2025) -
Latent Denoising Makes Good Tokenizers
di: Yang, Jiawei, et al.
Pubblicazione: (2025) -
Fractal Generative Models
di: Li, Tianhong, et al.
Pubblicazione: (2025)