Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Yongxin, Li, Bocheng, Zhang, Hang, Li, Xin, Xu, Linli, Bing, Lidong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
Latent Action Control for Reasoning-Guided Unified Image Generation
por: Zhai, Fuxiang, et al.
Publicado: (2026)
por: Zhai, Fuxiang, et al.
Publicado: (2026)
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
por: Wang, Yuchi, et al.
Publicado: (2024)
por: Wang, Yuchi, et al.
Publicado: (2024)
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
por: Jing, Liqi, et al.
Publicado: (2026)
por: Jing, Liqi, et al.
Publicado: (2026)
Addressing Representation Collapse in Vector Quantized Models with One Linear Layer
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
EAR: Erasing Concepts from Unified Autoregressive Models
por: Fan, Haipeng, et al.
Publicado: (2025)
por: Fan, Haipeng, et al.
Publicado: (2025)
Other Vehicle Trajectories Are Also Needed: A Driving World Model Unifies Ego-Other Vehicle Trajectories in Video Latent Space
por: Zhu, Jian, et al.
Publicado: (2025)
por: Zhu, Jian, et al.
Publicado: (2025)
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
por: Song, Guoxian, et al.
Publicado: (2025)
por: Song, Guoxian, et al.
Publicado: (2025)
Unified Medical Image Segmentation with State Space Modeling Snake
por: Zhang, Ruicheng, et al.
Publicado: (2025)
por: Zhang, Ruicheng, et al.
Publicado: (2025)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
por: Zheng, Anlin, et al.
Publicado: (2025)
por: Zheng, Anlin, et al.
Publicado: (2025)
UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos
por: Mei, Yuting, et al.
Publicado: (2024)
por: Mei, Yuting, et al.
Publicado: (2024)
Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models
por: Lu, Tianyi, et al.
Publicado: (2023)
por: Lu, Tianyi, et al.
Publicado: (2023)
Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
por: Xing, Jiazheng, et al.
Publicado: (2026)
por: Xing, Jiazheng, et al.
Publicado: (2026)
Diffusion Model in Latent Space for Medical Image Segmentation Task
por: Ngoc, Huynh Trinh, et al.
Publicado: (2025)
por: Ngoc, Huynh Trinh, et al.
Publicado: (2025)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
por: Yuan, Hangjie, et al.
Publicado: (2025)
por: Yuan, Hangjie, et al.
Publicado: (2025)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics
por: Zhang, Hang, et al.
Publicado: (2026)
por: Zhang, Hang, et al.
Publicado: (2026)
Compress3D: a Compressed Latent Space for 3D Generation from a Single Image
por: Zhang, Bowen, et al.
Publicado: (2024)
por: Zhang, Bowen, et al.
Publicado: (2024)
DAP: A Discrete-token Autoregressive Planner for Autonomous Driving
por: Ye, Bowen, et al.
Publicado: (2025)
por: Ye, Bowen, et al.
Publicado: (2025)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
por: Tang, Jianting, et al.
Publicado: (2025)
por: Tang, Jianting, et al.
Publicado: (2025)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
por: Liu, Chaohu, et al.
Publicado: (2025)
por: Liu, Chaohu, et al.
Publicado: (2025)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
GMapLatent: Geometric Mapping in Latent Space
por: Zeng, Wei, et al.
Publicado: (2025)
por: Zeng, Wei, et al.
Publicado: (2025)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
por: Wang, Qixun, et al.
Publicado: (2025)
por: Wang, Qixun, et al.
Publicado: (2025)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
por: Wang, Yufei, et al.
Publicado: (2025)
por: Wang, Yufei, et al.
Publicado: (2025)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024)
por: Yuan, Yuqian, et al.
Publicado: (2024)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
por: Zheng, Zirui, et al.
Publicado: (2025)
por: Zheng, Zirui, et al.
Publicado: (2025)
Direction-Aware Diagonal Autoregressive Image Generation
por: Xu, Yijia, et al.
Publicado: (2025)
por: Xu, Yijia, et al.
Publicado: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
por: Ren, Shuhuai, et al.
Publicado: (2023)
por: Ren, Shuhuai, et al.
Publicado: (2023)
CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
por: Li, Lingen, et al.
Publicado: (2026)
por: Li, Lingen, et al.
Publicado: (2026)
LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling
por: Li, Huaqiu, et al.
Publicado: (2025)
por: Li, Huaqiu, et al.
Publicado: (2025)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
por: Chen, Yinda, et al.
Publicado: (2024)
por: Chen, Yinda, et al.
Publicado: (2024)
LSSGen: Leveraging Latent Space Scaling in Flow and Diffusion for Efficient Text to Image Generation
por: Tang, Jyun-Ze, et al.
Publicado: (2025)
por: Tang, Jyun-Ze, et al.
Publicado: (2025)
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
por: Mao, Yuxin, et al.
Publicado: (2025)
por: Mao, Yuxin, et al.
Publicado: (2025)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
DocShaDiffusion: Diffusion Model in Latent Space for Document Image Shadow Removal
por: Liu, Wenjie, et al.
Publicado: (2025)
por: Liu, Wenjie, et al.
Publicado: (2025)
Multiple Latent Space Mapping for Compressed Dark Image Enhancement
por: Zeng, Yi, et al.
Publicado: (2024)
por: Zeng, Yi, et al.
Publicado: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
por: Zhang, Yang, et al.
Publicado: (2026)
por: Zhang, Yang, et al.
Publicado: (2026)
Ejemplares similares
-
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
por: Zhang, Hong, et al.
Publicado: (2025) -
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025) -
Latent Action Control for Reasoning-Guided Unified Image Generation
por: Zhai, Fuxiang, et al.
Publicado: (2026) -
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
por: Wang, Yuchi, et al.
Publicado: (2024) -
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
por: Jing, Liqi, et al.
Publicado: (2026)