Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Jiatao, Shen, Ying, Zhai, Shuangfei, Zhang, Yizhe, Jaitly, Navdeep, Susskind, Joshua M. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023)
par: Gu, Jiatao, et autres
Publié: (2023)
Improving GFlowNets for Text-to-Image Diffusion Alignment
par: Zhang, Dinghuai, et autres
Publié: (2024)
par: Zhang, Dinghuai, et autres
Publié: (2024)
Many-to-many Image Generation with Auto-regressive Diffusion Models
par: Shen, Ying, et autres
Publié: (2024)
par: Shen, Ying, et autres
Publié: (2024)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
par: Gu, Jiatao, et autres
Publié: (2024)
par: Gu, Jiatao, et autres
Publié: (2024)
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
How Far Are We from Intelligent Visual Deductive Reasoning?
par: Zhang, Yizhe, et autres
Publié: (2024)
par: Zhang, Yizhe, et autres
Publié: (2024)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
World-consistent Video Diffusion with Explicit 3D Modeling
par: Zhang, Qihang, et autres
Publié: (2024)
par: Zhang, Qihang, et autres
Publié: (2024)
Normalizing Trajectory Models
par: Gu, Jiatao, et autres
Publié: (2026)
par: Gu, Jiatao, et autres
Publié: (2026)
Normalizing Flows are Capable Generative Models
par: Zhai, Shuangfei, et autres
Publié: (2024)
par: Zhai, Shuangfei, et autres
Publié: (2024)
STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
par: Shen, Ying, et autres
Publié: (2026)
par: Shen, Ying, et autres
Publié: (2026)
Normalizing Flows with Iterative Denoising
par: Chen, Tianrong, et autres
Publié: (2026)
par: Chen, Tianrong, et autres
Publié: (2026)
Scalable Pre-training of Large Autoregressive Image Models
par: El-Nouby, Alaaeldin, et autres
Publié: (2024)
par: El-Nouby, Alaaeldin, et autres
Publié: (2024)
STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
par: Gu, Jiatao, et autres
Publié: (2025)
par: Gu, Jiatao, et autres
Publié: (2025)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer
par: Hu, Jinyi, et autres
Publié: (2024)
par: Hu, Jinyi, et autres
Publié: (2024)
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
par: Gu, Jiatao, et autres
Publié: (2025)
par: Gu, Jiatao, et autres
Publié: (2025)
Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
par: Zhang, Zhenxing, et autres
Publié: (2025)
par: Zhang, Zhenxing, et autres
Publié: (2025)
Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP
par: Huang, Chen, et autres
Publié: (2024)
par: Huang, Chen, et autres
Publié: (2024)
The Coupling Within: Flow Matching via Distilled Normalizing Flows
par: Berthelot, David, et autres
Publié: (2026)
par: Berthelot, David, et autres
Publié: (2026)
Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
par: Gong, Shansan, et autres
Publié: (2025)
par: Gong, Shansan, et autres
Publié: (2025)
Canonical Latent Representations in Conditional Diffusion Models
par: Xu, Yitao, et autres
Publié: (2025)
par: Xu, Yitao, et autres
Publié: (2025)
Are Conditional Latent Diffusion Models Effective for Image Restoration?
par: Yuan, Yunchen, et autres
Publié: (2024)
par: Yuan, Yunchen, et autres
Publié: (2024)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
Improved Video VAE for Latent Video Diffusion Model
par: Wu, Pingyu, et autres
Publié: (2024)
par: Wu, Pingyu, et autres
Publié: (2024)
Multimodal-Conditioned Latent Diffusion Models for Fashion Image Editing
par: Baldrati, Alberto, et autres
Publié: (2024)
par: Baldrati, Alberto, et autres
Publié: (2024)
Conditional Latent Diffusion Models for Zero-Shot Instance Segmentation
par: Ulmer, Maximilian, et autres
Publié: (2025)
par: Ulmer, Maximilian, et autres
Publié: (2025)
When No-Reference Image Quality Models Meet MAP Estimation in Diffusion Latents
par: Zhang, Weixia, et autres
Publié: (2024)
par: Zhang, Weixia, et autres
Publié: (2024)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
par: Zeng, Lunbin, et autres
Publié: (2025)
par: Zeng, Lunbin, et autres
Publié: (2025)
Diffuse to Choose: Enriching Image Conditioned Inpainting in Latent Diffusion Models for Virtual Try-All
par: Seyfioglu, Mehmet Saygin, et autres
Publié: (2024)
par: Seyfioglu, Mehmet Saygin, et autres
Publié: (2024)
Zero-1-to-G: Taming Pretrained 2D Diffusion Model for Direct 3D Generation
par: Meng, Xuyi, et autres
Publié: (2025)
par: Meng, Xuyi, et autres
Publié: (2025)
Epona: Autoregressive Diffusion World Model for Autonomous Driving
par: Zhang, Kaiwen, et autres
Publié: (2025)
par: Zhang, Kaiwen, et autres
Publié: (2025)
Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models
par: Li, Qifan, et autres
Publié: (2026)
par: Li, Qifan, et autres
Publié: (2026)
3D Shape Tokenization via Latent Flow Matching
par: Chang, Jen-Hao Rick, et autres
Publié: (2024)
par: Chang, Jen-Hao Rick, et autres
Publié: (2024)
LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision
par: Li, Chunyu, et autres
Publié: (2024)
par: Li, Chunyu, et autres
Publié: (2024)
D-AR: Diffusion via Autoregressive Models
par: Gao, Ziteng, et autres
Publié: (2025)
par: Gao, Ziteng, et autres
Publié: (2025)
Semantic Context Matters: Improving Conditioning for Autoregressive Models
par: Jin, Dongyang, et autres
Publié: (2025)
par: Jin, Dongyang, et autres
Publié: (2025)
Diffusion As Self-Distillation: End-to-End Latent Diffusion In One Model
par: Wang, Xiyuan, et autres
Publié: (2025)
par: Wang, Xiyuan, et autres
Publié: (2025)
MotionStreamer: Streaming Motion Generation via Diffusion-based Autoregressive Model in Causal Latent Space
par: Xiao, Lixing, et autres
Publié: (2025)
par: Xiao, Lixing, et autres
Publié: (2025)
Documents similaires
-
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023) -
Improving GFlowNets for Text-to-Image Diffusion Alignment
par: Zhang, Dinghuai, et autres
Publié: (2024) -
Many-to-many Image Generation with Auto-regressive Diffusion Models
par: Shen, Ying, et autres
Publié: (2024) -
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
par: Gu, Jiatao, et autres
Publié: (2024) -
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)