On the Scalability of Diffusion-based Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hao, Zou, Yang, Wang, Ying, Majumder, Orchid, Xie, Yusheng, Manmatha, R., Swaminathan, Ashwin, Tu, Zhuowen, Ermon, Stefano, Soatto, Stefano |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Mixed-Query Transformer: A Unified Image Segmentation Architecture
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
Diffusion Soup: Model Merging for Text-to-Image Diffusion Models
par: Biggs, Benjamin, et autres
Publié: (2024)
par: Biggs, Benjamin, et autres
Publié: (2024)
Grounded Compositional and Diverse Text-to-3D with Pretrained Multi-View Diffusion Model
par: Li, Xiaolong, et autres
Publié: (2024)
par: Li, Xiaolong, et autres
Publié: (2024)
Training Data Protection with Compositional Diffusion Models
par: Golatkar, Aditya, et autres
Publié: (2023)
par: Golatkar, Aditya, et autres
Publié: (2023)
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality
par: Tao, Chaofan, et autres
Publié: (2024)
par: Tao, Chaofan, et autres
Publié: (2024)
THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models
par: Kaul, Prannay, et autres
Publié: (2024)
par: Kaul, Prannay, et autres
Publié: (2024)
Non-autoregressive Sequence-to-Sequence Vision-Language Models
par: Shi, Kunyu, et autres
Publié: (2024)
par: Shi, Kunyu, et autres
Publié: (2024)
A Quantitative Evaluation of Score Distillation Sampling Based Text-to-3D
par: Fei, Xiaohan, et autres
Publié: (2024)
par: Fei, Xiaohan, et autres
Publié: (2024)
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
par: Kim, Sungnyun, et autres
Publié: (2024)
par: Kim, Sungnyun, et autres
Publié: (2024)
Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes
par: Tan, Jing, et autres
Publié: (2026)
par: Tan, Jing, et autres
Publié: (2026)
CPR: Retrieval Augmented Generation for Copyright Protection
par: Golatkar, Aditya, et autres
Publié: (2024)
par: Golatkar, Aditya, et autres
Publié: (2024)
Fast Sparse View Guided NeRF Update for Object Reconfigurations
par: Lu, Ziqi, et autres
Publié: (2024)
par: Lu, Ziqi, et autres
Publié: (2024)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
par: Wang, Zirui, et autres
Publié: (2023)
par: Wang, Zirui, et autres
Publié: (2023)
ELODI: Ensemble Logit Difference Inhibition for Positive-Congruent Training
par: Zhao, Yue, et autres
Publié: (2022)
par: Zhao, Yue, et autres
Publié: (2022)
DreamPropeller: Supercharge Text-to-3D Generation with Parallel Sampling
par: Zhou, Linqi, et autres
Publié: (2023)
par: Zhou, Linqi, et autres
Publié: (2023)
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
par: Zeng, Guanning, et autres
Publié: (2025)
par: Zeng, Guanning, et autres
Publié: (2025)
Multi-Modal Hallucination Control by Visual Information Grounding
par: Favero, Alessandro, et autres
Publié: (2024)
par: Favero, Alessandro, et autres
Publié: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
par: Gao, Yuan, et autres
Publié: (2024)
par: Gao, Yuan, et autres
Publié: (2024)
Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation
par: Iyengar, Aniketh, et autres
Publié: (2025)
par: Iyengar, Aniketh, et autres
Publié: (2025)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
par: Zhang, Zhaoyang, et autres
Publié: (2023)
par: Zhang, Zhaoyang, et autres
Publié: (2023)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
par: Wang, Austin, et autres
Publié: (2026)
par: Wang, Austin, et autres
Publié: (2026)
Descriminative-Generative Custom Tokens for Vision-Language Models
par: Perera, Pramuditha, et autres
Publié: (2025)
par: Perera, Pramuditha, et autres
Publié: (2025)
Diffeomorphic Template Registration for Atmospheric Turbulence Mitigation
par: Lao, Dong, et autres
Publié: (2024)
par: Lao, Dong, et autres
Publié: (2024)
Geometric Trajectory Diffusion Models
par: Han, Jiaqi, et autres
Publié: (2024)
par: Han, Jiaqi, et autres
Publié: (2024)
Diffusion-based Blind Text Image Super-Resolution
par: Zhang, Yuzhe, et autres
Publié: (2023)
par: Zhang, Yuzhe, et autres
Publié: (2023)
Personalized Preference Fine-tuning of Diffusion Models
par: Dang, Meihua, et autres
Publié: (2025)
par: Dang, Meihua, et autres
Publié: (2025)
Changen2: Multi-Temporal Remote Sensing Generative Change Foundation Model
par: Zheng, Zhuo, et autres
Publié: (2024)
par: Zheng, Zhuo, et autres
Publié: (2024)
TrAct: Making First-layer Pre-Activations Trainable
par: Petersen, Felix, et autres
Publié: (2024)
par: Petersen, Felix, et autres
Publié: (2024)
Divergence Minimization Preference Optimization for Diffusion Model Alignment
par: Li, Binxu, et autres
Publié: (2025)
par: Li, Binxu, et autres
Publié: (2025)
Segment Any Change
par: Zheng, Zhuo, et autres
Publié: (2024)
par: Zheng, Zhuo, et autres
Publié: (2024)
DistillKac: Few-Step Image Generation via Damped Wave Equations
par: Han, Weiqiao, et autres
Publié: (2025)
par: Han, Weiqiao, et autres
Publié: (2025)
Restoration by Generation with Constrained Priors
par: Ding, Zheng, et autres
Publié: (2023)
par: Ding, Zheng, et autres
Publié: (2023)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
par: Srivastava, Divyansh, et autres
Publié: (2025)
par: Srivastava, Divyansh, et autres
Publié: (2025)
Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration
par: Han, Jiaqi, et autres
Publié: (2026)
par: Han, Jiaqi, et autres
Publié: (2026)
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
par: Zhao, Qingcheng, et autres
Publié: (2025)
par: Zhao, Qingcheng, et autres
Publié: (2025)
Visual Concept-driven Image Generation with Text-to-Image Diffusion Model
par: Rahman, Tanzila, et autres
Publié: (2024)
par: Rahman, Tanzila, et autres
Publié: (2024)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
par: Chen, Zeyuan, et autres
Publié: (2025)
par: Chen, Zeyuan, et autres
Publié: (2025)
Documents similaires
-
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024) -
Mixed-Query Transformer: A Unified Image Segmentation Architecture
par: Wang, Pei, et autres
Publié: (2024) -
Diffusion Soup: Model Merging for Text-to-Image Diffusion Models
par: Biggs, Benjamin, et autres
Publié: (2024) -
Grounded Compositional and Diverse Text-to-3D with Pretrained Multi-View Diffusion Model
par: Li, Xiaolong, et autres
Publié: (2024) -
Training Data Protection with Compositional Diffusion Models
par: Golatkar, Aditya, et autres
Publié: (2023)