Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis
Fuente:
arXiv
Saved in:
| Main Authors: | Voronov, Anton, Kuznedelev, Denis, Khoroshikh, Mikhail, Khrulkov, Valentin, Baranchuk, Dmitry |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps
by: Starodubcev, Nikita, et al.
Published: (2024)
by: Starodubcev, Nikita, et al.
Published: (2024)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
by: Egiazarian, Vage, et al.
Published: (2024)
by: Egiazarian, Vage, et al.
Published: (2024)
Scale-wise Distillation of Diffusion Models
by: Starodubcev, Nikita, et al.
Published: (2025)
by: Starodubcev, Nikita, et al.
Published: (2025)
CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based Shading
by: Aliev, Mishan, et al.
Published: (2025)
by: Aliev, Mishan, et al.
Published: (2025)
Alchemist: Turning Public Text-to-Image Data into Generative Gold
by: Startsev, Valerii, et al.
Published: (2025)
by: Startsev, Valerii, et al.
Published: (2025)
Revisiting Autoregressive Models for Generative Image Classification
by: Sudakov, Ilia, et al.
Published: (2026)
by: Sudakov, Ilia, et al.
Published: (2026)
Your Student is Better Than Expected: Adaptive Teacher-Student Collaboration for Text-Conditional Diffusion Models
by: Starodubcev, Nikita, et al.
Published: (2023)
by: Starodubcev, Nikita, et al.
Published: (2023)
Rethinking Global Text Conditioning in Diffusion Transformers
by: Starodubcev, Nikita, et al.
Published: (2026)
by: Starodubcev, Nikita, et al.
Published: (2026)
Registers Matter for Pixel-Space Diffusion Transformers
by: Starodubcev, Nikita, et al.
Published: (2026)
by: Starodubcev, Nikita, et al.
Published: (2026)
CoMa: Contextual Massing Generation with Vision-Language Models
by: Maslov, Evgenii, et al.
Published: (2026)
by: Maslov, Evgenii, et al.
Published: (2026)
Does Diffusion Beat GAN in Image Super Resolution?
by: Kuznedelev, Denis, et al.
Published: (2024)
by: Kuznedelev, Denis, et al.
Published: (2024)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
by: Tong, Shengbang, et al.
Published: (2026)
by: Tong, Shengbang, et al.
Published: (2026)
MADrive: Memory-Augmented Driving Scene Modeling
by: Karpikova, Polina, et al.
Published: (2025)
by: Karpikova, Polina, et al.
Published: (2025)
YaART: Yet Another ART Rendering Technology
by: Kastryulin, Sergey, et al.
Published: (2024)
by: Kastryulin, Sergey, et al.
Published: (2024)
Fine-Tuning Text-To-Image Diffusion Models for Class-Wise Spurious Feature Generation
by: MaungMaung, AprilPyone, et al.
Published: (2024)
by: MaungMaung, AprilPyone, et al.
Published: (2024)
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
by: Esser, Patrick, et al.
Published: (2024)
by: Esser, Patrick, et al.
Published: (2024)
Visual Implicit Geometry Transformer for Autonomous Driving
by: Shirokov, Arsenii, et al.
Published: (2026)
by: Shirokov, Arsenii, et al.
Published: (2026)
Hierarchical and Step-Layer-Wise Tuning of Attention Specialty for Multi-Instance Synthesis in Diffusion Transformers
by: Zhang, Chunyang, et al.
Published: (2025)
by: Zhang, Chunyang, et al.
Published: (2025)
Robust Curve Detection in Volumetric Medical Imaging via Attraction Field
by: Yaushev, Farukh, et al.
Published: (2024)
by: Yaushev, Farukh, et al.
Published: (2024)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
by: Menapace, Willi, et al.
Published: (2024)
by: Menapace, Willi, et al.
Published: (2024)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
by: Bai, Jinbin, et al.
Published: (2024)
by: Bai, Jinbin, et al.
Published: (2024)
RATLIP: Generative Adversarial CLIP Text-to-Image Synthesis Based on Recurrent Affine Transformations
by: Lin, Chengde, et al.
Published: (2024)
by: Lin, Chengde, et al.
Published: (2024)
PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
by: Chen, Junsong, et al.
Published: (2023)
by: Chen, Junsong, et al.
Published: (2023)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
by: Tang, Bingda, et al.
Published: (2025)
by: Tang, Bingda, et al.
Published: (2025)
Enhancing Adversarial Transferability via Component-Wise Transformation
by: Liu, Hangyu, et al.
Published: (2025)
by: Liu, Hangyu, et al.
Published: (2025)
Quality and Quantity: Unveiling a Million High-Quality Images for Text-to-Image Synthesis in Fashion Design
by: Yu, Jia, et al.
Published: (2023)
by: Yu, Jia, et al.
Published: (2023)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
by: Arkhipkin, Vladimir, et al.
Published: (2024)
by: Arkhipkin, Vladimir, et al.
Published: (2024)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
by: Li, Shufan, et al.
Published: (2025)
by: Li, Shufan, et al.
Published: (2025)
Inverse Bridge Matching Distillation
by: Gushchin, Nikita, et al.
Published: (2025)
by: Gushchin, Nikita, et al.
Published: (2025)
Fine-grained Text to Image Synthesis
by: Ouyang, Xu, et al.
Published: (2024)
by: Ouyang, Xu, et al.
Published: (2024)
Spherical Dense Text-to-Image Synthesis
by: Winter, Timon, et al.
Published: (2025)
by: Winter, Timon, et al.
Published: (2025)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
by: Wang, Lifu, et al.
Published: (2025)
by: Wang, Lifu, et al.
Published: (2025)
Product-Quantised Image Representation for High-Quality Image Synthesis
by: Zavadski, Denis, et al.
Published: (2025)
by: Zavadski, Denis, et al.
Published: (2025)
Regularized Distribution Matching Distillation for One-step Unpaired Image-to-Image Translation
by: Rakitin, Denis, et al.
Published: (2024)
by: Rakitin, Denis, et al.
Published: (2024)
Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets
by: Zhang, Tianxiao, et al.
Published: (2024)
by: Zhang, Tianxiao, et al.
Published: (2024)
Text-to-Image Synthesis: A Decade Survey
by: Zhang, Nonghai, et al.
Published: (2024)
by: Zhang, Nonghai, et al.
Published: (2024)
All-in-One Conditioning for Text-to-Image Synthesis
by: Jayasekara, Hirunima, et al.
Published: (2026)
by: Jayasekara, Hirunima, et al.
Published: (2026)
The Devil is in the Details: StyleFeatureEditor for Detail-Rich StyleGAN Inversion and High Quality Image Editing
by: Bobkov, Denis, et al.
Published: (2024)
by: Bobkov, Denis, et al.
Published: (2024)
A High-Accuracy Fast Hough Transform with Linear-Log-Cubed Computational Complexity for Arbitrary-Shaped Images
by: Kazimirov, Danil, et al.
Published: (2025)
by: Kazimirov, Danil, et al.
Published: (2025)
Similar Items
-
Invertible Consistency Distillation for Text-Guided Image Editing in Around 7 Steps
by: Starodubcev, Nikita, et al.
Published: (2024) -
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
by: Egiazarian, Vage, et al.
Published: (2024) -
Scale-wise Distillation of Diffusion Models
by: Starodubcev, Nikita, et al.
Published: (2025) -
CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based Shading
by: Aliev, Mishan, et al.
Published: (2025) -
Alchemist: Turning Public Text-to-Image Data into Generative Gold
by: Startsev, Valerii, et al.
Published: (2025)