Scaling Down Text Encoders of Text-to-Image Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Lifu, Liu, Daqing, Liu, Xinchen, He, Xiaodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models
por: Li, Senmao, et al.
Publicado: (2025)
por: Li, Senmao, et al.
Publicado: (2025)
Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
por: Chen, Chaofeng, et al.
Publicado: (2023)
por: Chen, Chaofeng, et al.
Publicado: (2023)
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
por: Kou, Siqi, et al.
Publicado: (2026)
por: Kou, Siqi, et al.
Publicado: (2026)
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
por: Park, NaHyeon, et al.
Publicado: (2024)
por: Park, NaHyeon, et al.
Publicado: (2024)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
por: Liu, Baolin, et al.
Publicado: (2023)
por: Liu, Baolin, et al.
Publicado: (2023)
Text-Guided Semantic Image Encoder
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2025)
por: Thirukovalluru, Raghuveer, et al.
Publicado: (2025)
Debiasing Text-to-Image Diffusion Models
por: He, Ruifei, et al.
Publicado: (2024)
por: He, Ruifei, et al.
Publicado: (2024)
AID: Attention Interpolation of Text-to-Image Diffusion
por: He, Qiyuan, et al.
Publicado: (2024)
por: He, Qiyuan, et al.
Publicado: (2024)
Language-Image Alignment with Fixed Text Encoders
por: Yang, Jingfeng, et al.
Publicado: (2025)
por: Yang, Jingfeng, et al.
Publicado: (2025)
Local Conditional Controlling for Text-to-Image Diffusion Models
por: Zhao, Yibo, et al.
Publicado: (2023)
por: Zhao, Yibo, et al.
Publicado: (2023)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
One Stone with Two Birds: A Null-Text-Null Frequency-Aware Diffusion Models for Text-Guided Image Inpainting
por: Liu, Haipeng, et al.
Publicado: (2025)
por: Liu, Haipeng, et al.
Publicado: (2025)
VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control
por: Wu, Shaojin, et al.
Publicado: (2024)
por: Wu, Shaojin, et al.
Publicado: (2024)
Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
por: Khan, Faizan Farooq, et al.
Publicado: (2025)
por: Khan, Faizan Farooq, et al.
Publicado: (2025)
Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation
por: Zhang, Chi, et al.
Publicado: (2026)
por: Zhang, Chi, et al.
Publicado: (2026)
Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models
por: Pernias, Pablo, et al.
Publicado: (2023)
por: Pernias, Pablo, et al.
Publicado: (2023)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
por: Zhu, Yi, et al.
Publicado: (2024)
por: Zhu, Yi, et al.
Publicado: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
por: Liu, Luping, et al.
Publicado: (2024)
por: Liu, Luping, et al.
Publicado: (2024)
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
por: Zhang, Shilong, et al.
Publicado: (2025)
por: Zhang, Shilong, et al.
Publicado: (2025)
Diffusion Lens: Interpreting Text Encoders in Text-to-Image Pipelines
por: Toker, Michael, et al.
Publicado: (2024)
por: Toker, Michael, et al.
Publicado: (2024)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
por: Zhou, Letian, et al.
Publicado: (2025)
por: Zhou, Letian, et al.
Publicado: (2025)
TextCraftor: Your Text Encoder Can be Image Quality Controller
por: Li, Yanyu, et al.
Publicado: (2024)
por: Li, Yanyu, et al.
Publicado: (2024)
Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised Trackers
por: Zhang, Zhengbo, et al.
Publicado: (2024)
por: Zhang, Zhengbo, et al.
Publicado: (2024)
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
por: Xiang, Qianlong, et al.
Publicado: (2026)
por: Xiang, Qianlong, et al.
Publicado: (2026)
Frequency-Controlled Diffusion Model for Versatile Text-Guided Image-to-Image Translation
por: Gao, Xiang, et al.
Publicado: (2024)
por: Gao, Xiang, et al.
Publicado: (2024)
Uncovering the Text Embedding in Text-to-Image Diffusion Models
por: Yu, Hu, et al.
Publicado: (2024)
por: Yu, Hu, et al.
Publicado: (2024)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
por: Wang, Zixiao, et al.
Publicado: (2024)
por: Wang, Zixiao, et al.
Publicado: (2024)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)
por: Liu, Zeyu, et al.
Publicado: (2024)
VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder
por: Tang, Zhicong, et al.
Publicado: (2023)
por: Tang, Zhicong, et al.
Publicado: (2023)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
por: Wang, Tong, et al.
Publicado: (2025)
por: Wang, Tong, et al.
Publicado: (2025)
Holistic Evaluation for Interleaved Text-and-Image Generation
por: Liu, Minqian, et al.
Publicado: (2024)
por: Liu, Minqian, et al.
Publicado: (2024)
Versatile Diffusion: Text, Images and Variations All in One Diffusion Model
por: Xu, Xingqian, et al.
Publicado: (2022)
por: Xu, Xingqian, et al.
Publicado: (2022)
Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation
por: Hu, Minghui, et al.
Publicado: (2023)
por: Hu, Minghui, et al.
Publicado: (2023)
Origin Identification for Text-Guided Image-to-Image Diffusion Models
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
Text-Anchored Score Composition: Tackling Condition Misalignment in Text-to-Image Diffusion Models
por: Wang, Luozhou, et al.
Publicado: (2023)
por: Wang, Luozhou, et al.
Publicado: (2023)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
por: Guo, Yuxiang, et al.
Publicado: (2025)
por: Guo, Yuxiang, et al.
Publicado: (2025)
Layout Agnostic Scene Text Image Synthesis with Diffusion Models
por: Zhangli, Qilong, et al.
Publicado: (2024)
por: Zhangli, Qilong, et al.
Publicado: (2024)
OmniPrism: Learning Disentangled Visual Concept for Image Generation
por: Li, Yangyang, et al.
Publicado: (2024)
por: Li, Yangyang, et al.
Publicado: (2024)
LCM-Lookahead for Encoder-based Text-to-Image Personalization
por: Gal, Rinon, et al.
Publicado: (2024)
por: Gal, Rinon, et al.
Publicado: (2024)
Ejemplares similares
-
One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models
por: Li, Senmao, et al.
Publicado: (2025) -
Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
por: Chen, Chaofeng, et al.
Publicado: (2023) -
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
por: Kou, Siqi, et al.
Publicado: (2026) -
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
por: Park, NaHyeon, et al.
Publicado: (2024) -
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025)