PiCo: Enhancing Text-Image Alignment with Improved Noise Selection and Precise Mask Control in Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Chang, Zhuang, Chenyi, Gao, Pan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection
by: Yan, Teng, et al.
Published: (2026)
by: Yan, Teng, et al.
Published: (2026)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
by: Zhuang, Chenyi, et al.
Published: (2024)
by: Zhuang, Chenyi, et al.
Published: (2024)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
by: Hu, Ying, et al.
Published: (2024)
by: Hu, Ying, et al.
Published: (2024)
CDFormer:When Degradation Prediction Embraces Diffusion Model for Blind Image Super-Resolution
by: Liu, Qingguo, et al.
Published: (2024)
by: Liu, Qingguo, et al.
Published: (2024)
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
by: Parihar, Rishubh, et al.
Published: (2024)
by: Parihar, Rishubh, et al.
Published: (2024)
AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
by: Wang, Yidan, et al.
Published: (2025)
by: Wang, Yidan, et al.
Published: (2025)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
by: Huang, Jun, et al.
Published: (2025)
by: Huang, Jun, et al.
Published: (2025)
MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion
by: Zhan, Zechao, et al.
Published: (2024)
by: Zhan, Zechao, et al.
Published: (2024)
CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation
by: Bose, Rupak, et al.
Published: (2025)
by: Bose, Rupak, et al.
Published: (2025)
AMNS: Attention-Weighted Selective Mask and Noise Label Suppression for Text-to-Image Person Retrieval
by: Zhang, Runqing, et al.
Published: (2024)
by: Zhang, Runqing, et al.
Published: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
by: Liu, Luping, et al.
Published: (2024)
by: Liu, Luping, et al.
Published: (2024)
Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis
by: Miao, Boming, et al.
Published: (2024)
by: Miao, Boming, et al.
Published: (2024)
Mimir: Improving Video Diffusion Models for Precise Text Understanding
by: Tan, Shuai, et al.
Published: (2024)
by: Tan, Shuai, et al.
Published: (2024)
ECNet: Effective Controllable Text-to-Image Diffusion Models
by: Li, Sicheng, et al.
Published: (2024)
by: Li, Sicheng, et al.
Published: (2024)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
by: Xiao, Changming, et al.
Published: (2023)
by: Xiao, Changming, et al.
Published: (2023)
CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models
by: Zhang, Gaoyang, et al.
Published: (2024)
by: Zhang, Gaoyang, et al.
Published: (2024)
Personalized Safety Alignment for Text-to-Image Diffusion Models
by: Lei, Yu, et al.
Published: (2025)
by: Lei, Yu, et al.
Published: (2025)
Bokeh Diffusion: Defocus Blur Control in Text-to-Image Diffusion Models
by: Fortes, Armando, et al.
Published: (2025)
by: Fortes, Armando, et al.
Published: (2025)
Frequency-Controlled Diffusion Model for Versatile Text-Guided Image-to-Image Translation
by: Gao, Xiang, et al.
Published: (2024)
by: Gao, Xiang, et al.
Published: (2024)
FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation
by: Gao, Xiang, et al.
Published: (2026)
by: Gao, Xiang, et al.
Published: (2026)
VMix: Improving Text-to-Image Diffusion Model with Cross-Attention Mixing Control
by: Wu, Shaojin, et al.
Published: (2024)
by: Wu, Shaojin, et al.
Published: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
by: Gao, Shanghua, et al.
Published: (2023)
by: Gao, Shanghua, et al.
Published: (2023)
Not All Noises Are Created Equally:Diffusion Noise Selection and Optimization
by: Qi, Zipeng, et al.
Published: (2024)
by: Qi, Zipeng, et al.
Published: (2024)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
by: Liu, Baolin, et al.
Published: (2023)
by: Liu, Baolin, et al.
Published: (2023)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
by: Luo, Yifu, et al.
Published: (2025)
by: Luo, Yifu, et al.
Published: (2025)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
by: Wang, Zixiao, et al.
Published: (2024)
by: Wang, Zixiao, et al.
Published: (2024)
Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models
by: Han, Hyeonggeun, et al.
Published: (2025)
by: Han, Hyeonggeun, et al.
Published: (2025)
PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling
by: Lee, Junmyeong, et al.
Published: (2025)
by: Lee, Junmyeong, et al.
Published: (2025)
Text-to-Image Alignment in Denoising-Based Models through Step Selection
by: Grimal, Paul, et al.
Published: (2025)
by: Grimal, Paul, et al.
Published: (2025)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
by: He, Qingdong, et al.
Published: (2024)
by: He, Qingdong, et al.
Published: (2024)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
by: Lin, Tiancheng, et al.
Published: (2024)
by: Lin, Tiancheng, et al.
Published: (2024)
AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models
by: Agarwal, Aishwarya, et al.
Published: (2024)
by: Agarwal, Aishwarya, et al.
Published: (2024)
NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and Merging
by: Shirakawa, Takahiro, et al.
Published: (2024)
by: Shirakawa, Takahiro, et al.
Published: (2024)
CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval
by: Qian, Zhipeng, et al.
Published: (2026)
by: Qian, Zhipeng, et al.
Published: (2026)
InitNO: Boosting Text-to-Image Diffusion Models via Initial Noise Optimization
by: Guo, Xiefan, et al.
Published: (2024)
by: Guo, Xiefan, et al.
Published: (2024)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
by: Tang, Bingda, et al.
Published: (2025)
by: Tang, Bingda, et al.
Published: (2025)
MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation
by: Chang, Yu, et al.
Published: (2025)
by: Chang, Yu, et al.
Published: (2025)
DNAEdit: Direct Noise Alignment for Text-Guided Rectified Flow Editing
by: Xie, Chenxi, et al.
Published: (2025)
by: Xie, Chenxi, et al.
Published: (2025)
Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
by: Gao, Yurong, et al.
Published: (2026)
by: Gao, Yurong, et al.
Published: (2026)
Similar Items
-
PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection
by: Yan, Teng, et al.
Published: (2026) -
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
by: Zhuang, Chenyi, et al.
Published: (2024) -
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
by: Hu, Ying, et al.
Published: (2024) -
CDFormer:When Degradation Prediction Embraces Diffusion Model for Blind Image Super-Resolution
by: Liu, Qingguo, et al.
Published: (2024) -
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
by: Parihar, Rishubh, et al.
Published: (2024)