InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Xiang, Qiang, Sun, Shuang, Li, Binglei, Song, Dejia, Li, Huaxia, Chen, Nemo, Tang, Xu, Hu, Yao, Zhang, Junping
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866911235935567872
author Xiang, Qiang
Sun, Shuang
Li, Binglei
Song, Dejia
Li, Huaxia
Chen, Nemo
Tang, Xu
Hu, Yao
Zhang, Junping
author_facet Xiang, Qiang
Sun, Shuang
Li, Binglei
Song, Dejia
Li, Huaxia
Chen, Nemo
Tang, Xu
Hu, Yao
Zhang, Junping
contents Diffusion models have demonstrated remarkable capabilities in generating high-quality images. Recent advancements in Layout-to-Image (L2I) generation have leveraged positional conditions and textual descriptions to facilitate precise and controllable image synthesis. Despite overall progress, current L2I methods still exhibit suboptimal performance. Therefore, we propose InstanceAssemble, a novel architecture that incorporates layout conditions via instance-assembling attention, enabling position control with bounding boxes (bbox) and multimodal content control including texts and additional visual content. Our method achieves flexible adaption to existing DiT-based T2I models through light-weighted LoRA modules. Additionally, we propose a Layout-to-Image benchmark, Denselayout, a comprehensive benchmark for layout-to-image generation, containing 5k images with 90k instances in total. We further introduce Layout Grounding Score (LGS), an interpretable evaluation metric to more precisely assess the accuracy of L2I generation. Experiments demonstrate that our InstanceAssemble method achieves state-of-the-art performance under complex layout conditions, while exhibiting strong compatibility with diverse style LoRA modules. The code and pretrained models are publicly available at https://github.com/FireRedTeam/InstanceAssemble.
format Preprint
id arxiv_https___arxiv_org_abs_2509_16691
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
Xiang, Qiang
Sun, Shuang
Li, Binglei
Song, Dejia
Li, Huaxia
Chen, Nemo
Tang, Xu
Hu, Yao
Zhang, Junping
Computer Vision and Pattern Recognition
Diffusion models have demonstrated remarkable capabilities in generating high-quality images. Recent advancements in Layout-to-Image (L2I) generation have leveraged positional conditions and textual descriptions to facilitate precise and controllable image synthesis. Despite overall progress, current L2I methods still exhibit suboptimal performance. Therefore, we propose InstanceAssemble, a novel architecture that incorporates layout conditions via instance-assembling attention, enabling position control with bounding boxes (bbox) and multimodal content control including texts and additional visual content. Our method achieves flexible adaption to existing DiT-based T2I models through light-weighted LoRA modules. Additionally, we propose a Layout-to-Image benchmark, Denselayout, a comprehensive benchmark for layout-to-image generation, containing 5k images with 90k instances in total. We further introduce Layout Grounding Score (LGS), an interpretable evaluation metric to more precisely assess the accuracy of L2I generation. Experiments demonstrate that our InstanceAssemble method achieves state-of-the-art performance under complex layout conditions, while exhibiting strong compatibility with diverse style LoRA modules. The code and pretrained models are publicly available at https://github.com/FireRedTeam/InstanceAssemble.
title InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2509.16691