LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Yuzhuo, Ma, Zehua, Wang, Jianhua, Kang, Kai, Yao, Shunyu, Zhang, Weiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity
por: Chen, Yuzhuo, et al.
Publicado: (2025)
por: Chen, Yuzhuo, et al.
Publicado: (2025)
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
por: Chen, Yuzhuo, et al.
Publicado: (2026)
por: Chen, Yuzhuo, et al.
Publicado: (2026)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024)
por: Zhang, Hui, et al.
Publicado: (2024)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
por: Zhang, Ruiqiang, et al.
Publicado: (2026)
I2VWM: Robust Watermarking for Image to Video Generation
por: Wang, Guanjie, et al.
Publicado: (2025)
por: Wang, Guanjie, et al.
Publicado: (2025)
Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers
por: Huang, Sida, et al.
Publicado: (2025)
por: Huang, Sida, et al.
Publicado: (2025)
Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation
por: Zhang, Haojie, et al.
Publicado: (2024)
por: Zhang, Haojie, et al.
Publicado: (2024)
InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
por: Xiang, Qiang, et al.
Publicado: (2025)
por: Xiang, Qiang, et al.
Publicado: (2025)
ConsistCompose: Unified Multimodal Layout Control for Image Composition
por: Shi, Xuanke, et al.
Publicado: (2025)
por: Shi, Xuanke, et al.
Publicado: (2025)
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
por: Yu, Ning, et al.
Publicado: (2022)
por: Yu, Ning, et al.
Publicado: (2022)
Manga Generation via Layout-controllable Diffusion
por: Chen, Siyu, et al.
Publicado: (2024)
por: Chen, Siyu, et al.
Publicado: (2024)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
por: Chen, Huancheng, et al.
Publicado: (2024)
por: Chen, Huancheng, et al.
Publicado: (2024)
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation
por: Horita, Daichi, et al.
Publicado: (2023)
por: Horita, Daichi, et al.
Publicado: (2023)
Layout2Scene: 3D Semantic Layout Guided Scene Generation via Geometry and Appearance Diffusion Priors
por: Chen, Minglin, et al.
Publicado: (2025)
por: Chen, Minglin, et al.
Publicado: (2025)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
Consistent Image Layout Editing with Diffusion Models
por: Xia, Tao, et al.
Publicado: (2025)
por: Xia, Tao, et al.
Publicado: (2025)
Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer
por: Wu, Shuang, et al.
Publicado: (2024)
por: Wu, Shuang, et al.
Publicado: (2024)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
por: Shou, Yuntao, et al.
Publicado: (2026)
por: Shou, Yuntao, et al.
Publicado: (2026)
STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation
por: Wang, Ruyu, et al.
Publicado: (2025)
por: Wang, Ruyu, et al.
Publicado: (2025)
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
por: Ma, Ao, et al.
Publicado: (2025)
por: Ma, Ao, et al.
Publicado: (2025)
360 Layout Estimation via Orthogonal Planes Disentanglement and Multi-view Geometric Consistency Perception
por: Shen, Zhijie, et al.
Publicado: (2023)
por: Shen, Zhijie, et al.
Publicado: (2023)
Prior Normality Prompt Transformer for Multi-class Industrial Image Anomaly Detection
por: Yao, Haiming, et al.
Publicado: (2024)
por: Yao, Haiming, et al.
Publicado: (2024)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
por: Liu, Zeyang, et al.
Publicado: (2025)
por: Liu, Zeyang, et al.
Publicado: (2025)
Multi-Scale Diffusion: Enhancing Spatial Layout in High-Resolution Panoramic Image Generation
por: Zhang, Xiaoyu, et al.
Publicado: (2024)
por: Zhang, Xiaoyu, et al.
Publicado: (2024)
Multitwine: Multi-Object Compositing with Text and Layout Control
por: Tarrés, Gemma Canet, et al.
Publicado: (2025)
por: Tarrés, Gemma Canet, et al.
Publicado: (2025)
LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
por: Fan, Zezhong, et al.
Publicado: (2025)
por: Fan, Zezhong, et al.
Publicado: (2025)
Relation-Aware Diffusion Model for Controllable Poster Layout Generation
por: Li, Fengheng, et al.
Publicado: (2023)
por: Li, Fengheng, et al.
Publicado: (2023)
M3-AGIQA: Multimodal, Multi-Round, Multi-Aspect AI-Generated Image Quality Assessment
por: Cui, Chuan, et al.
Publicado: (2025)
por: Cui, Chuan, et al.
Publicado: (2025)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
por: Wang, Xierui, et al.
Publicado: (2024)
por: Wang, Xierui, et al.
Publicado: (2024)
SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models
por: Yang, Yang, et al.
Publicado: (2026)
por: Yang, Yang, et al.
Publicado: (2026)
Griffin: Generative Reference and Layout Guided Image Composition
por: Mikaeili, Aryan, et al.
Publicado: (2025)
por: Mikaeili, Aryan, et al.
Publicado: (2025)
DLAFormer: An End-to-End Transformer For Document Layout Analysis
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning
por: Wu, Changti, et al.
Publicado: (2026)
por: Wu, Changti, et al.
Publicado: (2026)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
por: Zheng, Guangcong, et al.
Publicado: (2023)
por: Zheng, Guangcong, et al.
Publicado: (2023)
VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and Merging
por: Shirakawa, Takahiro, et al.
Publicado: (2024)
por: Shirakawa, Takahiro, et al.
Publicado: (2024)
DiffOSeg: Omni Medical Image Segmentation via Multi-Expert Collaboration Diffusion Model
por: Zhang, Han, et al.
Publicado: (2025)
por: Zhang, Han, et al.
Publicado: (2025)
Spatial Diffusion for Cell Layout Generation
por: Li, Chen, et al.
Publicado: (2024)
por: Li, Chen, et al.
Publicado: (2024)
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
por: Gou, Yunhao, et al.
Publicado: (2024)
por: Gou, Yunhao, et al.
Publicado: (2024)
Universal Multi-view Black-box Attack against Object Detectors via Layout Optimization
por: Wang, Donghua, et al.
Publicado: (2024)
por: Wang, Donghua, et al.
Publicado: (2024)
Ejemplares similares
-
TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity
por: Chen, Yuzhuo, et al.
Publicado: (2025) -
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
por: Chen, Yuzhuo, et al.
Publicado: (2026) -
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024) -
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
por: Zhang, Ruiqiang, et al.
Publicado: (2026) -
I2VWM: Robust Watermarking for Image to Video Generation
por: Wang, Guanjie, et al.
Publicado: (2025)