HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Bo, Ma, Yuhang, Wu, Liebucha, Liu, Shanyuan, Ma, Ao, Wu, Xiaoyu, Leng, Dawei, Yin, Yuhui |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
by: He, Runze, et al.
Published: (2025)
by: He, Runze, et al.
Published: (2025)
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
by: Ma, Yuhang, et al.
Published: (2025)
by: Ma, Yuhang, et al.
Published: (2025)
NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
by: Liu, Shanyuan, et al.
Published: (2025)
by: Liu, Shanyuan, et al.
Published: (2025)
Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities
by: Liu, Shanyuan, et al.
Published: (2023)
by: Liu, Shanyuan, et al.
Published: (2023)
CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
by: Gong, Yue, et al.
Published: (2025)
by: Gong, Yue, et al.
Published: (2025)
RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing
by: Gong, Yue, et al.
Published: (2026)
by: Gong, Yue, et al.
Published: (2026)
RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition
by: Wang, Binhao, et al.
Published: (2026)
by: Wang, Binhao, et al.
Published: (2026)
FLUX-Makeup: High-Fidelity, Identity-Consistent, and Robust Makeup Transfer via Diffusion Transformer
by: Zhu, Jian, et al.
Published: (2025)
by: Zhu, Jian, et al.
Published: (2025)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
by: Zhang, Zhanjie, et al.
Published: (2025)
by: Zhang, Zhanjie, et al.
Published: (2025)
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
by: Wang, Jing, et al.
Published: (2025)
by: Wang, Jing, et al.
Published: (2025)
RefTon: Reference person shot assist virtual Try-on
by: Li, Liuzhuozheng, et al.
Published: (2025)
by: Li, Liuzhuozheng, et al.
Published: (2025)
Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task
by: Wang, Jing, et al.
Published: (2024)
by: Wang, Jing, et al.
Published: (2024)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
by: Zheng, Guangcong, et al.
Published: (2023)
by: Zheng, Guangcong, et al.
Published: (2023)
LMM-Det: Make Large Multimodal Models Excel in Object Detection
by: Li, Jincheng, et al.
Published: (2025)
by: Li, Jincheng, et al.
Published: (2025)
HiDiGen: Hierarchical Diffusion for B-Rep Generation with Explicit Topological Constraints
by: Liu, Shurui, et al.
Published: (2026)
by: Liu, Shurui, et al.
Published: (2026)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
by: Yang, Hongji, et al.
Published: (2025)
by: Yang, Hongji, et al.
Published: (2025)
Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image segmentation
by: Tang, Fenghe, et al.
Published: (2025)
by: Tang, Fenghe, et al.
Published: (2025)
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
by: Ma, Ao, et al.
Published: (2025)
by: Ma, Ao, et al.
Published: (2025)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
by: Xie, Chunyu, et al.
Published: (2025)
by: Xie, Chunyu, et al.
Published: (2025)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
by: Li, Yu, et al.
Published: (2024)
by: Li, Yu, et al.
Published: (2024)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
by: Wu, Hao, et al.
Published: (2026)
by: Wu, Hao, et al.
Published: (2026)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
by: Zhang, Hui, et al.
Published: (2024)
by: Zhang, Hui, et al.
Published: (2024)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
by: Ye, Maoyuan, et al.
Published: (2024)
by: Ye, Maoyuan, et al.
Published: (2024)
Relation-Aware Diffusion Model for Controllable Poster Layout Generation
by: Li, Fengheng, et al.
Published: (2023)
by: Li, Fengheng, et al.
Published: (2023)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
by: Jian, Weijian, et al.
Published: (2025)
by: Jian, Weijian, et al.
Published: (2025)
STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation
by: Wang, Ruyu, et al.
Published: (2025)
by: Wang, Ruyu, et al.
Published: (2025)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
by: Zhang, Jianke, et al.
Published: (2024)
by: Zhang, Jianke, et al.
Published: (2024)
Layout2Scene: 3D Semantic Layout Guided Scene Generation via Geometry and Appearance Diffusion Priors
by: Chen, Minglin, et al.
Published: (2025)
by: Chen, Minglin, et al.
Published: (2025)
Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Design
by: Tang, Wenxin, et al.
Published: (2025)
by: Tang, Wenxin, et al.
Published: (2025)
HiGFA: Hierarchical Guidance for Fine-grained Data Augmentation with Diffusion Models
by: Lu, Zhiguang, et al.
Published: (2025)
by: Lu, Zhiguang, et al.
Published: (2025)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
by: Bu, Jiazi, et al.
Published: (2025)
by: Bu, Jiazi, et al.
Published: (2025)
Hi3DEval: Advancing 3D Generation Evaluation with Hierarchical Validity
by: Zhang, Yuhan, et al.
Published: (2025)
by: Zhang, Yuhan, et al.
Published: (2025)
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
by: Shi, Hengyu, et al.
Published: (2025)
by: Shi, Hengyu, et al.
Published: (2025)
Co-Layout: LLM-driven Co-optimization for Interior Layout
by: Xiang, Chucheng, et al.
Published: (2025)
by: Xiang, Chucheng, et al.
Published: (2025)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
by: Wu, Yuxuan, et al.
Published: (2025)
by: Wu, Yuxuan, et al.
Published: (2025)
Multi-Scale Diffusion: Enhancing Spatial Layout in High-Resolution Panoramic Image Generation
by: Zhang, Xiaoyu, et al.
Published: (2024)
by: Zhang, Xiaoyu, et al.
Published: (2024)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
by: Dong, Wenqi, et al.
Published: (2025)
by: Dong, Wenqi, et al.
Published: (2025)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
by: Liu, Xianjie, et al.
Published: (2025)
by: Liu, Xianjie, et al.
Published: (2025)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
by: Shou, Yuntao, et al.
Published: (2026)
by: Shou, Yuntao, et al.
Published: (2026)
Similar Items
-
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
by: He, Runze, et al.
Published: (2025) -
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
by: Ma, Yuhang, et al.
Published: (2025) -
NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
by: Liu, Shanyuan, et al.
Published: (2025) -
Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities
by: Liu, Shanyuan, et al.
Published: (2023) -
CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
by: Gong, Yue, et al.
Published: (2025)