Control and Realism: Best of Both Worlds in Layout-to-Image without Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Bonan, Hu, Yinhan, Liu, Songhua, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
di: Zhou, Letian, et al.
Pubblicazione: (2025)
di: Zhou, Letian, et al.
Pubblicazione: (2025)
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
di: li, Bonan, et al.
Pubblicazione: (2025)
di: li, Bonan, et al.
Pubblicazione: (2025)
Flash Sculptor: Modular 3D Worlds from Objects
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Image Editing As Programs with Diffusion Models
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
Focus on Neighbors and Know the Whole: Towards Consistent Dense Multiview Text-to-Image Generator for 3D Creation
di: Li, Bonan, et al.
Pubblicazione: (2024)
di: Li, Bonan, et al.
Pubblicazione: (2024)
LinFusion: 1 GPU, 1 Minute, 16K Image
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Rethinking Large-scale Dataset Compression: Shifting Focus From Labels to Images
di: Xiao, Lingao, et al.
Pubblicazione: (2025)
di: Xiao, Lingao, et al.
Pubblicazione: (2025)
Understanding Dataset Distillation via Spectral Filtering
di: Bo, Deyu, et al.
Pubblicazione: (2025)
di: Bo, Deyu, et al.
Pubblicazione: (2025)
One-shot Federated Learning via Synthetic Distiller-Distillate Communication
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
Ultra-Resolution Adaptation with Ease
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
OminiControl2: Efficient Conditioning for Diffusion Transformers
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
MindBridge: A Cross-Subject Brain Decoding Framework
di: Wang, Shizun, et al.
Pubblicazione: (2024)
di: Wang, Shizun, et al.
Pubblicazione: (2024)
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
Distilled Datamodel with Reverse Gradient Matching
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
Heavy Labels Out! Dataset Distillation with Label Space Lightening
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
OminiControl: Minimal and Universal Control for Diffusion Transformer
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
StyO: Stylize Your Face in Only One-shot
di: Li, Bonan, et al.
Pubblicazione: (2023)
di: Li, Bonan, et al.
Pubblicazione: (2023)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
di: Ohanyan, Marianna, et al.
Pubblicazione: (2024)
di: Ohanyan, Marianna, et al.
Pubblicazione: (2024)
PCDepth: Pattern-based Complementary Learning for Monocular Depth Estimation by Best of Both Worlds
di: Liu, Haotian, et al.
Pubblicazione: (2024)
di: Liu, Haotian, et al.
Pubblicazione: (2024)
SpotEdit: Selective Region Editing in Diffusion Transformers
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
Vision Bridge Transformer at Scale
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
StyDeSty: Min-Max Stylization and Destylization for Single Domain Generalization
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
di: Susladkar, Onkar, et al.
Pubblicazione: (2026)
di: Susladkar, Onkar, et al.
Pubblicazione: (2026)
Hash3D: Training-free Acceleration for 3D Generation
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
Temporally Propagated Masks and Bounding Boxes: Combining the Best of Both Worlds for Multi-Object Tracking
di: Stanczyk, Tomasz, et al.
Pubblicazione: (2024)
di: Stanczyk, Tomasz, et al.
Pubblicazione: (2024)
Realism Control One-step Diffusion for Real-World Image Super-Resolution
di: Wu, Zongliang, et al.
Pubblicazione: (2025)
di: Wu, Zongliang, et al.
Pubblicazione: (2025)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
ConsistCompose: Unified Multimodal Layout Control for Image Composition
di: Shi, Xuanke, et al.
Pubblicazione: (2025)
di: Shi, Xuanke, et al.
Pubblicazione: (2025)
LoCo: Locally Constrained Training-Free Layout-to-Image Synthesis
di: Zhao, Peiang, et al.
Pubblicazione: (2023)
di: Zhao, Peiang, et al.
Pubblicazione: (2023)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
Rethinking The Training And Evaluation of Rich-Context Layout-to-Image Generation
di: Cheng, Jiaxin, et al.
Pubblicazione: (2024)
di: Cheng, Jiaxin, et al.
Pubblicazione: (2024)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
di: Gong, Biao, et al.
Pubblicazione: (2023)
di: Gong, Biao, et al.
Pubblicazione: (2023)
ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts
di: Huang, Linhao, et al.
Pubblicazione: (2025)
di: Huang, Linhao, et al.
Pubblicazione: (2025)
MultiAnimate: Pose-Guided Image Animation Made Extensible
di: Hu, Yingcheng, et al.
Pubblicazione: (2026)
di: Hu, Yingcheng, et al.
Pubblicazione: (2026)
DSConv: Dynamic Splitting Convolution for Pansharpening
di: Liu, Xuanyu, et al.
Pubblicazione: (2025)
di: Liu, Xuanyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
di: Zhou, Letian, et al.
Pubblicazione: (2025) -
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
di: Liu, Yuhe, et al.
Pubblicazione: (2026) -
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
di: li, Bonan, et al.
Pubblicazione: (2025) -
Flash Sculptor: Modular 3D Worlds from Objects
di: Hu, Yujia, et al.
Pubblicazione: (2025) -
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
di: Liu, Songhua, et al.
Pubblicazione: (2024)