Generating Compositional Scenes via Text-to-image RGBA Instance Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Fontanella, Alessandro, Tudosiu, Petru-Daniel, Yang, Yongxin, Zhang, Shifeng, Parisot, Sarah |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
di: Xia, Guoxuan, et al.
Pubblicazione: (2025)
di: Xia, Guoxuan, et al.
Pubblicazione: (2025)
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024)
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
di: Dutt, Raman, et al.
Pubblicazione: (2025)
di: Dutt, Raman, et al.
Pubblicazione: (2025)
SceneForge: Structured World Supervision from 3D Interventions
di: Li, Jizhizi, et al.
Pubblicazione: (2026)
di: Li, Jizhizi, et al.
Pubblicazione: (2026)
Alfie: Democratising RGBA Image Generation With No $$$
di: Quattrini, Fabio, et al.
Pubblicazione: (2024)
di: Quattrini, Fabio, et al.
Pubblicazione: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
di: Liu, Minghao, et al.
Pubblicazione: (2024)
di: Liu, Minghao, et al.
Pubblicazione: (2024)
GALOT: Generative Active Learning via Optimizable Zero-shot Text-to-image Generation
di: Hong, Hanbin, et al.
Pubblicazione: (2024)
di: Hong, Hanbin, et al.
Pubblicazione: (2024)
Progressive Compositionality in Text-to-Image Generative Models
di: Han, Evans Xu, et al.
Pubblicazione: (2024)
di: Han, Evans Xu, et al.
Pubblicazione: (2024)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2026)
di: Tran, Minh-Tuan, et al.
Pubblicazione: (2026)
TransAnimate: Taming Layer Diffusion to Generate RGBA Video
di: Chen, Xuewei, et al.
Pubblicazione: (2025)
di: Chen, Xuewei, et al.
Pubblicazione: (2025)
CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization
di: Zhao, Zelin, et al.
Pubblicazione: (2025)
di: Zhao, Zelin, et al.
Pubblicazione: (2025)
CADKnitter: Compositional CAD Generation from Text and Geometry Guidance
di: Le, Tri, et al.
Pubblicazione: (2025)
di: Le, Tri, et al.
Pubblicazione: (2025)
Enhancing Compositional Generalization via Compositional Feature Alignment
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
di: Srivastava, Divyansh, et al.
Pubblicazione: (2025)
di: Srivastava, Divyansh, et al.
Pubblicazione: (2025)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
Laplacian Multi-scale Flow Matching for Generative Modeling
di: Zhao, Zelin, et al.
Pubblicazione: (2026)
di: Zhao, Zelin, et al.
Pubblicazione: (2026)
Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
di: Fan, Lijie, et al.
Pubblicazione: (2024)
di: Fan, Lijie, et al.
Pubblicazione: (2024)
InstanceDiffusion: Instance-level Control for Image Generation
di: Wang, Xudong, et al.
Pubblicazione: (2024)
di: Wang, Xudong, et al.
Pubblicazione: (2024)
ISCUTE: Instance Segmentation of Cables Using Text Embedding
di: Kozlovsky, Shir, et al.
Pubblicazione: (2024)
di: Kozlovsky, Shir, et al.
Pubblicazione: (2024)
Text-to-image Diffusion Models in Generative AI: A Survey
di: Zhang, Chenshuang, et al.
Pubblicazione: (2023)
di: Zhang, Chenshuang, et al.
Pubblicazione: (2023)
Unbiased Scene Graph Generation from Biased Training
di: Tang, Kaihua, et al.
Pubblicazione: (2020)
di: Tang, Kaihua, et al.
Pubblicazione: (2020)
A Fair Ranking and New Model for Panoptic Scene Graph Generation
di: Lorenz, Julian, et al.
Pubblicazione: (2024)
di: Lorenz, Julian, et al.
Pubblicazione: (2024)
EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
di: Mun, Sunung, et al.
Pubblicazione: (2026)
di: Mun, Sunung, et al.
Pubblicazione: (2026)
All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds
di: Li, Shuangqi, et al.
Pubblicazione: (2024)
di: Li, Shuangqi, et al.
Pubblicazione: (2024)
InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes
di: Shahbazi, Mohamad, et al.
Pubblicazione: (2024)
di: Shahbazi, Mohamad, et al.
Pubblicazione: (2024)
Phrase-Instance Alignment for Generalized Referring Segmentation
di: Nguyen, E-Ro, et al.
Pubblicazione: (2024)
di: Nguyen, E-Ro, et al.
Pubblicazione: (2024)
gen2seg: Generative Models Enable Generalizable Instance Segmentation
di: Khangaonkar, Om, et al.
Pubblicazione: (2025)
di: Khangaonkar, Om, et al.
Pubblicazione: (2025)
Skews in the Phenomenon Space Hinder Generalization in Text-to-Image Generation
di: Chang, Yingshan, et al.
Pubblicazione: (2024)
di: Chang, Yingshan, et al.
Pubblicazione: (2024)
EP-Diffuser: An Efficient Diffusion Model for Traffic Scene Generation and Prediction via Polynomial Representations
di: Yao, Yue, et al.
Pubblicazione: (2025)
di: Yao, Yue, et al.
Pubblicazione: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Text-to-Scene with Large Reasoning Models
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation
di: Zhang, Yuhang, et al.
Pubblicazione: (2024)
di: Zhang, Yuhang, et al.
Pubblicazione: (2024)
Decision Boundary-aware Knowledge Consolidation Generates Better Instance-Incremental Learner
di: Nie, Qiang, et al.
Pubblicazione: (2024)
di: Nie, Qiang, et al.
Pubblicazione: (2024)
Compositional Text-to-Image Generation with Dense Blob Representations
di: Nie, Weili, et al.
Pubblicazione: (2024)
di: Nie, Weili, et al.
Pubblicazione: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
di: Zhai, Guangyao, et al.
Pubblicazione: (2024)
di: Zhai, Guangyao, et al.
Pubblicazione: (2024)
Multisource Collaborative Domain Generalization for Cross-Scene Remote Sensing Image Classification
di: Han, Zhu, et al.
Pubblicazione: (2024)
di: Han, Zhu, et al.
Pubblicazione: (2024)
Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
di: Li, Chao, et al.
Pubblicazione: (2026)
di: Li, Chao, et al.
Pubblicazione: (2026)
PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance
di: Zhou, Yujing, et al.
Pubblicazione: (2026)
di: Zhou, Yujing, et al.
Pubblicazione: (2026)
Disentangled 3D Scene Generation with Layout Learning
di: Epstein, Dave, et al.
Pubblicazione: (2024)
di: Epstein, Dave, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
di: Xia, Guoxuan, et al.
Pubblicazione: (2025) -
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024) -
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
di: Dutt, Raman, et al.
Pubblicazione: (2025) -
SceneForge: Structured World Supervision from 3D Interventions
di: Li, Jizhizi, et al.
Pubblicazione: (2026) -
Alfie: Democratising RGBA Image Generation With No $$$
di: Quattrini, Fabio, et al.
Pubblicazione: (2024)