Generating Compositional Scenes via Text-to-image RGBA Instance Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Fontanella, Alessandro, Tudosiu, Petru-Daniel, Yang, Yongxin, Zhang, Shifeng, Parisot, Sarah |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
por: Xia, Guoxuan, et al.
Publicado: (2025)
por: Xia, Guoxuan, et al.
Publicado: (2025)
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
por: Tudosiu, Petru-Daniel, et al.
Publicado: (2024)
por: Tudosiu, Petru-Daniel, et al.
Publicado: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
por: Dutt, Raman, et al.
Publicado: (2025)
por: Dutt, Raman, et al.
Publicado: (2025)
SceneForge: Structured World Supervision from 3D Interventions
por: Li, Jizhizi, et al.
Publicado: (2026)
por: Li, Jizhizi, et al.
Publicado: (2026)
Alfie: Democratising RGBA Image Generation With No $$$
por: Quattrini, Fabio, et al.
Publicado: (2024)
por: Quattrini, Fabio, et al.
Publicado: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
por: Liu, Minghao, et al.
Publicado: (2024)
por: Liu, Minghao, et al.
Publicado: (2024)
GALOT: Generative Active Learning via Optimizable Zero-shot Text-to-image Generation
por: Hong, Hanbin, et al.
Publicado: (2024)
por: Hong, Hanbin, et al.
Publicado: (2024)
Progressive Compositionality in Text-to-Image Generative Models
por: Han, Evans Xu, et al.
Publicado: (2024)
por: Han, Evans Xu, et al.
Publicado: (2024)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
por: Tran, Minh-Tuan, et al.
Publicado: (2026)
por: Tran, Minh-Tuan, et al.
Publicado: (2026)
TransAnimate: Taming Layer Diffusion to Generate RGBA Video
por: Chen, Xuewei, et al.
Publicado: (2025)
por: Chen, Xuewei, et al.
Publicado: (2025)
CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization
por: Zhao, Zelin, et al.
Publicado: (2025)
por: Zhao, Zelin, et al.
Publicado: (2025)
CADKnitter: Compositional CAD Generation from Text and Geometry Guidance
por: Le, Tri, et al.
Publicado: (2025)
por: Le, Tri, et al.
Publicado: (2025)
Enhancing Compositional Generalization via Compositional Feature Alignment
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
por: Srivastava, Divyansh, et al.
Publicado: (2025)
por: Srivastava, Divyansh, et al.
Publicado: (2025)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
por: Izadi, Amir Mohammad, et al.
Publicado: (2025)
por: Izadi, Amir Mohammad, et al.
Publicado: (2025)
Laplacian Multi-scale Flow Matching for Generative Modeling
por: Zhao, Zelin, et al.
Publicado: (2026)
por: Zhao, Zelin, et al.
Publicado: (2026)
Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
por: Fan, Lijie, et al.
Publicado: (2024)
por: Fan, Lijie, et al.
Publicado: (2024)
InstanceDiffusion: Instance-level Control for Image Generation
por: Wang, Xudong, et al.
Publicado: (2024)
por: Wang, Xudong, et al.
Publicado: (2024)
ISCUTE: Instance Segmentation of Cables Using Text Embedding
por: Kozlovsky, Shir, et al.
Publicado: (2024)
por: Kozlovsky, Shir, et al.
Publicado: (2024)
Text-to-image Diffusion Models in Generative AI: A Survey
por: Zhang, Chenshuang, et al.
Publicado: (2023)
por: Zhang, Chenshuang, et al.
Publicado: (2023)
Unbiased Scene Graph Generation from Biased Training
por: Tang, Kaihua, et al.
Publicado: (2020)
por: Tang, Kaihua, et al.
Publicado: (2020)
A Fair Ranking and New Model for Panoptic Scene Graph Generation
por: Lorenz, Julian, et al.
Publicado: (2024)
por: Lorenz, Julian, et al.
Publicado: (2024)
EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
por: Mun, Sunung, et al.
Publicado: (2026)
por: Mun, Sunung, et al.
Publicado: (2026)
All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds
por: Li, Shuangqi, et al.
Publicado: (2024)
por: Li, Shuangqi, et al.
Publicado: (2024)
InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes
por: Shahbazi, Mohamad, et al.
Publicado: (2024)
por: Shahbazi, Mohamad, et al.
Publicado: (2024)
Phrase-Instance Alignment for Generalized Referring Segmentation
por: Nguyen, E-Ro, et al.
Publicado: (2024)
por: Nguyen, E-Ro, et al.
Publicado: (2024)
gen2seg: Generative Models Enable Generalizable Instance Segmentation
por: Khangaonkar, Om, et al.
Publicado: (2025)
por: Khangaonkar, Om, et al.
Publicado: (2025)
Skews in the Phenomenon Space Hinder Generalization in Text-to-Image Generation
por: Chang, Yingshan, et al.
Publicado: (2024)
por: Chang, Yingshan, et al.
Publicado: (2024)
EP-Diffuser: An Efficient Diffusion Model for Traffic Scene Generation and Prediction via Polynomial Representations
por: Yao, Yue, et al.
Publicado: (2025)
por: Yao, Yue, et al.
Publicado: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Text-to-Scene with Large Reasoning Models
por: Berdoz, Frédéric, et al.
Publicado: (2025)
por: Berdoz, Frédéric, et al.
Publicado: (2025)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation
por: Zhang, Yuhang, et al.
Publicado: (2024)
por: Zhang, Yuhang, et al.
Publicado: (2024)
Decision Boundary-aware Knowledge Consolidation Generates Better Instance-Incremental Learner
por: Nie, Qiang, et al.
Publicado: (2024)
por: Nie, Qiang, et al.
Publicado: (2024)
Compositional Text-to-Image Generation with Dense Blob Representations
por: Nie, Weili, et al.
Publicado: (2024)
por: Nie, Weili, et al.
Publicado: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
por: Gao, Ziqi, et al.
Publicado: (2024)
por: Gao, Ziqi, et al.
Publicado: (2024)
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
por: Zhai, Guangyao, et al.
Publicado: (2024)
por: Zhai, Guangyao, et al.
Publicado: (2024)
Multisource Collaborative Domain Generalization for Cross-Scene Remote Sensing Image Classification
por: Han, Zhu, et al.
Publicado: (2024)
por: Han, Zhu, et al.
Publicado: (2024)
Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
por: Li, Chao, et al.
Publicado: (2026)
por: Li, Chao, et al.
Publicado: (2026)
PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance
por: Zhou, Yujing, et al.
Publicado: (2026)
por: Zhou, Yujing, et al.
Publicado: (2026)
Disentangled 3D Scene Generation with Layout Learning
por: Epstein, Dave, et al.
Publicado: (2024)
por: Epstein, Dave, et al.
Publicado: (2024)
Ejemplares similares
-
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
por: Xia, Guoxuan, et al.
Publicado: (2025) -
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
por: Tudosiu, Petru-Daniel, et al.
Publicado: (2024) -
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
por: Dutt, Raman, et al.
Publicado: (2025) -
SceneForge: Structured World Supervision from 3D Interventions
por: Li, Jizhizi, et al.
Publicado: (2026) -
Alfie: Democratising RGBA Image Generation With No $$$
por: Quattrini, Fabio, et al.
Publicado: (2024)