Generating Compositional Scenes via Text-to-image RGBA Instance Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fontanella, Alessandro, Tudosiu, Petru-Daniel, Yang, Yongxin, Zhang, Shifeng, Parisot, Sarah |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
par: Xia, Guoxuan, et autres
Publié: (2025)
par: Xia, Guoxuan, et autres
Publié: (2025)
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
par: Tudosiu, Petru-Daniel, et autres
Publié: (2024)
par: Tudosiu, Petru-Daniel, et autres
Publié: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
par: Dutt, Raman, et autres
Publié: (2025)
par: Dutt, Raman, et autres
Publié: (2025)
SceneForge: Structured World Supervision from 3D Interventions
par: Li, Jizhizi, et autres
Publié: (2026)
par: Li, Jizhizi, et autres
Publié: (2026)
Alfie: Democratising RGBA Image Generation With No $$$
par: Quattrini, Fabio, et autres
Publié: (2024)
par: Quattrini, Fabio, et autres
Publié: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
par: Liu, Minghao, et autres
Publié: (2024)
par: Liu, Minghao, et autres
Publié: (2024)
GALOT: Generative Active Learning via Optimizable Zero-shot Text-to-image Generation
par: Hong, Hanbin, et autres
Publié: (2024)
par: Hong, Hanbin, et autres
Publié: (2024)
Progressive Compositionality in Text-to-Image Generative Models
par: Han, Evans Xu, et autres
Publié: (2024)
par: Han, Evans Xu, et autres
Publié: (2024)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
par: Tran, Minh-Tuan, et autres
Publié: (2026)
par: Tran, Minh-Tuan, et autres
Publié: (2026)
TransAnimate: Taming Layer Diffusion to Generate RGBA Video
par: Chen, Xuewei, et autres
Publié: (2025)
par: Chen, Xuewei, et autres
Publié: (2025)
CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization
par: Zhao, Zelin, et autres
Publié: (2025)
par: Zhao, Zelin, et autres
Publié: (2025)
CADKnitter: Compositional CAD Generation from Text and Geometry Guidance
par: Le, Tri, et autres
Publié: (2025)
par: Le, Tri, et autres
Publié: (2025)
Enhancing Compositional Generalization via Compositional Feature Alignment
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
par: Srivastava, Divyansh, et autres
Publié: (2025)
par: Srivastava, Divyansh, et autres
Publié: (2025)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
par: Izadi, Amir Mohammad, et autres
Publié: (2025)
par: Izadi, Amir Mohammad, et autres
Publié: (2025)
Laplacian Multi-scale Flow Matching for Generative Modeling
par: Zhao, Zelin, et autres
Publié: (2026)
par: Zhao, Zelin, et autres
Publié: (2026)
Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
par: Fan, Lijie, et autres
Publié: (2024)
par: Fan, Lijie, et autres
Publié: (2024)
InstanceDiffusion: Instance-level Control for Image Generation
par: Wang, Xudong, et autres
Publié: (2024)
par: Wang, Xudong, et autres
Publié: (2024)
ISCUTE: Instance Segmentation of Cables Using Text Embedding
par: Kozlovsky, Shir, et autres
Publié: (2024)
par: Kozlovsky, Shir, et autres
Publié: (2024)
Text-to-image Diffusion Models in Generative AI: A Survey
par: Zhang, Chenshuang, et autres
Publié: (2023)
par: Zhang, Chenshuang, et autres
Publié: (2023)
Unbiased Scene Graph Generation from Biased Training
par: Tang, Kaihua, et autres
Publié: (2020)
par: Tang, Kaihua, et autres
Publié: (2020)
A Fair Ranking and New Model for Panoptic Scene Graph Generation
par: Lorenz, Julian, et autres
Publié: (2024)
par: Lorenz, Julian, et autres
Publié: (2024)
EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation
par: Mun, Sunung, et autres
Publié: (2026)
par: Mun, Sunung, et autres
Publié: (2026)
All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds
par: Li, Shuangqi, et autres
Publié: (2024)
par: Li, Shuangqi, et autres
Publié: (2024)
InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes
par: Shahbazi, Mohamad, et autres
Publié: (2024)
par: Shahbazi, Mohamad, et autres
Publié: (2024)
Phrase-Instance Alignment for Generalized Referring Segmentation
par: Nguyen, E-Ro, et autres
Publié: (2024)
par: Nguyen, E-Ro, et autres
Publié: (2024)
gen2seg: Generative Models Enable Generalizable Instance Segmentation
par: Khangaonkar, Om, et autres
Publié: (2025)
par: Khangaonkar, Om, et autres
Publié: (2025)
Skews in the Phenomenon Space Hinder Generalization in Text-to-Image Generation
par: Chang, Yingshan, et autres
Publié: (2024)
par: Chang, Yingshan, et autres
Publié: (2024)
EP-Diffuser: An Efficient Diffusion Model for Traffic Scene Generation and Prediction via Polynomial Representations
par: Yao, Yue, et autres
Publié: (2025)
par: Yao, Yue, et autres
Publié: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Text-to-Scene with Large Reasoning Models
par: Berdoz, Frédéric, et autres
Publié: (2025)
par: Berdoz, Frédéric, et autres
Publié: (2025)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation
par: Zhang, Yuhang, et autres
Publié: (2024)
par: Zhang, Yuhang, et autres
Publié: (2024)
Decision Boundary-aware Knowledge Consolidation Generates Better Instance-Incremental Learner
par: Nie, Qiang, et autres
Publié: (2024)
par: Nie, Qiang, et autres
Publié: (2024)
Compositional Text-to-Image Generation with Dense Blob Representations
par: Nie, Weili, et autres
Publié: (2024)
par: Nie, Weili, et autres
Publié: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
par: Gao, Ziqi, et autres
Publié: (2024)
par: Gao, Ziqi, et autres
Publié: (2024)
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
par: Zhai, Guangyao, et autres
Publié: (2024)
par: Zhai, Guangyao, et autres
Publié: (2024)
Multisource Collaborative Domain Generalization for Cross-Scene Remote Sensing Image Classification
par: Han, Zhu, et autres
Publié: (2024)
par: Han, Zhu, et autres
Publié: (2024)
Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
par: Li, Chao, et autres
Publié: (2026)
par: Li, Chao, et autres
Publié: (2026)
PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance
par: Zhou, Yujing, et autres
Publié: (2026)
par: Zhou, Yujing, et autres
Publié: (2026)
Disentangled 3D Scene Generation with Layout Learning
par: Epstein, Dave, et autres
Publié: (2024)
par: Epstein, Dave, et autres
Publié: (2024)
Documents similaires
-
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
par: Xia, Guoxuan, et autres
Publié: (2025) -
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
par: Tudosiu, Petru-Daniel, et autres
Publié: (2024) -
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
par: Dutt, Raman, et autres
Publié: (2025) -
SceneForge: Structured World Supervision from 3D Interventions
par: Li, Jizhizi, et autres
Publié: (2026) -
Alfie: Democratising RGBA Image Generation With No $$$
par: Quattrini, Fabio, et autres
Publié: (2024)