Multitwine: Multi-Object Compositing with Text and Layout Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tarrés, Gemma Canet, Lin, Zhe, Zhang, Zhifei, Zhang, He, Gilbert, Andrew, Collomosse, John, Kim, Soo Ye |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Thinking Outside the BBox: Unconstrained Generative Object Compositing
par: Tarrés, Gemma Canet, et autres
Publié: (2024)
par: Tarrés, Gemma Canet, et autres
Publié: (2024)
PARASOL: Parametric Style Control for Diffusion Image Synthesis
par: Tarrés, Gemma Canet, et autres
Publié: (2023)
par: Tarrés, Gemma Canet, et autres
Publié: (2023)
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
par: Tarrés, Gemma Canet, et autres
Publié: (2026)
par: Tarrés, Gemma Canet, et autres
Publié: (2026)
MultiNeRF: Multiple Watermark Embedding for Neural Radiance Fields
par: Kulthe, Yash, et autres
Publié: (2025)
par: Kulthe, Yash, et autres
Publié: (2025)
IMPRINT: Generative Object Compositing by Learning Identity-Preserving Representation
par: Song, Yizhi, et autres
Publié: (2024)
par: Song, Yizhi, et autres
Publié: (2024)
TransPixeler: Advancing Text-to-Video Generation with Transparency
par: Wang, Luozhou, et autres
Publié: (2025)
par: Wang, Luozhou, et autres
Publié: (2025)
CatalogStitch: Dimension-Aware and Occlusion-Preserving Object Compositing for Catalog Image Generation
par: Jain, Sanyam, et autres
Publié: (2026)
par: Jain, Sanyam, et autres
Publié: (2026)
Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing
par: Ko, Sukhun, et autres
Publié: (2026)
par: Ko, Sukhun, et autres
Publié: (2026)
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
par: Zhang, Shilong, et autres
Publié: (2025)
par: Zhang, Shilong, et autres
Publié: (2025)
TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery
par: Zhang, Li, et autres
Publié: (2026)
par: Zhang, Li, et autres
Publié: (2026)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
par: He, Weijie, et autres
Publié: (2025)
par: He, Weijie, et autres
Publié: (2025)
Refine-by-Align: Reference-Guided Artifacts Refinement through Semantic Alignment
par: Song, Yizhi, et autres
Publié: (2024)
par: Song, Yizhi, et autres
Publié: (2024)
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
par: Cai, Yuanhao, et autres
Publié: (2025)
par: Cai, Yuanhao, et autres
Publié: (2025)
CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout
par: Bai, Haotian, et autres
Publié: (2023)
par: Bai, Haotian, et autres
Publié: (2023)
OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation
par: Gunawan, Agus, et autres
Publié: (2025)
par: Gunawan, Agus, et autres
Publié: (2025)
ConsistCompose: Unified Multimodal Layout Control for Image Composition
par: Shi, Xuanke, et autres
Publié: (2025)
par: Shi, Xuanke, et autres
Publié: (2025)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
par: Black, Alexander, et autres
Publié: (2024)
par: Black, Alexander, et autres
Publié: (2024)
UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
MureObjectStitch: Multi-reference Image Composition
par: Chen, Jiaxuan, et autres
Publié: (2024)
par: Chen, Jiaxuan, et autres
Publié: (2024)
MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer
par: Teodoro, Samuel, et autres
Publié: (2026)
par: Teodoro, Samuel, et autres
Publié: (2026)
CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion
par: Banerjee, Ayan, et autres
Publié: (2024)
par: Banerjee, Ayan, et autres
Publié: (2024)
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
par: Shen, Fei, et autres
Publié: (2025)
par: Shen, Fei, et autres
Publié: (2025)
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
par: Zhang, Xike, et autres
Publié: (2026)
par: Zhang, Xike, et autres
Publié: (2026)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
par: He, Junwen, et autres
Publié: (2024)
par: He, Junwen, et autres
Publié: (2024)
MetaShadow: Object-Centered Shadow Detection, Removal, and Synthesis
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis
par: Bi, Tianci, et autres
Publié: (2024)
par: Bi, Tianci, et autres
Publié: (2024)
Generating Animated Layouts as Structured Text Representations
par: Shin, Yeonsang, et autres
Publié: (2025)
par: Shin, Yeonsang, et autres
Publié: (2025)
LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
par: Chen, Yuzhuo, et autres
Publié: (2025)
par: Chen, Yuzhuo, et autres
Publié: (2025)
LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
ObjectMover: Generative Object Movement with Video Prior
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
LTOS: Layout-controllable Text-Object Synthesis via Adaptive Cross-attention Fusions
par: Zhao, Xiaoran, et autres
Publié: (2024)
par: Zhao, Xiaoran, et autres
Publié: (2024)
Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency
par: Tan, Jiaqi, et autres
Publié: (2025)
par: Tan, Jiaqi, et autres
Publié: (2025)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
par: Ju, Xuan, et autres
Publié: (2025)
par: Ju, Xuan, et autres
Publié: (2025)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
par: Zhou, Zhenghong, et autres
Publié: (2026)
par: Zhou, Zhenghong, et autres
Publié: (2026)
Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis
par: Ohanyan, Marianna, et autres
Publié: (2024)
par: Ohanyan, Marianna, et autres
Publié: (2024)
Towards Improved Text-Aligned Codebook Learning: Multi-Hierarchical Codebook-Text Alignment with Long Text
par: Liang, Guotao, et autres
Publié: (2025)
par: Liang, Guotao, et autres
Publié: (2025)
InstructLayout: Instruction-Driven 2D and 3D Layout Synthesis with Semantic Graph Prior
par: Lin, Chenguo, et autres
Publié: (2024)
par: Lin, Chenguo, et autres
Publié: (2024)
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
DogLayout: Denoising Diffusion GAN for Discrete and Continuous Layout Generation
par: Gan, Zhaoxing, et autres
Publié: (2024)
par: Gan, Zhaoxing, et autres
Publié: (2024)
Documents similaires
-
Thinking Outside the BBox: Unconstrained Generative Object Compositing
par: Tarrés, Gemma Canet, et autres
Publié: (2024) -
PARASOL: Parametric Style Control for Diffusion Image Synthesis
par: Tarrés, Gemma Canet, et autres
Publié: (2023) -
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
par: Tarrés, Gemma Canet, et autres
Publié: (2026) -
MultiNeRF: Multiple Watermark Embedding for Neural Radiance Fields
par: Kulthe, Yash, et autres
Publié: (2025) -
IMPRINT: Generative Object Compositing by Learning Identity-Preserving Representation
par: Song, Yizhi, et autres
Publié: (2024)