Canvas-to-Image: Compositional Image Generation with Multimodal Controls
Fuente:
arXiv
Guardado en:
| Autores principales: | Dalva, Yusuf, Qian, Guocheng Gordon, Goldenberg, Maya, Chen, Tsai-Shien, Aberman, Kfir, Tulyakov, Sergey, Yanardag, Pinar, Wang, Kuan-Chieh Jackson |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
por: Qian, Guocheng Gordon, et al.
Publicado: (2025)
por: Qian, Guocheng Gordon, et al.
Publicado: (2025)
LayerComposer: Multi-Human Personalized Generation via Layered Canvas
por: Qian, Guocheng Gordon, et al.
Publicado: (2025)
por: Qian, Guocheng Gordon, et al.
Publicado: (2025)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
por: Wang, Kuan-Chieh, et al.
Publicado: (2024)
por: Wang, Kuan-Chieh, et al.
Publicado: (2024)
AdaState: Self-Evolving Anchors for Streaming Video Generation
por: Dalva, Yusuf, et al.
Publicado: (2026)
por: Dalva, Yusuf, et al.
Publicado: (2026)
LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers
por: Dalva, Yusuf, et al.
Publicado: (2025)
por: Dalva, Yusuf, et al.
Publicado: (2025)
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models
por: Dalva, Yusuf, et al.
Publicado: (2024)
por: Dalva, Yusuf, et al.
Publicado: (2024)
Omni-ID: Holistic Identity Representation Designed for Generative Tasks
por: Qian, Guocheng, et al.
Publicado: (2024)
por: Qian, Guocheng, et al.
Publicado: (2024)
The Curious Case of End Token: A Zero-Shot Disentangled Image Editing using CLIP
por: Yesiltepe, Hidir, et al.
Publicado: (2024)
por: Yesiltepe, Hidir, et al.
Publicado: (2024)
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers
por: Dalva, Yusuf, et al.
Publicado: (2024)
por: Dalva, Yusuf, et al.
Publicado: (2024)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
por: Venkatesh, Kavana, et al.
Publicado: (2024)
por: Venkatesh, Kavana, et al.
Publicado: (2024)
I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models
por: Mi, Zhenxing, et al.
Publicado: (2025)
por: Mi, Zhenxing, et al.
Publicado: (2025)
Preventing Shortcuts in Adapter Training via Providing the Shortcuts
por: Goyal, Anujraaj Argo, et al.
Publicado: (2025)
por: Goyal, Anujraaj Argo, et al.
Publicado: (2025)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
por: Dalva, Yusuf, et al.
Publicado: (2024)
por: Dalva, Yusuf, et al.
Publicado: (2024)
Object-level Visual Prompts for Compositional Image Generation
por: Parmar, Gaurav, et al.
Publicado: (2025)
por: Parmar, Gaurav, et al.
Publicado: (2025)
MyVLM: Personalizing VLMs for User-Specific Queries
por: Alaluf, Yuval, et al.
Publicado: (2024)
por: Alaluf, Yuval, et al.
Publicado: (2024)
Multi-subject Open-set Personalization in Video Generation
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
Nested Attention: Semantic-aware Attention Values for Concept Personalization
por: Patashnik, Or, et al.
Publicado: (2025)
por: Patashnik, Or, et al.
Publicado: (2025)
Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation
por: Dahary, Omer, et al.
Publicado: (2024)
por: Dahary, Omer, et al.
Publicado: (2024)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
por: Venkatesh, Kavana, et al.
Publicado: (2025)
por: Venkatesh, Kavana, et al.
Publicado: (2025)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
por: Girish, Sharath, et al.
Publicado: (2025)
por: Girish, Sharath, et al.
Publicado: (2025)
Visual Personalization Turing Test
por: Abdal, Rameen, et al.
Publicado: (2026)
por: Abdal, Rameen, et al.
Publicado: (2026)
Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
por: Meral, Tuna Han Salih, et al.
Publicado: (2024)
por: Meral, Tuna Han Salih, et al.
Publicado: (2024)
3D PixBrush: Image-Guided Local Texture Synthesis
por: Decatur, Dale, et al.
Publicado: (2025)
por: Decatur, Dale, et al.
Publicado: (2025)
Orthogonal Adaptation for Modular Customization of Diffusion Models
por: Po, Ryan, et al.
Publicado: (2023)
por: Po, Ryan, et al.
Publicado: (2023)
E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation
por: Gong, Yifan, et al.
Publicado: (2024)
por: Gong, Yifan, et al.
Publicado: (2024)
Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models
por: Akdemir, Kiymet, et al.
Publicado: (2025)
por: Akdemir, Kiymet, et al.
Publicado: (2025)
Explaining in Diffusion: Explaining a Classifier Through Hierarchical Semantics with Text-to-Image Diffusion Models
por: Kazimi, Tahira, et al.
Publicado: (2024)
por: Kazimi, Tahira, et al.
Publicado: (2024)
MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models
por: Yesiltepe, Hidir, et al.
Publicado: (2024)
por: Yesiltepe, Hidir, et al.
Publicado: (2024)
Interpreting the Weight Space of Customized Diffusion Models
por: Dravid, Amil, et al.
Publicado: (2024)
por: Dravid, Amil, et al.
Publicado: (2024)
Scaling Group Inference for Diverse and High-Quality Generation
por: Parmar, Gaurav, et al.
Publicado: (2025)
por: Parmar, Gaurav, et al.
Publicado: (2025)
ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models
por: Akdemir, Kiymet, et al.
Publicado: (2024)
por: Akdemir, Kiymet, et al.
Publicado: (2024)
Continuous Control of Editing Models via Adaptive-Origin Guidance
por: Wolf, Alon, et al.
Publicado: (2026)
por: Wolf, Alon, et al.
Publicado: (2026)
Dynamic Concepts Personalization from Single Videos
por: Abdal, Rameen, et al.
Publicado: (2025)
por: Abdal, Rameen, et al.
Publicado: (2025)
Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA
por: Abdal, Rameen, et al.
Publicado: (2025)
por: Abdal, Rameen, et al.
Publicado: (2025)
Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
por: Dunlop, Connor, et al.
Publicado: (2025)
por: Dunlop, Connor, et al.
Publicado: (2025)
Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
VIMI: Grounding Video Generation through Multi-modal Instruction
por: Fang, Yuwei, et al.
Publicado: (2024)
por: Fang, Yuwei, et al.
Publicado: (2024)
From Zero to Hero: Training-Free Custom Concept Spawning in World Models
por: Akdemir, Kiymet, et al.
Publicado: (2026)
por: Akdemir, Kiymet, et al.
Publicado: (2026)
Dynamic View Synthesis as an Inverse Problem
por: Yesiltepe, Hidir, et al.
Publicado: (2025)
por: Yesiltepe, Hidir, et al.
Publicado: (2025)
Ejemplares similares
-
ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
por: Qian, Guocheng Gordon, et al.
Publicado: (2025) -
LayerComposer: Multi-Human Personalized Generation via Layered Canvas
por: Qian, Guocheng Gordon, et al.
Publicado: (2025) -
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
por: Wang, Kuan-Chieh, et al.
Publicado: (2024) -
AdaState: Self-Evolving Anchors for Streaming Video Generation
por: Dalva, Yusuf, et al.
Publicado: (2026) -
LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers
por: Dalva, Yusuf, et al.
Publicado: (2025)