Object-level Visual Prompts for Compositional Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Parmar, Gaurav, Patashnik, Or, Wang, Kuan-Chieh, Ostashev, Daniil, Narasimhan, Srinivasa, Zhu, Jun-Yan, Cohen-Or, Daniel, Aberman, Kfir |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Group Inference for Diverse and High-Quality Generation
di: Parmar, Gaurav, et al.
Pubblicazione: (2025)
di: Parmar, Gaurav, et al.
Pubblicazione: (2025)
Nested Attention: Semantic-aware Attention Values for Concept Personalization
di: Patashnik, Or, et al.
Pubblicazione: (2025)
di: Patashnik, Or, et al.
Pubblicazione: (2025)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024)
Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation
di: Dahary, Omer, et al.
Pubblicazione: (2024)
di: Dahary, Omer, et al.
Pubblicazione: (2024)
Be Decisive: Noise-Induced Layouts for Multi-Subject Generation
di: Dahary, Omer, et al.
Pubblicazione: (2025)
di: Dahary, Omer, et al.
Pubblicazione: (2025)
One-Step Image Translation with Text-to-Image Models
di: Parmar, Gaurav, et al.
Pubblicazione: (2024)
di: Parmar, Gaurav, et al.
Pubblicazione: (2024)
Continuous Control of Editing Models via Adaptive-Origin Guidance
di: Wolf, Alon, et al.
Pubblicazione: (2026)
di: Wolf, Alon, et al.
Pubblicazione: (2026)
Stable Flow: Vital Layers for Training-Free Image Editing
di: Avrahami, Omri, et al.
Pubblicazione: (2024)
di: Avrahami, Omri, et al.
Pubblicazione: (2024)
Omni-ID: Holistic Identity Representation Designed for Generative Tasks
di: Qian, Guocheng, et al.
Pubblicazione: (2024)
di: Qian, Guocheng, et al.
Pubblicazione: (2024)
Dynamic Concepts Personalization from Single Videos
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
di: Abdal, Rameen, et al.
Pubblicazione: (2025)
3D PixBrush: Image-Guided Local Texture Synthesis
di: Decatur, Dale, et al.
Pubblicazione: (2025)
di: Decatur, Dale, et al.
Pubblicazione: (2025)
Image Generation from Contextually-Contradictory Prompts
di: Huberman, Saar, et al.
Pubblicazione: (2025)
di: Huberman, Saar, et al.
Pubblicazione: (2025)
ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
di: Qian, Guocheng Gordon, et al.
Pubblicazione: (2025)
Consolidating Attention Features for Multi-view Image Editing
di: Patashnik, Or, et al.
Pubblicazione: (2024)
di: Patashnik, Or, et al.
Pubblicazione: (2024)
Interpreting the Weight Space of Customized Diffusion Models
di: Dravid, Amil, et al.
Pubblicazione: (2024)
di: Dravid, Amil, et al.
Pubblicazione: (2024)
TurboEdit: Text-Based Image Editing Using Few-Step Diffusion Models
di: Deutch, Gilad, et al.
Pubblicazione: (2024)
di: Deutch, Gilad, et al.
Pubblicazione: (2024)
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
di: Parihar, Rishubh, et al.
Pubblicazione: (2025)
di: Parihar, Rishubh, et al.
Pubblicazione: (2025)
Tight Inversion: Image-Conditioned Inversion for Real Image Editing
di: Kadosh, Edo, et al.
Pubblicazione: (2025)
di: Kadosh, Edo, et al.
Pubblicazione: (2025)
VLM-Guided Adaptive Negative Prompting for Creative Generation
di: Golan, Shelly, et al.
Pubblicazione: (2025)
di: Golan, Shelly, et al.
Pubblicazione: (2025)
LCM-Lookahead for Encoder-based Text-to-Image Personalization
di: Gal, Rinon, et al.
Pubblicazione: (2024)
di: Gal, Rinon, et al.
Pubblicazione: (2024)
SAEdit: Token-level control for continuous image editing via Sparse AutoEncoder
di: Kamenetsky, Ronen, et al.
Pubblicazione: (2025)
di: Kamenetsky, Ronen, et al.
Pubblicazione: (2025)
MotioNet: 3D Human Motion Reconstruction from Monocular Video with Skeleton Consistency
di: Shi, Mingyi, et al.
Pubblicazione: (2020)
di: Shi, Mingyi, et al.
Pubblicazione: (2020)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
IP-Composer: Semantic Composition of Visual Concepts
di: Dorfman, Sara, et al.
Pubblicazione: (2025)
di: Dorfman, Sara, et al.
Pubblicazione: (2025)
In-Context Sync-LoRA for Portrait Video Editing
di: Polaczek, Sagi, et al.
Pubblicazione: (2025)
di: Polaczek, Sagi, et al.
Pubblicazione: (2025)
ReNoise: Real Image Inversion Through Iterative Noising
di: Garibi, Daniel, et al.
Pubblicazione: (2024)
di: Garibi, Daniel, et al.
Pubblicazione: (2024)
JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
di: Chen, Anthony, et al.
Pubblicazione: (2026)
di: Chen, Anthony, et al.
Pubblicazione: (2026)
On the Content Bias in Fréchet Video Distance
di: Ge, Songwei, et al.
Pubblicazione: (2024)
di: Ge, Songwei, et al.
Pubblicazione: (2024)
Structure-Guided Image Completion with Image-level and Object-level Semantic Discriminators
di: Zheng, Haitian, et al.
Pubblicazione: (2022)
di: Zheng, Haitian, et al.
Pubblicazione: (2022)
RealFill: Reference-Driven Generation for Authentic Image Completion
di: Tang, Luming, et al.
Pubblicazione: (2023)
di: Tang, Luming, et al.
Pubblicazione: (2023)
ComfyGen: Prompt-Adaptive Workflows for Text-to-Image Generation
di: Gal, Rinon, et al.
Pubblicazione: (2024)
di: Gal, Rinon, et al.
Pubblicazione: (2024)
Rhythm is a Dancer: Music-Driven Motion Synthesis with Global Structure
di: Aristidou, Andreas, et al.
Pubblicazione: (2021)
di: Aristidou, Andreas, et al.
Pubblicazione: (2021)
HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image Models
di: Ruiz, Nataniel, et al.
Pubblicazione: (2023)
di: Ruiz, Nataniel, et al.
Pubblicazione: (2023)
Alterbute: Editing Intrinsic Attributes of Objects in Images
di: Reiss, Tal, et al.
Pubblicazione: (2026)
di: Reiss, Tal, et al.
Pubblicazione: (2026)
LooseRoPE: Content-aware Attention Manipulation for Semantic Harmonization
di: Sella, Etai, et al.
Pubblicazione: (2026)
di: Sella, Etai, et al.
Pubblicazione: (2026)
MultiAct: Text-to-Motion Generation from Composite Text via Tailored Attention Guidance
di: Sala, Nathan, et al.
Pubblicazione: (2026)
di: Sala, Nathan, et al.
Pubblicazione: (2026)
In-2-4D: Inbetweening from Two Single-View Images to 4D Generation
di: Nag, Sauradip, et al.
Pubblicazione: (2025)
di: Nag, Sauradip, et al.
Pubblicazione: (2025)
Iterative Motion Editing with Natural Language
di: Goel, Purvi, et al.
Pubblicazione: (2023)
di: Goel, Purvi, et al.
Pubblicazione: (2023)
Incorporating dense metric depth into neural 3D representations for view synthesis and relighting
di: Chaudhury, Arkadeep Narayan, et al.
Pubblicazione: (2024)
di: Chaudhury, Arkadeep Narayan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scaling Group Inference for Diverse and High-Quality Generation
di: Parmar, Gaurav, et al.
Pubblicazione: (2025) -
Nested Attention: Semantic-aware Attention Values for Concept Personalization
di: Patashnik, Or, et al.
Pubblicazione: (2025) -
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
di: Wang, Kuan-Chieh, et al.
Pubblicazione: (2024) -
Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation
di: Dahary, Omer, et al.
Pubblicazione: (2024) -
Be Decisive: Noise-Induced Layouts for Multi-Subject Generation
di: Dahary, Omer, et al.
Pubblicazione: (2025)