Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Akdemir, Kiymet, Shi, Jing, Kafle, Kushal, Price, Brian, Yanardag, Pinar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2025)
di: Akdemir, Kiymet, et al.
Pubblicazione: (2025)
From Zero to Hero: Training-Free Custom Concept Spawning in World Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2026)
di: Akdemir, Kiymet, et al.
Pubblicazione: (2026)
ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2024)
di: Akdemir, Kiymet, et al.
Pubblicazione: (2024)
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
The Curious Case of End Token: A Zero-Shot Disentangled Image Editing using CLIP
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
di: Dunlop, Connor, et al.
Pubblicazione: (2025)
di: Dunlop, Connor, et al.
Pubblicazione: (2025)
Explaining in Diffusion: Explaining a Classifier Through Hierarchical Semantics with Text-to-Image Diffusion Models
di: Kazimi, Tahira, et al.
Pubblicazione: (2024)
di: Kazimi, Tahira, et al.
Pubblicazione: (2024)
CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
di: Venkatesh, Kavana, et al.
Pubblicazione: (2025)
di: Venkatesh, Kavana, et al.
Pubblicazione: (2025)
LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers
di: Dalva, Yusuf, et al.
Pubblicazione: (2025)
di: Dalva, Yusuf, et al.
Pubblicazione: (2025)
LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion Models
di: Sonmezer, Mert, et al.
Pubblicazione: (2025)
di: Sonmezer, Mert, et al.
Pubblicazione: (2025)
AdaState: Self-Evolving Anchors for Streaming Video Generation
di: Dalva, Yusuf, et al.
Pubblicazione: (2026)
di: Dalva, Yusuf, et al.
Pubblicazione: (2026)
Latent Space Disentanglement in Diffusion Transformers Enables Precise Zero-shot Semantic Editing
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
di: Lu, Jianglin, et al.
Pubblicazione: (2026)
di: Lu, Jianglin, et al.
Pubblicazione: (2026)
Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
di: Shuai, Zitao, et al.
Pubblicazione: (2024)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
di: Venkatesh, Kavana, et al.
Pubblicazione: (2024)
MotionShop: Zero-Shot Motion Transfer in Video Diffusion Models with Mixture of Score Guidance
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024)
Dynamic View Synthesis as an Inverse Problem
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2025)
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2025)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
LoRACLR: Contrastive Adaptation for Customization of Diffusion Models
di: Simsar, Enis, et al.
Pubblicazione: (2024)
di: Simsar, Enis, et al.
Pubblicazione: (2024)
Stylebreeder: Exploring and Democratizing Artistic Styles through Text-to-Image Models
di: Zheng, Matthew, et al.
Pubblicazione: (2024)
di: Zheng, Matthew, et al.
Pubblicazione: (2024)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Free-Editor: Zero-shot Text-driven 3D Scene Editing
di: Karim, Nazmul, et al.
Pubblicazione: (2023)
di: Karim, Nazmul, et al.
Pubblicazione: (2023)
Improving Large Vision and Language Models by Learning from a Panel of Peers
di: Hernandez, Jefferson, et al.
Pubblicazione: (2025)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2025)
Zero-shot Image Editing with Reference Imitation
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
di: Liu, Xuyang, et al.
Pubblicazione: (2023)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
di: Kazimi, Tahira, et al.
Pubblicazione: (2025)
di: Kazimi, Tahira, et al.
Pubblicazione: (2025)
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
di: Wu, Qiucheng, et al.
Pubblicazione: (2026)
di: Wu, Qiucheng, et al.
Pubblicazione: (2026)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
DisControlFace: Adding Disentangled Control to Diffusion Autoencoder for One-shot Explicit Facial Image Editing
di: Jia, Haozhe, et al.
Pubblicazione: (2023)
di: Jia, Haozhe, et al.
Pubblicazione: (2023)
Exploring Iterative Manifold Constraint for Zero-shot Image Editing
di: Li, Maomao, et al.
Pubblicazione: (2025)
di: Li, Maomao, et al.
Pubblicazione: (2025)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
SCoRD: Subject-Conditional Relation Detection with Text-Augmented Data
di: Yang, Ziyan, et al.
Pubblicazione: (2023)
di: Yang, Ziyan, et al.
Pubblicazione: (2023)
DreamDrone: Text-to-Image Diffusion Models are Zero-shot Perpetual View Generators
di: Kong, Hanyang, et al.
Pubblicazione: (2023)
di: Kong, Hanyang, et al.
Pubblicazione: (2023)
Are Bias Mitigation Techniques for Deep Learning Effective?
di: Shrestha, Robik, et al.
Pubblicazione: (2021)
di: Shrestha, Robik, et al.
Pubblicazione: (2021)
Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models
di: Yesiltepe, Hidir, et al.
Pubblicazione: (2024) -
Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2025) -
From Zero to Hero: Training-Free Custom Concept Spawning in World Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2026) -
ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models
di: Akdemir, Kiymet, et al.
Pubblicazione: (2024) -
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)