Imagine for Me: Creative Conceptual Blending of Real Images and Text via Blended Attention
Fuente:
arXiv
Guardado en:
| Autores principales: | Cho, Wonwoong, Zhang, Yanxia, Chen, Yan-Ying, Inouye, David I. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Att-Adapter: A Robust and Precise Domain-Specific Multi-Attributes T2I Diffusion Adapter via Conditional Variational Autoencoder
por: Cho, Wonwoong, et al.
Publicado: (2025)
por: Cho, Wonwoong, et al.
Publicado: (2025)
Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods
por: Cho, Wonwoong, et al.
Publicado: (2023)
por: Cho, Wonwoong, et al.
Publicado: (2023)
Plug-and-Play Multi-Concept Adaptive Blending for High-Fidelity Text-to-Image Synthesis
por: Woo, Young-Beom
Publicado: (2025)
por: Woo, Young-Beom
Publicado: (2025)
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
por: Huang, Wenjing, et al.
Publicado: (2023)
por: Huang, Wenjing, et al.
Publicado: (2023)
TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models
por: Jin, Xin, et al.
Publicado: (2026)
por: Jin, Xin, et al.
Publicado: (2026)
How to Blend Concepts in Diffusion Models
por: Olearo, Lorenzo, et al.
Publicado: (2024)
por: Olearo, Lorenzo, et al.
Publicado: (2024)
Mosaic: Compositional Multi-Concept Erasure via Vector Field Blending
por: Ko, Junseok, et al.
Publicado: (2026)
por: Ko, Junseok, et al.
Publicado: (2026)
Evidential Graph Contrastive Alignment for Source-Free Blending-Target Domain Adaptation
por: Zheng, Juepeng, et al.
Publicado: (2024)
por: Zheng, Juepeng, et al.
Publicado: (2024)
Ordering Matters: Rank-Aware Selective Fusion for Blended Emotion Recognition
por: Lee, Junghyun, et al.
Publicado: (2026)
por: Lee, Junghyun, et al.
Publicado: (2026)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
por: Cheng, Min, et al.
Publicado: (2025)
por: Cheng, Min, et al.
Publicado: (2025)
Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
por: Chen, Yi-Chung, et al.
Publicado: (2025)
por: Chen, Yi-Chung, et al.
Publicado: (2025)
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion
por: Huang, Nisha, et al.
Publicado: (2024)
por: Huang, Nisha, et al.
Publicado: (2024)
Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis
por: Jelaca, Aleksa, et al.
Publicado: (2025)
por: Jelaca, Aleksa, et al.
Publicado: (2025)
StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments
por: Kulinski, Sean, et al.
Publicado: (2024)
por: Kulinski, Sean, et al.
Publicado: (2024)
Imagine yourself: Tuning-Free Personalized Image Generation
por: He, Zecheng, et al.
Publicado: (2024)
por: He, Zecheng, et al.
Publicado: (2024)
AID: Attention Interpolation of Text-to-Image Diffusion
por: He, Qiyuan, et al.
Publicado: (2024)
por: He, Qiyuan, et al.
Publicado: (2024)
Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
por: Kim, Seungwook, et al.
Publicado: (2026)
por: Kim, Seungwook, et al.
Publicado: (2026)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
por: Jiao, Pengkun, et al.
Publicado: (2025)
por: Jiao, Pengkun, et al.
Publicado: (2025)
UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation
por: Zhong, Siru, et al.
Publicado: (2024)
por: Zhong, Siru, et al.
Publicado: (2024)
Repairing Catastrophic-Neglect in Text-to-Image Diffusion Models via Attention-Guided Feature Enhancement
por: Chang, Zhiyuan, et al.
Publicado: (2024)
por: Chang, Zhiyuan, et al.
Publicado: (2024)
Blending Concepts with Text-to-Image Diffusion Models
por: Olearo, Lorenzo, et al.
Publicado: (2025)
por: Olearo, Lorenzo, et al.
Publicado: (2025)
Blending 3D Geometry and Machine Learning for Multi-View Stereopsis
por: Vats, Vibhas, et al.
Publicado: (2025)
por: Vats, Vibhas, et al.
Publicado: (2025)
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
por: Yu, Tao, et al.
Publicado: (2026)
por: Yu, Tao, et al.
Publicado: (2026)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Image Clustering Conditioned on Text Criteria
por: Kwon, Sehyun, et al.
Publicado: (2023)
por: Kwon, Sehyun, et al.
Publicado: (2023)
SurFhead: Affine Rig Blending for Geometrically Accurate 2D Gaussian Surfel Head Avatars
por: Lee, Jaeseong, et al.
Publicado: (2024)
por: Lee, Jaeseong, et al.
Publicado: (2024)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
por: Kang, Wonjun, et al.
Publicado: (2025)
por: Kang, Wonjun, et al.
Publicado: (2025)
PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image Models
por: Zhang, Yiming, et al.
Publicado: (2023)
por: Zhang, Yiming, et al.
Publicado: (2023)
Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding
por: Cho, Yeongjae, et al.
Publicado: (2025)
por: Cho, Yeongjae, et al.
Publicado: (2025)
TFANet: Three-Stage Image-Text Feature Alignment Network for Robust Referring Image Segmentation
por: Lu, Qianqi, et al.
Publicado: (2025)
por: Lu, Qianqi, et al.
Publicado: (2025)
Blending adversarial training and representation-conditional purification via aggregation improves adversarial robustness
por: Ballarin, Emanuele, et al.
Publicado: (2023)
por: Ballarin, Emanuele, et al.
Publicado: (2023)
Retain, Blend, and Exchange: A Quality-aware Spatial-Stereo Fusion Approach for Event Stream Recognition
por: Chen, Lan, et al.
Publicado: (2024)
por: Chen, Lan, et al.
Publicado: (2024)
Prompt Decoupling for Text-to-Image Person Re-identification
por: Li, Weihao, et al.
Publicado: (2024)
por: Li, Weihao, et al.
Publicado: (2024)
GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation
por: Fofanah, Abdul Joseph, et al.
Publicado: (2026)
por: Fofanah, Abdul Joseph, et al.
Publicado: (2026)
VIPA: Visual Informative Part Attention for Referring Image Segmentation
por: Cho, Yubin, et al.
Publicado: (2026)
por: Cho, Yubin, et al.
Publicado: (2026)
Personalized Safety Alignment for Text-to-Image Diffusion Models
por: Lei, Yu, et al.
Publicado: (2025)
por: Lei, Yu, et al.
Publicado: (2025)
15M Multimodal Facial Image-Text Dataset
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
YOLOv12: Attention-Centric Real-Time Object Detectors
por: Tian, Yunjie, et al.
Publicado: (2025)
por: Tian, Yunjie, et al.
Publicado: (2025)
LOCATEdit: Graph Laplacian Optimized Cross Attention for Localized Text-Guided Image Editing
por: Soni, Achint, et al.
Publicado: (2025)
por: Soni, Achint, et al.
Publicado: (2025)
Ejemplares similares
-
Att-Adapter: A Robust and Precise Domain-Specific Multi-Attributes T2I Diffusion Adapter via Conditional Variational Autoencoder
por: Cho, Wonwoong, et al.
Publicado: (2025) -
Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods
por: Cho, Wonwoong, et al.
Publicado: (2023) -
Plug-and-Play Multi-Concept Adaptive Blending for High-Fidelity Text-to-Image Synthesis
por: Woo, Young-Beom
Publicado: (2025) -
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
por: Huang, Wenjing, et al.
Publicado: (2023) -
TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models
por: Jin, Xin, et al.
Publicado: (2026)