AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Yiheng, Zhao, Shifang, Liu, Ting, Qu, Xiaochao, Liu, Luoqi, Zhao, Yao, Wei, Yunchao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
by: Hu, Yihan, et al.
Published: (2025)
by: Hu, Yihan, et al.
Published: (2025)
Memory Efficient Matting with Adaptive Token Routing
by: Lin, Yiheng, et al.
Published: (2024)
by: Lin, Yiheng, et al.
Published: (2024)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
by: Zhao, Shifang, et al.
Published: (2025)
by: Zhao, Shifang, et al.
Published: (2025)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
by: Huang, Jun, et al.
Published: (2025)
by: Huang, Jun, et al.
Published: (2025)
On Exact Editing of Flow-Based Diffusion Models
by: Li, Zixiang, et al.
Published: (2025)
by: Li, Zixiang, et al.
Published: (2025)
Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?
by: Liang, Chen, et al.
Published: (2024)
by: Liang, Chen, et al.
Published: (2024)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
by: Liu, Minghao, et al.
Published: (2024)
by: Liu, Minghao, et al.
Published: (2024)
SAM-REF: Introducing Image-Prompt Synergy during Interaction for Detail Enhancement in the Segment Anything Model
by: Yu, Chongkai, et al.
Published: (2024)
by: Yu, Chongkai, et al.
Published: (2024)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
by: Wang, Tong, et al.
Published: (2025)
by: Wang, Tong, et al.
Published: (2025)
ThinkGen: Generalized Thinking for Visual Generation
by: Jiao, Siyu, et al.
Published: (2025)
by: Jiao, Siyu, et al.
Published: (2025)
FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation
by: Zhang, Zekang, et al.
Published: (2026)
by: Zhang, Zekang, et al.
Published: (2026)
AlignedGen: Aligning Style Across Generated Images
by: Zhang, Jiexuan, et al.
Published: (2025)
by: Zhang, Jiexuan, et al.
Published: (2025)
Diffusion for Natural Image Matting
by: Hu, Yihan, et al.
Published: (2023)
by: Hu, Yihan, et al.
Published: (2023)
PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation
by: Sha, Yuyang, et al.
Published: (2026)
by: Sha, Yuyang, et al.
Published: (2026)
MiVE: Multiscale Vision-language features for reference-guided video Editing
by: Wang, Tong, et al.
Published: (2026)
by: Wang, Tong, et al.
Published: (2026)
Region-Adaptive Transform with Segmentation Prior for Image Compression
by: Liu, Yuxi, et al.
Published: (2024)
by: Liu, Yuxi, et al.
Published: (2024)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
by: Li, Hongxi, et al.
Published: (2026)
by: Li, Hongxi, et al.
Published: (2026)
Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
by: Zhao, Pengfei, et al.
Published: (2025)
by: Zhao, Pengfei, et al.
Published: (2025)
CutClaw: Agentic Hours-Long Video Editing via Music Synchronization
by: Zhao, Shifang, et al.
Published: (2026)
by: Zhao, Shifang, et al.
Published: (2026)
Learning Stochastic Bridges for Video Object Removal via Video-to-Video Translation
by: Lou, Zijie, et al.
Published: (2026)
by: Lou, Zijie, et al.
Published: (2026)
TextMastero: Mastering High-Quality Scene Text Editing in Diverse Languages and Styles
by: Wang, Tong, et al.
Published: (2024)
by: Wang, Tong, et al.
Published: (2024)
DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
by: Li, Zixiang, et al.
Published: (2025)
by: Li, Zixiang, et al.
Published: (2025)
ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance
by: Huang, Jiannan, et al.
Published: (2024)
by: Huang, Jiannan, et al.
Published: (2024)
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
by: Luo, Yuqing, et al.
Published: (2025)
by: Luo, Yuqing, et al.
Published: (2025)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
by: Qian, Chengxuan, et al.
Published: (2025)
by: Qian, Chengxuan, et al.
Published: (2025)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
by: Xu, Zhensong, et al.
Published: (2024)
by: Xu, Zhensong, et al.
Published: (2024)
IPSeg: Image Posterior Mitigates Semantic Drift in Class-Incremental Segmentation
by: Yu, Xiao, et al.
Published: (2025)
by: Yu, Xiao, et al.
Published: (2025)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
by: Sun, Zengbao, et al.
Published: (2024)
by: Sun, Zengbao, et al.
Published: (2024)
Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment
by: Li, Yuchen, et al.
Published: (2026)
by: Li, Yuchen, et al.
Published: (2026)
Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
by: Peng, Chuang, et al.
Published: (2025)
by: Peng, Chuang, et al.
Published: (2025)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
by: Zhong, Yiming, et al.
Published: (2024)
by: Zhong, Yiming, et al.
Published: (2024)
PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors
by: Lee, Chia-Ming, et al.
Published: (2026)
by: Lee, Chia-Ming, et al.
Published: (2026)
AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment
by: Chen, Ruoxin, et al.
Published: (2025)
by: Chen, Ruoxin, et al.
Published: (2025)
Personalized Image Generation with Deep Generative Models: A Decade Survey
by: Wei, Yuxiang, et al.
Published: (2025)
by: Wei, Yuxiang, et al.
Published: (2025)
Navigating Image Restoration with VAR's Distribution Alignment Prior
by: Wang, Siyang, et al.
Published: (2024)
by: Wang, Siyang, et al.
Published: (2024)
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
by: Zhao, Youjun, et al.
Published: (2025)
by: Zhao, Youjun, et al.
Published: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
by: Feng, Qianhan, et al.
Published: (2024)
by: Feng, Qianhan, et al.
Published: (2024)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
AvatarMakeup: Realistic Makeup Transfer for 3D Animatable Head Avatars
by: Zhong, Yiming, et al.
Published: (2025)
by: Zhong, Yiming, et al.
Published: (2025)
XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution
by: Qu, Yunpeng, et al.
Published: (2024)
by: Qu, Yunpeng, et al.
Published: (2024)
Similar Items
-
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
by: Hu, Yihan, et al.
Published: (2025) -
Memory Efficient Matting with Adaptive Token Routing
by: Lin, Yiheng, et al.
Published: (2024) -
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
by: Zhao, Shifang, et al.
Published: (2025) -
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
by: Huang, Jun, et al.
Published: (2025) -
On Exact Editing of Flow-Based Diffusion Models
by: Li, Zixiang, et al.
Published: (2025)