Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Sihyun, Kwak, Sangkyung, Jang, Huiwon, Jeong, Jongheon, Huang, Jonathan, Shin, Jinwoo, Xie, Saining |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Robustification via Text-to-Image Diffusion Models
di: Choi, Daewon, et al.
Pubblicazione: (2024)
di: Choi, Daewon, et al.
Pubblicazione: (2024)
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment
di: Kim, Younghyun, et al.
Pubblicazione: (2025)
di: Kim, Younghyun, et al.
Pubblicazione: (2025)
Controllable Human Image Generation with Personalized Multi-Garments
di: Choi, Yisol, et al.
Pubblicazione: (2024)
di: Choi, Yisol, et al.
Pubblicazione: (2024)
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
di: Wu, Ge, et al.
Pubblicazione: (2025)
di: Wu, Ge, et al.
Pubblicazione: (2025)
Representation Alignment for Just Image Transformers is not Easier than You Think
di: Shin, Jaeyo, et al.
Pubblicazione: (2026)
di: Shin, Jaeyo, et al.
Pubblicazione: (2026)
Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
DiffusionGuard: A Robust Defense Against Malicious Diffusion-based Image Editing
di: Choi, June Suk, et al.
Pubblicazione: (2024)
di: Choi, June Suk, et al.
Pubblicazione: (2024)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
Direct Consistency Optimization for Robust Customization of Text-to-Image Diffusion Models
di: Lee, Kyungmin, et al.
Pubblicazione: (2024)
di: Lee, Kyungmin, et al.
Pubblicazione: (2024)
CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think
di: Sun, Zening, et al.
Pubblicazione: (2026)
di: Sun, Zening, et al.
Pubblicazione: (2026)
Improving Diffusion Models for Authentic Virtual Try-on in the Wild
di: Choi, Yisol, et al.
Pubblicazione: (2024)
di: Choi, Yisol, et al.
Pubblicazione: (2024)
Aligning Text to Image in Diffusion Models is Easier Than You Think
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2025)
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2025)
Confidence-aware Denoised Fine-tuning of Off-the-shelf Models for Certified Robustness
di: Jang, Suhyeok, et al.
Pubblicazione: (2024)
di: Jang, Suhyeok, et al.
Pubblicazione: (2024)
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
di: Won, John, et al.
Pubblicazione: (2025)
di: Won, John, et al.
Pubblicazione: (2025)
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
di: Li, He, et al.
Pubblicazione: (2026)
di: Li, He, et al.
Pubblicazione: (2026)
Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
di: Tian, Jie, et al.
Pubblicazione: (2025)
di: Tian, Jie, et al.
Pubblicazione: (2025)
FontAdapter: Instant Font Adaptation in Visual Text Generation
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
di: Koo, Myungkyu, et al.
Pubblicazione: (2025)
Decoupled MeanFlow: Turning Flow Models into Flow Maps for Accelerated Sampling
di: Lee, Kyungmin, et al.
Pubblicazione: (2025)
di: Lee, Kyungmin, et al.
Pubblicazione: (2025)
Visual Representation Learning with Stochastic Frame Prediction
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
di: Jang, Huiwon, et al.
Pubblicazione: (2024)
MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation
di: Yu, Sihyun, et al.
Pubblicazione: (2025)
di: Yu, Sihyun, et al.
Pubblicazione: (2025)
ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context
di: Jang, Huiwon, et al.
Pubblicazione: (2025)
di: Jang, Huiwon, et al.
Pubblicazione: (2025)
Diffusion Transformers with Representation Autoencoders
di: Zheng, Boyang, et al.
Pubblicazione: (2025)
di: Zheng, Boyang, et al.
Pubblicazione: (2025)
Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think
di: Garcia, Gonzalo Martin, et al.
Pubblicazione: (2024)
di: Garcia, Gonzalo Martin, et al.
Pubblicazione: (2024)
Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition
di: Yu, Sihyun, et al.
Pubblicazione: (2024)
di: Yu, Sihyun, et al.
Pubblicazione: (2024)
Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
di: Li, Ouxiang, et al.
Pubblicazione: (2025)
di: Li, Ouxiang, et al.
Pubblicazione: (2025)
Identification in (Endogenously) Nonlinear SVARs Is Easier Than You Think
di: Duffy, James A., et al.
Pubblicazione: (2026)
di: Duffy, James A., et al.
Pubblicazione: (2026)
ZeroFlow: Overcoming Catastrophic Forgetting is Easier than You Think
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
di: Tang, Bingda, et al.
Pubblicazione: (2026)
di: Tang, Bingda, et al.
Pubblicazione: (2026)
Intermediate Outputs Are More Sensitive Than You Think
di: Huang, Tao, et al.
Pubblicazione: (2024)
di: Huang, Tao, et al.
Pubblicazione: (2024)
LVMark: Robust Watermark for Latent Video Diffusion Models
di: Jang, MinHyuk, et al.
Pubblicazione: (2024)
di: Jang, MinHyuk, et al.
Pubblicazione: (2024)
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
di: Choi, June Suk, et al.
Pubblicazione: (2025)
di: Choi, June Suk, et al.
Pubblicazione: (2025)
Dual Data Alignment Makes AI-Generated Image Detector Easier Generalizable
di: Chen, Ruoxin, et al.
Pubblicazione: (2025)
di: Chen, Ruoxin, et al.
Pubblicazione: (2025)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
di: Tong, Shengbang, et al.
Pubblicazione: (2026)
di: Tong, Shengbang, et al.
Pubblicazione: (2026)
FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution
di: Kim, Aro, et al.
Pubblicazione: (2026)
di: Kim, Aro, et al.
Pubblicazione: (2026)
Your Embedding Model is SMARTer Than You Think
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
di: Lee, Jimin, et al.
Pubblicazione: (2026)
di: Lee, Jimin, et al.
Pubblicazione: (2026)
Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
Data-Efficient Molecular Generation with Hierarchical Textual Inversion
di: Kim, Seojin, et al.
Pubblicazione: (2024)
di: Kim, Seojin, et al.
Pubblicazione: (2024)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
di: Tang, Bingda, et al.
Pubblicazione: (2025)
di: Tang, Bingda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adversarial Robustification via Text-to-Image Diffusion Models
di: Choi, Daewon, et al.
Pubblicazione: (2024) -
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment
di: Kim, Younghyun, et al.
Pubblicazione: (2025) -
Controllable Human Image Generation with Personalized Multi-Garments
di: Choi, Yisol, et al.
Pubblicazione: (2024) -
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
di: Wu, Ge, et al.
Pubblicazione: (2025) -
Representation Alignment for Just Image Transformers is not Easier than You Think
di: Shin, Jaeyo, et al.
Pubblicazione: (2026)