OminiControl2: Efficient Conditioning for Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Zhenxiong, Xue, Qiaochu, Yang, Xingyi, Liu, Songhua, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OminiControl: Minimal and Universal Control for Diffusion Transformer
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
Vision Bridge Transformer at Scale
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
SpotEdit: Selective Region Editing in Diffusion Transformers
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
MindBridge: A Cross-Subject Brain Decoding Framework
di: Wang, Shizun, et al.
Pubblicazione: (2024)
di: Wang, Shizun, et al.
Pubblicazione: (2024)
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Image Editing As Programs with Diffusion Models
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
Kolmogorov-Arnold Transformer
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
Ultra-Resolution Adaptation with Ease
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
Neural Metamorphosis
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
LinFusion: 1 GPU, 1 Minute, 16K Image
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
C4D: 4D Made from 3D through Dual Correspondences
di: Wang, Shizun, et al.
Pubblicazione: (2025)
di: Wang, Shizun, et al.
Pubblicazione: (2025)
Few-shot Implicit Function Generation via Equivariance
di: Huang, Suizhi, et al.
Pubblicazione: (2025)
di: Huang, Suizhi, et al.
Pubblicazione: (2025)
Flash Sculptor: Modular 3D Worlds from Objects
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
GFlow: Recovering 4D World from Monocular Video
di: Wang, Shizun, et al.
Pubblicazione: (2024)
di: Wang, Shizun, et al.
Pubblicazione: (2024)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Minute-Long Videos with Dual Parallelisms
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
di: Zhou, Letian, et al.
Pubblicazione: (2025)
di: Zhou, Letian, et al.
Pubblicazione: (2025)
TinyFusion: Diffusion Transformers Learned Shallow
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Relation Rectification in Diffusion Model
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
In-Video Instructions: Visual Signals as Generative Control
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
StyDeSty: Min-Max Stylization and Destylization for Single Domain Generalization
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Vista3D: Unravel the 3D Darkside of a Single Image
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
Hash3D: Training-free Acceleration for 3D Generation
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
Language Model as Visual Explainer
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
Compositional Video Generation as Flow Equalization
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
Efficient Gaussian Splatting for Monocular Dynamic Scene Rendering via Sparse Time-Variant Attribute Modeling
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
Image-Conditional Diffusion Transformer for Underwater Image Enhancement
di: Nie, Xingyang, et al.
Pubblicazione: (2024)
di: Nie, Xingyang, et al.
Pubblicazione: (2024)
Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
Control and Realism: Best of Both Worlds in Layout-to-Image without Training
di: Li, Bonan, et al.
Pubblicazione: (2025)
di: Li, Bonan, et al.
Pubblicazione: (2025)
POSTA: A Go-to Framework for Customized Artistic Poster Generation
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
di: Wu, Yunfeng, et al.
Pubblicazione: (2025)
di: Wu, Yunfeng, et al.
Pubblicazione: (2025)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
di: Liang, Cheng, et al.
Pubblicazione: (2026)
di: Liang, Cheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
OminiControl: Minimal and Universal Control for Diffusion Transformer
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024) -
Vision Bridge Transformer at Scale
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025) -
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024) -
SpotEdit: Selective Region Editing in Diffusion Transformers
di: Qin, Zhibin, et al.
Pubblicazione: (2025) -
MindBridge: A Cross-Subject Brain Decoding Framework
di: Wang, Shizun, et al.
Pubblicazione: (2024)