XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Bowen, Zhao, Mengyi, Sun, Haomiao, Chen, Li, Wang, Xu, Du, Kang, Wu, Xinglong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024)
por: Jiang, Junpeng, et al.
Publicado: (2024)
MaterialPicker: Multi-Modal DiT-Based Material Generation
por: Ma, Xiaohe, et al.
Publicado: (2024)
por: Ma, Xiaohe, et al.
Publicado: (2024)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
por: Lin, Hangyu, et al.
Publicado: (2026)
por: Lin, Hangyu, et al.
Publicado: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
por: Feng, Haoran, et al.
Publicado: (2025)
por: Feng, Haoran, et al.
Publicado: (2025)
OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
por: Sun, Ruitong, et al.
Publicado: (2025)
por: Sun, Ruitong, et al.
Publicado: (2025)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
por: Tian, Yuchuan, et al.
Publicado: (2024)
por: Tian, Yuchuan, et al.
Publicado: (2024)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
por: Zhou, Jingkai, et al.
Publicado: (2025)
por: Zhou, Jingkai, et al.
Publicado: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
por: Wang, Zhaoqing, et al.
Publicado: (2024)
por: Wang, Zhaoqing, et al.
Publicado: (2024)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
por: Shi, Yangming, et al.
Publicado: (2026)
por: Shi, Yangming, et al.
Publicado: (2026)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
por: Chen, Pengtao, et al.
Publicado: (2024)
por: Chen, Pengtao, et al.
Publicado: (2024)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
por: Feng, He, et al.
Publicado: (2025)
por: Feng, He, et al.
Publicado: (2025)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
por: Zhao, Lin, et al.
Publicado: (2026)
por: Zhao, Lin, et al.
Publicado: (2026)
MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs
por: He, Xianglong, et al.
Publicado: (2025)
por: He, Xianglong, et al.
Publicado: (2025)
Insert Anything: Image Insertion via In-Context Editing in DiT
por: Song, Wensong, et al.
Publicado: (2025)
por: Song, Wensong, et al.
Publicado: (2025)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
por: Zhu, Rui, et al.
Publicado: (2024)
por: Zhu, Rui, et al.
Publicado: (2024)
VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers
por: Zheng, Jun, et al.
Publicado: (2024)
por: Zheng, Jun, et al.
Publicado: (2024)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
por: Li, Zhimin, et al.
Publicado: (2024)
por: Li, Zhimin, et al.
Publicado: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations
por: Tan, Kailin, et al.
Publicado: (2026)
por: Tan, Kailin, et al.
Publicado: (2026)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
por: Wu, Junyi, et al.
Publicado: (2024)
por: Wu, Junyi, et al.
Publicado: (2024)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation
por: Cai, Honghao, et al.
Publicado: (2026)
por: Cai, Honghao, et al.
Publicado: (2026)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
por: Zhou, Chao, et al.
Publicado: (2026)
por: Zhou, Chao, et al.
Publicado: (2026)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
por: Mikaeili, Aryan, et al.
Publicado: (2026)
por: Mikaeili, Aryan, et al.
Publicado: (2026)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
por: Chen, Ruichen, et al.
Publicado: (2025)
por: Chen, Ruichen, et al.
Publicado: (2025)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
por: Yang, Yuhuan, et al.
Publicado: (2026)
por: Yang, Yuhuan, et al.
Publicado: (2026)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
por: Yang, Lianwei, et al.
Publicado: (2025)
por: Yang, Lianwei, et al.
Publicado: (2025)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
por: Liu, Dongyang, et al.
Publicado: (2025)
por: Liu, Dongyang, et al.
Publicado: (2025)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
por: Sun, Yasheng, et al.
Publicado: (2025)
por: Sun, Yasheng, et al.
Publicado: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
por: Lyu, Hengye, et al.
Publicado: (2026)
por: Lyu, Hengye, et al.
Publicado: (2026)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
por: Tan, Xin, et al.
Publicado: (2025)
por: Tan, Xin, et al.
Publicado: (2025)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
por: Sun, Xibo, et al.
Publicado: (2024)
por: Sun, Xibo, et al.
Publicado: (2024)
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
por: Zhuo, Le, et al.
Publicado: (2024)
por: Zhuo, Le, et al.
Publicado: (2024)
Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers
por: Zhang, Jiaji, et al.
Publicado: (2026)
por: Zhang, Jiaji, et al.
Publicado: (2026)
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
por: Shao, Ruizhi, et al.
Publicado: (2024)
por: Shao, Ruizhi, et al.
Publicado: (2024)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
por: Xie, Yu, et al.
Publicado: (2025)
por: Xie, Yu, et al.
Publicado: (2025)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
por: Qi, Tianhao, et al.
Publicado: (2025)
por: Qi, Tianhao, et al.
Publicado: (2025)
Ejemplares similares
-
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024) -
MaterialPicker: Multi-Modal DiT-Based Material Generation
por: Ma, Xiaohe, et al.
Publicado: (2024) -
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
por: Lin, Hangyu, et al.
Publicado: (2026) -
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024) -
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
por: Feng, Haoran, et al.
Publicado: (2025)