3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Dewei, Xie, Ji, Yang, Zongxin, Yang, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation
von: Zhou, Dewei, et al.
Veröffentlicht: (2024)
von: Zhou, Dewei, et al.
Veröffentlicht: (2024)
DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
von: Zhou, Dewei, et al.
Veröffentlicht: (2026)
von: Zhou, Dewei, et al.
Veröffentlicht: (2026)
MIGC++: Advanced Multi-Instance Generation Controller for Image Synthesis
von: Zhou, Dewei, et al.
Veröffentlicht: (2024)
von: Zhou, Dewei, et al.
Veröffentlicht: (2024)
Insert Anything: Image Insertion via In-Context Editing in DiT
von: Song, Wensong, et al.
Veröffentlicht: (2025)
von: Song, Wensong, et al.
Veröffentlicht: (2025)
DiVE: DiT-based Video Generation with Enhanced Control
von: Jiang, Junpeng, et al.
Veröffentlicht: (2024)
von: Jiang, Junpeng, et al.
Veröffentlicht: (2024)
OUSAC: Optimized Guidance Scheduling with Adaptive Caching for DiT Acceleration
von: Sun, Ruitong, et al.
Veröffentlicht: (2025)
von: Sun, Ruitong, et al.
Veröffentlicht: (2025)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
von: Zhang, Zechuan, et al.
Veröffentlicht: (2025)
von: Zhang, Zechuan, et al.
Veröffentlicht: (2025)
MaterialPicker: Multi-Modal DiT-Based Material Generation
von: Ma, Xiaohe, et al.
Veröffentlicht: (2024)
von: Ma, Xiaohe, et al.
Veröffentlicht: (2024)
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
von: Ji, Seunghyun
Veröffentlicht: (2026)
von: Ji, Seunghyun
Veröffentlicht: (2026)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
von: Yang, Yuhuan, et al.
Veröffentlicht: (2026)
von: Yang, Yuhuan, et al.
Veröffentlicht: (2026)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
von: Yang, Lianwei, et al.
Veröffentlicht: (2025)
von: Yang, Lianwei, et al.
Veröffentlicht: (2025)
HiMat: DiT-based Ultra-High Resolution SVBRDF Generation
von: Wang, Zixiong, et al.
Veröffentlicht: (2025)
von: Wang, Zixiong, et al.
Veröffentlicht: (2025)
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
von: Zhou, Dewei, et al.
Veröffentlicht: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
von: Wang, Zhaoqing, et al.
Veröffentlicht: (2024)
von: Wang, Zhaoqing, et al.
Veröffentlicht: (2024)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
von: Yang, Zhuoyi, et al.
Veröffentlicht: (2024)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
von: Shi, Yangming, et al.
Veröffentlicht: (2026)
von: Shi, Yangming, et al.
Veröffentlicht: (2026)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
von: Wu, Junyi, et al.
Veröffentlicht: (2024)
von: Wu, Junyi, et al.
Veröffentlicht: (2024)
SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction
von: Zhang, Zechuan, et al.
Veröffentlicht: (2023)
von: Zhang, Zechuan, et al.
Veröffentlicht: (2023)
HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2024)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2024)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
von: Qi, Tianhao, et al.
Veröffentlicht: (2025)
von: Qi, Tianhao, et al.
Veröffentlicht: (2025)
3D Object Manipulation in a Single Image using Generative Models
von: Zhao, Ruisi, et al.
Veröffentlicht: (2025)
von: Zhao, Ruisi, et al.
Veröffentlicht: (2025)
RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization
von: Yang, Kaicheng, et al.
Veröffentlicht: (2025)
von: Yang, Kaicheng, et al.
Veröffentlicht: (2025)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
von: Chen, Chen, et al.
Veröffentlicht: (2025)
von: Chen, Chen, et al.
Veröffentlicht: (2025)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
von: Liu, Dongyang, et al.
Veröffentlicht: (2025)
von: Liu, Dongyang, et al.
Veröffentlicht: (2025)
TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking
von: Hu, Jiyuan, et al.
Veröffentlicht: (2026)
von: Hu, Jiyuan, et al.
Veröffentlicht: (2026)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
von: Sun, Yasheng, et al.
Veröffentlicht: (2025)
von: Sun, Yasheng, et al.
Veröffentlicht: (2025)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
von: Tian, Yuchuan, et al.
Veröffentlicht: (2024)
von: Tian, Yuchuan, et al.
Veröffentlicht: (2024)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
von: Xie, Yu, et al.
Veröffentlicht: (2025)
von: Xie, Yu, et al.
Veröffentlicht: (2025)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
von: Kong, Lingshun, et al.
Veröffentlicht: (2026)
von: Kong, Lingshun, et al.
Veröffentlicht: (2026)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
von: Zhou, Jingkai, et al.
Veröffentlicht: (2025)
von: Zhou, Jingkai, et al.
Veröffentlicht: (2025)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
von: Feng, He, et al.
Veröffentlicht: (2025)
von: Feng, He, et al.
Veröffentlicht: (2025)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
von: Chen, Ruichen, et al.
Veröffentlicht: (2025)
von: Chen, Ruichen, et al.
Veröffentlicht: (2025)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
von: Feng, Haoran, et al.
Veröffentlicht: (2025)
von: Feng, Haoran, et al.
Veröffentlicht: (2025)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
von: Fang, Haipeng, et al.
Veröffentlicht: (2025)
von: Fang, Haipeng, et al.
Veröffentlicht: (2025)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
von: Chen, Pengtao, et al.
Veröffentlicht: (2024)
von: Chen, Pengtao, et al.
Veröffentlicht: (2024)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
von: Lyu, Hengye, et al.
Veröffentlicht: (2026)
von: Lyu, Hengye, et al.
Veröffentlicht: (2026)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
von: Lin, Hangyu, et al.
Veröffentlicht: (2026)
von: Lin, Hangyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation
von: Zhou, Dewei, et al.
Veröffentlicht: (2024) -
DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
von: Zhou, Dewei, et al.
Veröffentlicht: (2025) -
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
von: Zhou, Dewei, et al.
Veröffentlicht: (2026) -
MIGC++: Advanced Multi-Instance Generation Controller for Image Synthesis
von: Zhou, Dewei, et al.
Veröffentlicht: (2024) -
Insert Anything: Image Insertion via In-Context Editing in DiT
von: Song, Wensong, et al.
Veröffentlicht: (2025)