Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Gongfan, Ma, Xinyin, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
TinyFusion: Diffusion Transformers Learned Shallow
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
In-Video Instructions: Visual Signals as Generative Control
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
di: Tang, Siao, et al.
Pubblicazione: (2025)
di: Tang, Siao, et al.
Pubblicazione: (2025)
Isomorphic Pruning for Vision Models
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
di: Chen, Lei, et al.
Pubblicazione: (2024)
di: Chen, Lei, et al.
Pubblicazione: (2024)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
di: Sun, Xibo, et al.
Pubblicazione: (2024)
di: Sun, Xibo, et al.
Pubblicazione: (2024)
Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
di: Chen, Zigeng, et al.
Pubblicazione: (2024)
SlimSAM: 0.1% Data Makes Segment Anything Slim
di: Chen, Zigeng, et al.
Pubblicazione: (2023)
di: Chen, Zigeng, et al.
Pubblicazione: (2023)
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
di: Tang, Siao, et al.
Pubblicazione: (2026)
di: Tang, Siao, et al.
Pubblicazione: (2026)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
di: Ji, Seunghyun
Pubblicazione: (2026)
di: Ji, Seunghyun
Pubblicazione: (2026)
MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation
di: Krishnamurthy, Bharath, et al.
Pubblicazione: (2026)
di: Krishnamurthy, Bharath, et al.
Pubblicazione: (2026)
DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
Thinkless: LLM Learns When to Think
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
di: Fang, Gongfan, et al.
Pubblicazione: (2025)
Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers
di: Zhang, Jiaji, et al.
Pubblicazione: (2026)
di: Zhang, Jiaji, et al.
Pubblicazione: (2026)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
di: Deng, Juncan, et al.
Pubblicazione: (2024)
di: Deng, Juncan, et al.
Pubblicazione: (2024)
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
di: Hu, Vincent Tao, et al.
Pubblicazione: (2024)
di: Hu, Vincent Tao, et al.
Pubblicazione: (2024)
DiT4Edit: Diffusion Transformer for Image Editing
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
MixReasoning: Switching Modes to Think
di: Lu, Haiquan, et al.
Pubblicazione: (2025)
di: Lu, Haiquan, et al.
Pubblicazione: (2025)
Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space
di: Wang, Xiaoce, et al.
Pubblicazione: (2026)
di: Wang, Xiaoce, et al.
Pubblicazione: (2026)
SpotEdit: Selective Region Editing in Diffusion Transformers
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
di: Zhou, Chao, et al.
Pubblicazione: (2026)
di: Zhou, Chao, et al.
Pubblicazione: (2026)
LaVin-DiT: Large Vision Diffusion Transformer
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
OminiControl2: Efficient Conditioning for Diffusion Transformers
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
Efficient Reasoning Models: A Survey
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
Rethinking Token Reduction for Large Vision-Language Models
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation
di: Zhang, Jian, et al.
Pubblicazione: (2026)
di: Zhang, Jian, et al.
Pubblicazione: (2026)
Knowledge Amalgamation for Object Detection with Transformers
di: Zhang, Haofei, et al.
Pubblicazione: (2022)
di: Zhang, Haofei, et al.
Pubblicazione: (2022)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
di: Zhou, Zihan, et al.
Pubblicazione: (2025)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
di: Zeng, Weixuan, et al.
Pubblicazione: (2026)
di: Zeng, Weixuan, et al.
Pubblicazione: (2026)
DiTFastAttnV2: Head-wise Attention Compression for Multi-Modality Diffusion Transformers
di: Zhang, Hanling, et al.
Pubblicazione: (2025)
di: Zhang, Hanling, et al.
Pubblicazione: (2025)
DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking
di: Haridas, Akash, et al.
Pubblicazione: (2026)
di: Haridas, Akash, et al.
Pubblicazione: (2026)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
di: Li, Zhimin, et al.
Pubblicazione: (2024)
di: Li, Zhimin, et al.
Pubblicazione: (2024)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
di: Chen, Zigeng, et al.
Pubblicazione: (2024) -
TinyFusion: Diffusion Transformers Learned Shallow
di: Fang, Gongfan, et al.
Pubblicazione: (2024) -
In-Video Instructions: Visual Signals as Generative Control
di: Fang, Gongfan, et al.
Pubblicazione: (2025) -
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
di: Tang, Siao, et al.
Pubblicazione: (2025) -
Isomorphic Pruning for Vision Models
di: Fang, Gongfan, et al.
Pubblicazione: (2024)