Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Yangming, Zhu, Shixiang, Shen, Tao, Yu, Zhimiao, Chen, Dengsheng, Chen, Taicai, Yang, Yunfei, Zhou, Juan, Cheng, Chen, Ma, Liang, Wu, Xibin, Yan, Benxuan, Li, Ge, Zhang, Tuoyu, Li, Dan, Liu, Chang, Sun, Zhenbang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
di: Shen, Tao, et al.
Pubblicazione: (2025)
di: Shen, Tao, et al.
Pubblicazione: (2025)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
di: Kong, Lingshun, et al.
Pubblicazione: (2026)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
di: Zhu, Rui, et al.
Pubblicazione: (2024)
di: Zhu, Rui, et al.
Pubblicazione: (2024)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
di: Chen, Pengtao, et al.
Pubblicazione: (2024)
di: Chen, Pengtao, et al.
Pubblicazione: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
di: Chen, Lei, et al.
Pubblicazione: (2024)
di: Chen, Lei, et al.
Pubblicazione: (2024)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
di: Ma, Teli, et al.
Pubblicazione: (2026)
di: Ma, Teli, et al.
Pubblicazione: (2026)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
di: Lu, Runyu, et al.
Pubblicazione: (2025)
di: Lu, Runyu, et al.
Pubblicazione: (2025)
XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
di: Chen, Bowen, et al.
Pubblicazione: (2025)
di: Chen, Bowen, et al.
Pubblicazione: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
di: Chen, Sixiang, et al.
Pubblicazione: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
di: Liu, Zhenyu, et al.
Pubblicazione: (2025)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
di: Chen, Ruichen, et al.
Pubblicazione: (2025)
di: Chen, Ruichen, et al.
Pubblicazione: (2025)
BIG-MoE: Bypass Isolated Gating MoE for Generalized Multimodal Face Anti-Spoofing
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
di: Ma, Yingjie, et al.
Pubblicazione: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
di: Wang, Liujianfu, et al.
Pubblicazione: (2025)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
di: Tan, Xin, et al.
Pubblicazione: (2025)
di: Tan, Xin, et al.
Pubblicazione: (2025)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
di: Feng, He, et al.
Pubblicazione: (2025)
di: Feng, He, et al.
Pubblicazione: (2025)
MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs
di: He, Xianglong, et al.
Pubblicazione: (2025)
di: He, Xianglong, et al.
Pubblicazione: (2025)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
di: Li, Zhimin, et al.
Pubblicazione: (2024)
di: Li, Zhimin, et al.
Pubblicazione: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
MoE-SpAc: Efficient MoE Inference Based on Speculative Activation Utility in Heterogeneous Edge Scenarios
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
di: Li, Shuhuai, et al.
Pubblicazione: (2026)
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
di: Zheng, Size, et al.
Pubblicazione: (2026)
di: Zheng, Size, et al.
Pubblicazione: (2026)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
di: Shi, Junqi, et al.
Pubblicazione: (2026)
di: Shi, Junqi, et al.
Pubblicazione: (2026)
Retraining-Free Merging of Sparse MoE via Hierarchical Clustering
di: Chen, I-Chun, et al.
Pubblicazione: (2024)
di: Chen, I-Chun, et al.
Pubblicazione: (2024)
Transforming Higher Education with AI-Powered Video Lectures
di: Zhang, Dengsheng
Pubblicazione: (2025)
di: Zhang, Dengsheng
Pubblicazione: (2025)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
di: Xie, Yu, et al.
Pubblicazione: (2025)
di: Xie, Yu, et al.
Pubblicazione: (2025)
TextFlux: An OCR‐Free DiT Model for High‐Fidelity Multilingual Scene Text Synthesis
di: Yu Xie, et al.
Pubblicazione: (2026)
di: Yu Xie, et al.
Pubblicazione: (2026)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
di: Zhou, Jingkai, et al.
Pubblicazione: (2025)
di: Zhou, Jingkai, et al.
Pubblicazione: (2025)
An Invisible Backdoor Attack Based On Semantic Feature
di: Chen, Yangming
Pubblicazione: (2024)
di: Chen, Yangming
Pubblicazione: (2024)
DynaMo: Runtime Switchable Quantization for MoE with Cross-Dataset Adaptation
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
di: Sun, Xibo, et al.
Pubblicazione: (2024)
di: Sun, Xibo, et al.
Pubblicazione: (2024)
Divide-and-Conquer for Enhancing Unlabeled Learning, Stability, and Plasticity in Semi-supervised Continual Learning
di: Duan, Yue, et al.
Pubblicazione: (2025)
di: Duan, Yue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
di: Shen, Tao, et al.
Pubblicazione: (2025) -
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
di: Kong, Lingshun, et al.
Pubblicazione: (2026) -
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
di: Zhu, Rui, et al.
Pubblicazione: (2024) -
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
di: Chen, Pengtao, et al.
Pubblicazione: (2024) -
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)