ZigMa: A DiT-style Zigzag Mamba Diffusion Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Vincent Tao, Baumann, Stefan Andreas, Gui, Ming, Grebenkova, Olga, Ma, Pingchuan, Schusterbauer, Johannes, Ommer, Björn |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Guiding Token-Sparse Diffusion Models
di: Krause, Felix, et al.
Pubblicazione: (2026)
di: Krause, Felix, et al.
Pubblicazione: (2026)
DepthFM: Fast Monocular Depth Estimation with Flow Matching
di: Gui, Ming, et al.
Pubblicazione: (2024)
di: Gui, Ming, et al.
Pubblicazione: (2024)
Boosting Latent Diffusion with Flow Matching
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2023)
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2023)
Diffusion Models and Representation Learning: A Survey
di: Fuest, Michael, et al.
Pubblicazione: (2024)
di: Fuest, Michael, et al.
Pubblicazione: (2024)
Distillation of Diffusion Features for Semantic Correspondence
di: Fundel, Frank, et al.
Pubblicazione: (2024)
di: Fundel, Frank, et al.
Pubblicazione: (2024)
Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2025)
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2025)
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2026)
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2026)
SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
di: Ma, Pingchuan, et al.
Pubblicazione: (2025)
di: Ma, Pingchuan, et al.
Pubblicazione: (2025)
TREAD: Token Routing for Efficient Architecture-agnostic Diffusion Training
di: Krause, Felix, et al.
Pubblicazione: (2025)
di: Krause, Felix, et al.
Pubblicazione: (2025)
Does VLM Classification Benefit from LLM Description Semantics?
di: Ma, Pingchuan, et al.
Pubblicazione: (2024)
di: Ma, Pingchuan, et al.
Pubblicazione: (2024)
Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
di: Gui, Ming, et al.
Pubblicazione: (2025)
di: Gui, Ming, et al.
Pubblicazione: (2025)
Probabilistic Precipitation Nowcasting with Rectified Flow Transformers
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2026)
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2026)
EDGS: Eliminating Densification for Efficient Convergence of 3DGS
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2025)
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2025)
[MASK] is All You Need
di: Hu, Vincent Tao, et al.
Pubblicazione: (2024)
di: Hu, Vincent Tao, et al.
Pubblicazione: (2024)
CleanDIFT: Diffusion Features without Noise
di: Stracke, Nick, et al.
Pubblicazione: (2024)
di: Stracke, Nick, et al.
Pubblicazione: (2024)
What If : Understanding Motion Through Sparse Interactions
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2025)
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2025)
HalluZig: Hallucination Detection using Zigzag Persistence
di: Samaga, Shreyas N., et al.
Pubblicazione: (2026)
di: Samaga, Shreyas N., et al.
Pubblicazione: (2026)
MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation
di: Fuest, Michael, et al.
Pubblicazione: (2025)
di: Fuest, Michael, et al.
Pubblicazione: (2025)
WaSt-3D: Wasserstein-2 Distance for Scene-to-Scene Stylization on 3D Gaussians
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2024)
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2024)
RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video
di: Prestel, Ulrich, et al.
Pubblicazione: (2026)
di: Prestel, Ulrich, et al.
Pubblicazione: (2026)
Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2024)
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2024)
DisMo: Disentangled Motion Representations for Open-World Motion Transfer
di: Ressler-Antal, Thomas, et al.
Pubblicazione: (2025)
di: Ressler-Antal, Thomas, et al.
Pubblicazione: (2025)
ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment
di: Aghdam, Amir, et al.
Pubblicazione: (2025)
di: Aghdam, Amir, et al.
Pubblicazione: (2025)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
di: Shi, Junqi, et al.
Pubblicazione: (2026)
di: Shi, Junqi, et al.
Pubblicazione: (2026)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
di: Tian, Yuchuan, et al.
Pubblicazione: (2024)
DiT4Edit: Diffusion Transformer for Image Editing
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
di: Feng, Kunyu, et al.
Pubblicazione: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2024)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
di: Zhu, Rui, et al.
Pubblicazione: (2024)
di: Zhu, Rui, et al.
Pubblicazione: (2024)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
di: Chen, Pengtao, et al.
Pubblicazione: (2024)
di: Chen, Pengtao, et al.
Pubblicazione: (2024)
CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I Models
di: Stracke, Nick, et al.
Pubblicazione: (2024)
di: Stracke, Nick, et al.
Pubblicazione: (2024)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
di: Fang, Jiarui, et al.
Pubblicazione: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
Envisioning the Future, One Step at a Time
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2026)
di: Baumann, Stefan Andreas, et al.
Pubblicazione: (2026)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
di: Zhang, Jinxiao, et al.
Pubblicazione: (2026)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
di: Chen, Lei, et al.
Pubblicazione: (2024)
di: Chen, Lei, et al.
Pubblicazione: (2024)
Learning Long-term Motion Embeddings for Efficient Kinematics Generation
di: Stracke, Nick, et al.
Pubblicazione: (2026)
di: Stracke, Nick, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Guiding Token-Sparse Diffusion Models
di: Krause, Felix, et al.
Pubblicazione: (2026) -
DepthFM: Fast Monocular Depth Estimation with Flow Matching
di: Gui, Ming, et al.
Pubblicazione: (2024) -
Boosting Latent Diffusion with Flow Matching
di: Schusterbauer, Johannes, et al.
Pubblicazione: (2023) -
Diffusion Models and Representation Learning: A Survey
di: Fuest, Michael, et al.
Pubblicazione: (2024) -
Distillation of Diffusion Features for Semantic Correspondence
di: Fundel, Frank, et al.
Pubblicazione: (2024)