Guiding Token-Sparse Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Krause, Felix, Baumann, Stefan Andreas, Schusterbauer, Johannes, Grebenkova, Olga, Gui, Ming, Hu, Vincent Tao, Ommer, Björn |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
par: Hu, Vincent Tao, et autres
Publié: (2024)
par: Hu, Vincent Tao, et autres
Publié: (2024)
DepthFM: Fast Monocular Depth Estimation with Flow Matching
par: Gui, Ming, et autres
Publié: (2024)
par: Gui, Ming, et autres
Publié: (2024)
TREAD: Token Routing for Efficient Architecture-agnostic Diffusion Training
par: Krause, Felix, et autres
Publié: (2025)
par: Krause, Felix, et autres
Publié: (2025)
Boosting Latent Diffusion with Flow Matching
par: Schusterbauer, Johannes, et autres
Publié: (2023)
par: Schusterbauer, Johannes, et autres
Publié: (2023)
Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment
par: Schusterbauer, Johannes, et autres
Publié: (2025)
par: Schusterbauer, Johannes, et autres
Publié: (2025)
Distillation of Diffusion Features for Semantic Correspondence
par: Fundel, Frank, et autres
Publié: (2024)
par: Fundel, Frank, et autres
Publié: (2024)
Diffusion Models and Representation Learning: A Survey
par: Fuest, Michael, et autres
Publié: (2024)
par: Fuest, Michael, et autres
Publié: (2024)
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
par: Schusterbauer, Johannes, et autres
Publié: (2026)
par: Schusterbauer, Johannes, et autres
Publié: (2026)
Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
par: Gui, Ming, et autres
Publié: (2025)
par: Gui, Ming, et autres
Publié: (2025)
SCFlow: Implicitly Learning Style and Content Disentanglement with Flow Models
par: Ma, Pingchuan, et autres
Publié: (2025)
par: Ma, Pingchuan, et autres
Publié: (2025)
What If : Understanding Motion Through Sparse Interactions
par: Baumann, Stefan Andreas, et autres
Publié: (2025)
par: Baumann, Stefan Andreas, et autres
Publié: (2025)
DisMo: Disentangled Motion Representations for Open-World Motion Transfer
par: Ressler-Antal, Thomas, et autres
Publié: (2025)
par: Ressler-Antal, Thomas, et autres
Publié: (2025)
Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions
par: Baumann, Stefan Andreas, et autres
Publié: (2024)
par: Baumann, Stefan Andreas, et autres
Publié: (2024)
Probabilistic Precipitation Nowcasting with Rectified Flow Transformers
par: Schusterbauer, Johannes, et autres
Publié: (2026)
par: Schusterbauer, Johannes, et autres
Publié: (2026)
CleanDIFT: Diffusion Features without Noise
par: Stracke, Nick, et autres
Publié: (2024)
par: Stracke, Nick, et autres
Publié: (2024)
[MASK] is All You Need
par: Hu, Vincent Tao, et autres
Publié: (2024)
par: Hu, Vincent Tao, et autres
Publié: (2024)
MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation
par: Fuest, Michael, et autres
Publié: (2025)
par: Fuest, Michael, et autres
Publié: (2025)
Scaling Image Tokenizers with Grouped Spherical Quantization
par: Wang, Jiangtao, et autres
Publié: (2024)
par: Wang, Jiangtao, et autres
Publié: (2024)
CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I Models
par: Stracke, Nick, et autres
Publié: (2024)
par: Stracke, Nick, et autres
Publié: (2024)
RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video
par: Prestel, Ulrich, et autres
Publié: (2026)
par: Prestel, Ulrich, et autres
Publié: (2026)
ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment
par: Aghdam, Amir, et autres
Publié: (2025)
par: Aghdam, Amir, et autres
Publié: (2025)
Does VLM Classification Benefit from LLM Description Semantics?
par: Ma, Pingchuan, et autres
Publié: (2024)
par: Ma, Pingchuan, et autres
Publié: (2024)
Learning Long-term Motion Embeddings for Efficient Kinematics Generation
par: Stracke, Nick, et autres
Publié: (2026)
par: Stracke, Nick, et autres
Publié: (2026)
WaSt-3D: Wasserstein-2 Distance for Scene-to-Scene Stylization on 3D Gaussians
par: Kotovenko, Dmytro, et autres
Publié: (2024)
par: Kotovenko, Dmytro, et autres
Publié: (2024)
Envisioning the Future, One Step at a Time
par: Baumann, Stefan Andreas, et autres
Publié: (2026)
par: Baumann, Stefan Andreas, et autres
Publié: (2026)
Stable-Pose: Leveraging Transformers for Pose-Guided Text-to-Image Generation
par: Wang, Jiajun, et autres
Publié: (2024)
par: Wang, Jiajun, et autres
Publié: (2024)
Unsupervised View-Invariant Human Posture Representation
par: Sardari, Faegheh, et autres
Publié: (2021)
par: Sardari, Faegheh, et autres
Publié: (2021)
Quantum Denoising Diffusion Models
par: Kölle, Michael, et autres
Publié: (2024)
par: Kölle, Michael, et autres
Publié: (2024)
CAGE: Unsupervised Visual Composition and Animation for Controllable Video Generation
par: Davtyan, Aram, et autres
Publié: (2024)
par: Davtyan, Aram, et autres
Publié: (2024)
Guiding a Diffusion Model by Swapping Its Tokens
par: Zhang, Weijia, et autres
Publié: (2026)
par: Zhang, Weijia, et autres
Publié: (2026)
Training Class-Imbalanced Diffusion Model Via Overlap Optimization
par: Yan, Divin, et autres
Publié: (2024)
par: Yan, Divin, et autres
Publié: (2024)
Latent Drifting in Diffusion Models for Counterfactual Medical Image Synthesis
par: Yeganeh, Yousef, et autres
Publié: (2024)
par: Yeganeh, Yousef, et autres
Publié: (2024)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
par: Chang, Shuning, et autres
Publié: (2024)
par: Chang, Shuning, et autres
Publié: (2024)
DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity
par: Zhu, Haowei, et autres
Publié: (2026)
par: Zhu, Haowei, et autres
Publié: (2026)
Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
par: Li, Yitong, et autres
Publié: (2025)
par: Li, Yitong, et autres
Publié: (2025)
Latent Diffusion for Guided Document Table Generation
par: Hamdani, Syed Jawwad Haider, et autres
Publié: (2024)
par: Hamdani, Syed Jawwad Haider, et autres
Publié: (2024)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
Retinex-Diffusion: On Controlling Illumination Conditions in Diffusion Models via Retinex Theory
par: Xing, Xiaoyan, et autres
Publié: (2024)
par: Xing, Xiaoyan, et autres
Publié: (2024)
Feedback Guidance of Diffusion Models
par: Koulischer, Felix, et autres
Publié: (2025)
par: Koulischer, Felix, et autres
Publié: (2025)
Guided Trajectory Optimization with Sparse Scaling for Test-Time Diffusion
par: Dai, Gang, et autres
Publié: (2026)
par: Dai, Gang, et autres
Publié: (2026)
Documents similaires
-
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
par: Hu, Vincent Tao, et autres
Publié: (2024) -
DepthFM: Fast Monocular Depth Estimation with Flow Matching
par: Gui, Ming, et autres
Publié: (2024) -
TREAD: Token Routing for Efficient Architecture-agnostic Diffusion Training
par: Krause, Felix, et autres
Publié: (2025) -
Boosting Latent Diffusion with Flow Matching
par: Schusterbauer, Johannes, et autres
Publié: (2023) -
Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment
par: Schusterbauer, Johannes, et autres
Publié: (2025)