Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Guanjie, Zhao, Xinyu, Zhou, Yucheng, Qu, Xiaoye, Chen, Tianlong, Cheng, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
di: Chen, Guanjie, et al.
Pubblicazione: (2025)
di: Chen, Guanjie, et al.
Pubblicazione: (2025)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
di: Song, Mingyang, et al.
Pubblicazione: (2025)
di: Song, Mingyang, et al.
Pubblicazione: (2025)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
di: Sun, Jiashuo, et al.
Pubblicazione: (2024)
di: Sun, Jiashuo, et al.
Pubblicazione: (2024)
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers
di: Cui, Hanshuai, et al.
Pubblicazione: (2026)
di: Cui, Hanshuai, et al.
Pubblicazione: (2026)
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
di: Huang, Lianming, et al.
Pubblicazione: (2025)
di: Huang, Lianming, et al.
Pubblicazione: (2025)
ExFusion: Efficient Transformer Training via Multi-Experts Fusion
di: Ruan, Jiacheng, et al.
Pubblicazione: (2026)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2026)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
di: Zhang, Jihai, et al.
Pubblicazione: (2024)
di: Zhang, Jihai, et al.
Pubblicazione: (2024)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
di: Shen, Chuming, et al.
Pubblicazione: (2025)
di: Shen, Chuming, et al.
Pubblicazione: (2025)
A Space-Time Transformer for Precipitation Nowcasting
di: Harris, Levi, et al.
Pubblicazione: (2025)
di: Harris, Levi, et al.
Pubblicazione: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
di: He, Zefeng, et al.
Pubblicazione: (2025)
di: He, Zefeng, et al.
Pubblicazione: (2025)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
SkipViT: Speeding Up Vision Transformers with a Token-Level Skip Connection
di: Ataiefard, Foozhan, et al.
Pubblicazione: (2024)
di: Ataiefard, Foozhan, et al.
Pubblicazione: (2024)
SSI-DM: Singularity Skipping Inversion of Diffusion Models
di: Min, Chen, et al.
Pubblicazione: (2026)
di: Min, Chen, et al.
Pubblicazione: (2026)
Spectral-Structured Diffusion for Single-Image Rain Removal
di: Xing, Yucheng, et al.
Pubblicazione: (2026)
di: Xing, Yucheng, et al.
Pubblicazione: (2026)
Skip and Skip: Segmenting Medical Images with Prompts
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
On the Vulnerability of Skip Connections to Model Inversion Attacks
di: Koh, Jun Hao, et al.
Pubblicazione: (2024)
di: Koh, Jun Hao, et al.
Pubblicazione: (2024)
Optimization of Layer Skipping and Frequency Scaling for Convolutional Neural Networks under Latency Constraint
di: Chan, Minh David Thao, et al.
Pubblicazione: (2025)
di: Chan, Minh David Thao, et al.
Pubblicazione: (2025)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
Training-Free Style and Content Transfer by Leveraging U-Net Skip Connections in Stable Diffusion
di: Schaerf, Ludovica, et al.
Pubblicazione: (2025)
di: Schaerf, Ludovica, et al.
Pubblicazione: (2025)
UNet--: Memory-Efficient and Feature-Enhanced Network Architecture based on U-Net with Reduced Skip-Connections
di: Yin, Lingxiao, et al.
Pubblicazione: (2024)
di: Yin, Lingxiao, et al.
Pubblicazione: (2024)
SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping
di: Li, Jiajun, et al.
Pubblicazione: (2025)
di: Li, Jiajun, et al.
Pubblicazione: (2025)
Soft Masked Transformer for Point Cloud Processing with Skip Attention-Based Upsampling
di: He, Yong, et al.
Pubblicazione: (2024)
di: He, Yong, et al.
Pubblicazione: (2024)
Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping
di: Park, Sunghyun, et al.
Pubblicazione: (2026)
di: Park, Sunghyun, et al.
Pubblicazione: (2026)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
di: Liu, Daizong, et al.
Pubblicazione: (2024)
di: Liu, Daizong, et al.
Pubblicazione: (2024)
GRIT-LP: Graph Transformer with Long-Range Skip Connection and Partitioned Spatial Graphs for Accurate Ice Layer Thickness Prediction
di: Liu, Zesheng, et al.
Pubblicazione: (2025)
di: Liu, Zesheng, et al.
Pubblicazione: (2025)
SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training
di: Li, Jingxing, et al.
Pubblicazione: (2026)
di: Li, Jingxing, et al.
Pubblicazione: (2026)
Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers
di: Chen, Guantao, et al.
Pubblicazione: (2026)
di: Chen, Guantao, et al.
Pubblicazione: (2026)
Beyond Skip Connection: Pooling and Unpooling Design for Elimination Singularities
di: Sun, Chengkun, et al.
Pubblicazione: (2024)
di: Sun, Chengkun, et al.
Pubblicazione: (2024)
Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
di: Zheng, Shikang, et al.
Pubblicazione: (2025)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
TransGUNet: Transformer Meets Graph-based Skip Connection for Medical Image Segmentation
di: Nam, Ju-Hyeon, et al.
Pubblicazione: (2025)
di: Nam, Ju-Hyeon, et al.
Pubblicazione: (2025)
SkiP: When to Skip and When to Refine for Efficient Robot Manipulation
di: Dai, Mingtong, et al.
Pubblicazione: (2026)
di: Dai, Mingtong, et al.
Pubblicazione: (2026)
SkipSR: Faster Super Resolution with Token Skipping
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
di: Choudhury, Rohan, et al.
Pubblicazione: (2025)
Rethinking Skip Connections: Additive U-Net for Robust and Interpretable Denoising
di: Lakkavalli, Vikram R
Pubblicazione: (2026)
di: Lakkavalli, Vikram R
Pubblicazione: (2026)
Enhancing Feature Fusion of U-like Networks with Dynamic Skip Connections
di: Cao, Yue, et al.
Pubblicazione: (2025)
di: Cao, Yue, et al.
Pubblicazione: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
di: Zeng, Weili, et al.
Pubblicazione: (2025)
di: Zeng, Weili, et al.
Pubblicazione: (2025)
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
di: He, Yu, et al.
Pubblicazione: (2026)
di: He, Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
di: Chen, Guanjie, et al.
Pubblicazione: (2025) -
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
di: Song, Mingyang, et al.
Pubblicazione: (2025) -
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
di: He, Zefeng, et al.
Pubblicazione: (2025) -
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
di: Sun, Jiashuo, et al.
Pubblicazione: (2024) -
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
di: Liao, Xinyao, et al.
Pubblicazione: (2025)