FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Yunfeng, Song, Jiayi, Tan, Zhenxiong, He, Zihao, Liu, Songhua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
by: Wu, Yunfeng, et al.
Published: (2026)
by: Wu, Yunfeng, et al.
Published: (2026)
Ultra-Resolution Adaptation with Ease
by: Yu, Ruonan, et al.
Published: (2025)
by: Yu, Ruonan, et al.
Published: (2025)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
by: Yu, Ruonan, et al.
Published: (2026)
by: Yu, Ruonan, et al.
Published: (2026)
Video-Infinity: Distributed Long Video Generation
by: Tan, Zhenxiong, et al.
Published: (2024)
by: Tan, Zhenxiong, et al.
Published: (2024)
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
by: Liu, Songhua, et al.
Published: (2024)
by: Liu, Songhua, et al.
Published: (2024)
SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution
by: Wang, Chao, et al.
Published: (2026)
by: Wang, Chao, et al.
Published: (2026)
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
by: Liu, Yuhe, et al.
Published: (2026)
by: Liu, Yuhe, et al.
Published: (2026)
DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion
by: Hwang, Geunmin, et al.
Published: (2025)
by: Hwang, Geunmin, et al.
Published: (2025)
MindBridge: A Cross-Subject Brain Decoding Framework
by: Wang, Shizun, et al.
Published: (2024)
by: Wang, Shizun, et al.
Published: (2024)
LinFusion: 1 GPU, 1 Minute, 16K Image
by: Liu, Songhua, et al.
Published: (2024)
by: Liu, Songhua, et al.
Published: (2024)
Sliding Window Attention for Learned Video Compression
by: Kopte, Alexander, et al.
Published: (2025)
by: Kopte, Alexander, et al.
Published: (2025)
SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls
by: Xu, Qianxun, et al.
Published: (2026)
by: Xu, Qianxun, et al.
Published: (2026)
UltraGen: High-Resolution Video Generation with Hierarchical Attention
by: Hu, Teng, et al.
Published: (2025)
by: Hu, Teng, et al.
Published: (2025)
SWiT-4D: Sliding-Window Transformer for Lossless and Parameter-Free Temporal 4D Generation
by: Gong, Kehong, et al.
Published: (2025)
by: Gong, Kehong, et al.
Published: (2025)
Image Editing As Programs with Diffusion Models
by: Hu, Yujia, et al.
Published: (2025)
by: Hu, Yujia, et al.
Published: (2025)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
by: Lu, Yu, et al.
Published: (2024)
by: Lu, Yu, et al.
Published: (2024)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
by: Zhou, Letian, et al.
Published: (2025)
by: Zhou, Letian, et al.
Published: (2025)
PhyRPR: Training-Free Physics-Constrained Video Generation
by: Zhao, Yibo, et al.
Published: (2026)
by: Zhao, Yibo, et al.
Published: (2026)
SpotEdit: Selective Region Editing in Diffusion Transformers
by: Qin, Zhibin, et al.
Published: (2025)
by: Qin, Zhibin, et al.
Published: (2025)
OminiControl2: Efficient Conditioning for Diffusion Transformers
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion
by: Lai, Hong-Phuc, et al.
Published: (2026)
by: Lai, Hong-Phuc, et al.
Published: (2026)
DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
by: Yesiltepe, Hidir, et al.
Published: (2026)
by: Yesiltepe, Hidir, et al.
Published: (2026)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
by: Luo, Jiayi, et al.
Published: (2026)
by: Luo, Jiayi, et al.
Published: (2026)
VGGT-CD: Training-Free Robust Registration for 3D Change Detection
by: Zhang, Wei, et al.
Published: (2026)
by: Zhang, Wei, et al.
Published: (2026)
Dual Frequency Branch Framework with Reconstructed Sliding Windows Attention for AI-Generated Image Detection
by: Yan, Jiazhen, et al.
Published: (2025)
by: Yan, Jiazhen, et al.
Published: (2025)
OminiControl: Minimal and Universal Control for Diffusion Transformer
by: Tan, Zhenxiong, et al.
Published: (2024)
by: Tan, Zhenxiong, et al.
Published: (2024)
One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control
by: Rao, Haoxiang, et al.
Published: (2026)
by: Rao, Haoxiang, et al.
Published: (2026)
FreeVA: Offline MLLM as Training-Free Video Assistant
by: Wu, Wenhao
Published: (2024)
by: Wu, Wenhao
Published: (2024)
Fast Video Generation with Sliding Tile Attention
by: Zhang, Peiyuan, et al.
Published: (2025)
by: Zhang, Peiyuan, et al.
Published: (2025)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
by: Shen, Leqi, et al.
Published: (2025)
by: Shen, Leqi, et al.
Published: (2025)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
by: Gao, Jiayi, et al.
Published: (2025)
by: Gao, Jiayi, et al.
Published: (2025)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
by: Han, Su Ho, et al.
Published: (2025)
by: Han, Su Ho, et al.
Published: (2025)
FouriScale: A Frequency Perspective on Training-Free High-Resolution Image Synthesis
by: Huang, Linjiang, et al.
Published: (2024)
by: Huang, Linjiang, et al.
Published: (2024)
FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
by: Lin, Jiang, et al.
Published: (2025)
by: Lin, Jiang, et al.
Published: (2025)
BachVid: Training-Free Video Generation with Consistent Background and Character
by: Yan, Han, et al.
Published: (2025)
by: Yan, Han, et al.
Published: (2025)
Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
by: Zuo, Zuo, et al.
Published: (2025)
by: Zuo, Zuo, et al.
Published: (2025)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
by: Feng, X., et al.
Published: (2026)
by: Feng, X., et al.
Published: (2026)
LVSA: Training-Free Sparse Attention for Long Video Diffusion
by: Glorian, Gael, et al.
Published: (2026)
by: Glorian, Gael, et al.
Published: (2026)
TraDiffusion: Trajectory-Based Training-Free Image Generation
by: Wu, Mingrui, et al.
Published: (2024)
by: Wu, Mingrui, et al.
Published: (2024)
Similar Items
-
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
by: Wu, Yunfeng, et al.
Published: (2026) -
Ultra-Resolution Adaptation with Ease
by: Yu, Ruonan, et al.
Published: (2025) -
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
by: Yu, Ruonan, et al.
Published: (2026) -
Video-Infinity: Distributed Long Video Generation
by: Tan, Zhenxiong, et al.
Published: (2024) -
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
by: Liu, Songhua, et al.
Published: (2024)