Boosting Diffusion Models with Moving Average Sampling in Frequency Domain
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Qian, Yurui, Cai, Qi, Pan, Yingwei, Li, Yehao, Yao, Ting, Sun, Qibin, Mei, Tao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Creatively Upscaling Images with Global-Regional Priors
von: Qian, Yurui, et al.
Veröffentlicht: (2025)
von: Qian, Yurui, et al.
Veröffentlicht: (2025)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
von: Yao, Ting, et al.
Veröffentlicht: (2024)
von: Yao, Ting, et al.
Veröffentlicht: (2024)
Improving Virtual Try-On with Garment-focused Diffusion Models
von: Wan, Siqi, et al.
Veröffentlicht: (2024)
von: Wan, Siqi, et al.
Veröffentlicht: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
von: Mao, Qingyang, et al.
Veröffentlicht: (2025)
von: Mao, Qingyang, et al.
Veröffentlicht: (2025)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
von: Zhu, Rui, et al.
Veröffentlicht: (2024)
von: Zhu, Rui, et al.
Veröffentlicht: (2024)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
von: Zheng, Guangting, et al.
Veröffentlicht: (2025)
von: Zheng, Guangting, et al.
Veröffentlicht: (2025)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
von: Wan, Siqi, et al.
Veröffentlicht: (2025)
von: Wan, Siqi, et al.
Veröffentlicht: (2025)
Improving Text-guided Object Inpainting with Semantic Pre-inpainting
von: Chen, Yifu, et al.
Veröffentlicht: (2024)
von: Chen, Yifu, et al.
Veröffentlicht: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2024)
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2024)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
von: Chen, Yang, et al.
Veröffentlicht: (2024)
von: Chen, Yang, et al.
Veröffentlicht: (2024)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
von: Luo, Jianjie, et al.
Veröffentlicht: (2024)
von: Luo, Jianjie, et al.
Veröffentlicht: (2024)
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
von: Cai, Qi, et al.
Veröffentlicht: (2025)
von: Cai, Qi, et al.
Veröffentlicht: (2025)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2025)
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2025)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
von: Li, Dong, et al.
Veröffentlicht: (2025)
von: Li, Dong, et al.
Veröffentlicht: (2025)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
von: Chen, Zhikai, et al.
Veröffentlicht: (2024)
von: Chen, Zhikai, et al.
Veröffentlicht: (2024)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
von: Cai, Qi, et al.
Veröffentlicht: (2026)
von: Cai, Qi, et al.
Veröffentlicht: (2026)
Region-Constraint In-Context Generation for Instructional Video Editing
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2025)
von: Zhang, Zhongwei, et al.
Veröffentlicht: (2025)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
von: Hu, Ying, et al.
Veröffentlicht: (2024)
von: Hu, Ying, et al.
Veröffentlicht: (2024)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
von: Luo, Yang, et al.
Veröffentlicht: (2024)
von: Luo, Yang, et al.
Veröffentlicht: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
Radio Frequency Signal based Human Silhouette Segmentation: A Sequential Diffusion Approach
von: Wen, Penghui, et al.
Veröffentlicht: (2024)
von: Wen, Penghui, et al.
Veröffentlicht: (2024)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
von: Yao, Ziyu, et al.
Veröffentlicht: (2024)
von: Yao, Ziyu, et al.
Veröffentlicht: (2024)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
von: Sun, Hao, et al.
Veröffentlicht: (2025)
von: Sun, Hao, et al.
Veröffentlicht: (2025)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
von: Li, Yuxuan, et al.
Veröffentlicht: (2024)
von: Li, Yuxuan, et al.
Veröffentlicht: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
von: Yang, Danni, et al.
Veröffentlicht: (2024)
von: Yang, Danni, et al.
Veröffentlicht: (2024)
JIGMARK: A Black-Box Approach for Enhancing Image Watermarks against Diffusion Model Edits
von: Pan, Minzhou, et al.
Veröffentlicht: (2024)
von: Pan, Minzhou, et al.
Veröffentlicht: (2024)
Copy-Move Forgery Detection and Question Answering for Remote Sensing Image
von: Zhang, Ze, et al.
Veröffentlicht: (2024)
von: Zhang, Ze, et al.
Veröffentlicht: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
D2SL: Decouple Defogging and Semantic Learning for Foggy Domain-Adaptive Segmentation
von: Sun, Xuan, et al.
Veröffentlicht: (2024)
von: Sun, Xuan, et al.
Veröffentlicht: (2024)
Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion
von: Zheng, Guoquan, et al.
Veröffentlicht: (2026)
von: Zheng, Guoquan, et al.
Veröffentlicht: (2026)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
von: Wang, Jing, et al.
Veröffentlicht: (2025)
von: Wang, Jing, et al.
Veröffentlicht: (2025)
ReactDiff: Latent Diffusion for Facial Reaction Generation
von: Li, Jiaming, et al.
Veröffentlicht: (2025)
von: Li, Jiaming, et al.
Veröffentlicht: (2025)
Language-Guided Diffusion Model for Visual Grounding
von: Chen, Sijia, et al.
Veröffentlicht: (2023)
von: Chen, Sijia, et al.
Veröffentlicht: (2023)
Scalable Diffusion Models with State Space Backbone
von: Fei, Zhengcong, et al.
Veröffentlicht: (2024)
von: Fei, Zhengcong, et al.
Veröffentlicht: (2024)
Boosting Temporal Sentence Grounding via Causal Inference
von: Tang, Kefan, et al.
Veröffentlicht: (2025)
von: Tang, Kefan, et al.
Veröffentlicht: (2025)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
von: Jiang, Haoyu, et al.
Veröffentlicht: (2024)
von: Jiang, Haoyu, et al.
Veröffentlicht: (2024)
DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
von: Li, Yinqi, et al.
Veröffentlicht: (2025)
von: Li, Yinqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Creatively Upscaling Images with Global-Regional Priors
von: Qian, Yurui, et al.
Veröffentlicht: (2025) -
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
von: Yao, Ting, et al.
Veröffentlicht: (2024) -
Improving Virtual Try-On with Garment-focused Diffusion Models
von: Wan, Siqi, et al.
Veröffentlicht: (2024) -
Visual Autoregressive Modeling for Instruction-Guided Image Editing
von: Mao, Qingyang, et al.
Veröffentlicht: (2025) -
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
von: Zhu, Rui, et al.
Veröffentlicht: (2024)