Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Chubin, Zhu, Jiashu, Feng, Xiaokun, Huang, Nisha, Zhu, Chen, Wu, Meiqi, Mao, Fangyuan, Wu, Jiahong, Chu, Xiangxiang, Li, Xiu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
par: Wu, Meiqi, et autres
Publié: (2025)
par: Wu, Meiqi, et autres
Publié: (2025)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
par: Mao, Fangyuan, et autres
Publié: (2025)
par: Mao, Fangyuan, et autres
Publié: (2025)
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
par: Chen, Chubin, et autres
Publié: (2025)
par: Chen, Chubin, et autres
Publié: (2025)
Embedding-perturbed Exploration Preference Optimization for Flow Models
par: Hu, Sujie, et autres
Publié: (2026)
par: Hu, Sujie, et autres
Publié: (2026)
Artifact-Aware Evaluation for High-Quality Video Generation
par: Zhu, Chen, et autres
Publié: (2026)
par: Zhu, Chen, et autres
Publié: (2026)
VMBench: A Benchmark for Perception-Aligned Video Motion Generation
par: Ling, Xinran, et autres
Publié: (2025)
par: Ling, Xinran, et autres
Publié: (2025)
Latent Temporal Discrepancy as Motion Prior: A Loss-Weighting Strategy for Dynamic Fidelity in T2V
par: Wu, Meiqi, et autres
Publié: (2026)
par: Wu, Meiqi, et autres
Publié: (2026)
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
par: Zhao, Chenxi, et autres
Publié: (2026)
par: Zhao, Chenxi, et autres
Publié: (2026)
Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models
par: Wu, Meiqi, et autres
Publié: (2026)
par: Wu, Meiqi, et autres
Publié: (2026)
ConceptWeaver: Weaving Disentangled Concepts with Flow
par: Chen, Jintao, et autres
Publié: (2026)
par: Chen, Jintao, et autres
Publié: (2026)
Revealing the Dark Secrets of Extremely Large Kernel ConvNets on Robustness
par: Chen, Honghao, et autres
Publié: (2024)
par: Chen, Honghao, et autres
Publié: (2024)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
par: Mao, Fangyuan, et autres
Publié: (2025)
par: Mao, Fangyuan, et autres
Publié: (2025)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
par: Huang, Nisha, et autres
Publié: (2026)
par: Huang, Nisha, et autres
Publié: (2026)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
par: Feng, X., et autres
Publié: (2026)
par: Feng, X., et autres
Publié: (2026)
MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation
par: Yang, Kaixing, et autres
Publié: (2025)
par: Yang, Kaixing, et autres
Publié: (2025)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
par: Huang, Zhe, et autres
Publié: (2025)
par: Huang, Zhe, et autres
Publié: (2025)
There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
par: Lei, Jiachen, et autres
Publié: (2025)
par: Lei, Jiachen, et autres
Publié: (2025)
Ranking-aware Reinforcement Learning for Ordinal Ranking
par: Hao, Aiming, et autres
Publié: (2026)
par: Hao, Aiming, et autres
Publié: (2026)
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
par: Zhu, Jingyuan, et autres
Publié: (2024)
par: Zhu, Jingyuan, et autres
Publié: (2024)
Training-Free Anomaly Generation via Dual-Attention Enhancement in Diffusion Model
par: Zuo, Zuo, et autres
Publié: (2025)
par: Zuo, Zuo, et autres
Publié: (2025)
DTLLM-VLT: Diverse Text Generation for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
par: Sun, Lingchen, et autres
Publié: (2026)
par: Sun, Lingchen, et autres
Publié: (2026)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025)
par: Gao, Jiayi, et autres
Publié: (2025)
PRISM: Rethinking Scattered Atmosphere Reconstruction as a Unified Understanding and Generation Model for Real-world Dehazing
par: Fang, Chengyu, et autres
Publié: (2026)
par: Fang, Chengyu, et autres
Publié: (2026)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2026)
par: Ma, Xiaoxiao, et autres
Publié: (2026)
RB-Modulation: Training-Free Personalization of Diffusion Models using Stochastic Optimal Control
par: Rout, Litu, et autres
Publié: (2024)
par: Rout, Litu, et autres
Publié: (2024)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
par: Li, Yanyu, et autres
Publié: (2025)
par: Li, Yanyu, et autres
Publié: (2025)
InstantSwap: Fast Customized Concept Swapping across Sharp Shape Differences
par: Zhu, Chenyang, et autres
Publié: (2024)
par: Zhu, Chenyang, et autres
Publié: (2024)
USP: Unified Self-Supervised Pretraining for Image Generation and Understanding
par: Chu, Xiangxiang, et autres
Publié: (2025)
par: Chu, Xiangxiang, et autres
Publié: (2025)
FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation
par: Zhang, Liuzhou, et autres
Publié: (2026)
par: Zhang, Liuzhou, et autres
Publié: (2026)
Coupled Diffusion Sampling for Training-Free Multi-View Image Editing
par: Alzayer, Hadi, et autres
Publié: (2025)
par: Alzayer, Hadi, et autres
Publié: (2025)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
par: Jang, Sangwon, et autres
Publié: (2025)
par: Jang, Sangwon, et autres
Publié: (2025)
No Training, No Problem: Rethinking Classifier-Free Guidance for Diffusion Models
par: Sadat, Seyedmorteza, et autres
Publié: (2024)
par: Sadat, Seyedmorteza, et autres
Publié: (2024)
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
par: Wang, Zhen, et autres
Publié: (2026)
par: Wang, Zhen, et autres
Publié: (2026)
Towards a Golden Classifier-Free Guidance Path via Foresight Fixed Point Iterations
par: Wang, Kaibo, et autres
Publié: (2025)
par: Wang, Kaibo, et autres
Publié: (2025)
Self-Guidance: Boosting Flow and Diffusion Generation on Their Own
par: Li, Tiancheng, et autres
Publié: (2024)
par: Li, Tiancheng, et autres
Publié: (2024)
Training-free Dense-Aligned Diffusion Guidance for Modular Conditional Image Synthesis
par: Wang, Zixuan, et autres
Publié: (2025)
par: Wang, Zixuan, et autres
Publié: (2025)
Documents similaires
-
ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints
par: Wu, Meiqi, et autres
Publié: (2025) -
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
par: Mao, Fangyuan, et autres
Publié: (2025) -
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
par: Chen, Chubin, et autres
Publié: (2025) -
Embedding-perturbed Exploration Preference Optimization for Flow Models
par: Hu, Sujie, et autres
Publié: (2026) -
Artifact-Aware Evaluation for High-Quality Video Generation
par: Zhu, Chen, et autres
Publié: (2026)