Towards One-step Causal Video Generation via Adversarial Self-Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yongqi, Huang, Huayang, Peng, Xu, Hu, Xiaobin, Luo, Donghao, Zhang, Jiangning, Wang, Chengjie, Wu, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
di: Huang, Xijie, et al.
Pubblicazione: (2026)
di: Huang, Xijie, et al.
Pubblicazione: (2026)
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
di: Xiaobin, Hu, et al.
Pubblicazione: (2025)
di: Xiaobin, Hu, et al.
Pubblicazione: (2025)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
di: Xu, Chengming, et al.
Pubblicazione: (2024)
di: Xu, Chengming, et al.
Pubblicazione: (2024)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
di: Jiang, Boyuan, et al.
Pubblicazione: (2024)
di: Jiang, Boyuan, et al.
Pubblicazione: (2024)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation
di: Hu, Xiaobin, et al.
Pubblicazione: (2024)
di: Hu, Xiaobin, et al.
Pubblicazione: (2024)
CustAny: Customizing Anything from A Single Example
di: Kong, Lingjie, et al.
Pubblicazione: (2024)
di: Kong, Lingjie, et al.
Pubblicazione: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
di: Xu, Pengcheng, et al.
Pubblicazione: (2024)
di: Xu, Pengcheng, et al.
Pubblicazione: (2024)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
di: He, Qingdong, et al.
Pubblicazione: (2025)
di: He, Qingdong, et al.
Pubblicazione: (2025)
StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
di: Zhang, Na, et al.
Pubblicazione: (2025)
di: Zhang, Na, et al.
Pubblicazione: (2025)
SVFR: A Unified Framework for Generalized Video Face Restoration
di: Wang, Zhiyao, et al.
Pubblicazione: (2025)
di: Wang, Zhiyao, et al.
Pubblicazione: (2025)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
di: Luo, Donghao, et al.
Pubblicazione: (2025)
di: Luo, Donghao, et al.
Pubblicazione: (2025)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
ROBIN: Robust and Invisible Watermarks for Diffusion Models with Adversarial Optimization
di: Huang, Huayang, et al.
Pubblicazione: (2024)
di: Huang, Huayang, et al.
Pubblicazione: (2024)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
di: Sun, Yanxiao, et al.
Pubblicazione: (2025)
di: Sun, Yanxiao, et al.
Pubblicazione: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
di: Chen, Yinan, et al.
Pubblicazione: (2025)
di: Chen, Yinan, et al.
Pubblicazione: (2025)
Rethinking the Intermediate Features in Adversarial Attacks: Misleading Robotic Models via Adversarial Distillation
di: Zhao, Ke, et al.
Pubblicazione: (2024)
di: Zhao, Ke, et al.
Pubblicazione: (2024)
VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors Embedding
di: Liang, Yujie, et al.
Pubblicazione: (2024)
di: Liang, Yujie, et al.
Pubblicazione: (2024)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
Self-Adversarial One Step Generation via Condition Shifting
di: Liu, Deyuan, et al.
Pubblicazione: (2026)
di: Liu, Deyuan, et al.
Pubblicazione: (2026)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
DiP: Taming Diffusion Models in Pixel Space
di: Chen, Zhennan, et al.
Pubblicazione: (2025)
di: Chen, Zhennan, et al.
Pubblicazione: (2025)
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
di: Lin, Hangyu, et al.
Pubblicazione: (2026)
di: Lin, Hangyu, et al.
Pubblicazione: (2026)
WaDi: Weight Direction-aware Distillation for One-step Image Synthesis
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
Adversarial Concept Distillation for One-Step Diffusion Personalization
di: Yang, Yixiong, et al.
Pubblicazione: (2025)
di: Yang, Yixiong, et al.
Pubblicazione: (2025)
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
di: Wu, Junyi, et al.
Pubblicazione: (2026)
di: Wu, Junyi, et al.
Pubblicazione: (2026)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
TexDreamer: Towards Zero-Shot High-Fidelity 3D Human Texture Generation
di: Liu, Yufei, et al.
Pubblicazione: (2024)
di: Liu, Yufei, et al.
Pubblicazione: (2024)
OSV: One Step is Enough for High-Quality Image to Video Generation
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
One-step Diffusion with Distribution Matching Distillation
di: Yin, Tianwei, et al.
Pubblicazione: (2023)
di: Yin, Tianwei, et al.
Pubblicazione: (2023)
DF40: Toward Next-Generation Deepfake Detection
di: Yan, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yan, Zhiyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
di: Huang, Xijie, et al.
Pubblicazione: (2026) -
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
di: Xiaobin, Hu, et al.
Pubblicazione: (2025) -
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
di: Xu, Chengming, et al.
Pubblicazione: (2024) -
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
di: Zhang, Jiangning, et al.
Pubblicazione: (2025) -
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
di: Jiang, Boyuan, et al.
Pubblicazione: (2024)