Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Yuanyang, Deng, Yufan, Yuan, Shenghai, Zhang, Kaipeng, Yang, Xiao, Zhao, Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Helios: Real Real-Time Long Video Generation Model
di: Yuan, Shenghai, et al.
Pubblicazione: (2026)
di: Yuan, Shenghai, et al.
Pubblicazione: (2026)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
di: Deng, Yufan, et al.
Pubblicazione: (2025)
di: Deng, Yufan, et al.
Pubblicazione: (2025)
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
di: Xu, Xiaojie, et al.
Pubblicazione: (2026)
di: Xu, Xiaojie, et al.
Pubblicazione: (2026)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
di: Deng, Yufan, et al.
Pubblicazione: (2025)
di: Deng, Yufan, et al.
Pubblicazione: (2025)
Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
di: Yuan, Liangyu, et al.
Pubblicazione: (2026)
di: Yuan, Liangyu, et al.
Pubblicazione: (2026)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
di: Xue, Naifu, et al.
Pubblicazione: (2025)
di: Xue, Naifu, et al.
Pubblicazione: (2025)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
di: Yuan, Shenghai, et al.
Pubblicazione: (2025)
di: Yuan, Shenghai, et al.
Pubblicazione: (2025)
Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation
di: Wu, Wangyu, et al.
Pubblicazione: (2023)
di: Wu, Wangyu, et al.
Pubblicazione: (2023)
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
di: Li, Zongjian, et al.
Pubblicazione: (2024)
di: Li, Zongjian, et al.
Pubblicazione: (2024)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
di: Guo, Xun, et al.
Pubblicazione: (2023)
di: Guo, Xun, et al.
Pubblicazione: (2023)
SplatSSC: Decoupled Depth-Guided Gaussian Splatting for Semantic Scene Completion
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion
di: Kang, Taewon, et al.
Pubblicazione: (2026)
di: Kang, Taewon, et al.
Pubblicazione: (2026)
SGBA: Semantic Gaussian Mixture Model-Based LiDAR Bundle Adjustment
di: Ji, Xingyu, et al.
Pubblicazione: (2024)
di: Ji, Xingyu, et al.
Pubblicazione: (2024)
3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
di: Xu, Xiaoxu, et al.
Pubblicazione: (2024)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2024)
Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection
di: Yang, Zhiwei, et al.
Pubblicazione: (2024)
di: Yang, Zhiwei, et al.
Pubblicazione: (2024)
DRM: Diffusion-based Reward Model With Step-wise Guidance
di: Zhang, Jaxon, et al.
Pubblicazione: (2026)
di: Zhang, Jaxon, et al.
Pubblicazione: (2026)
Layout Control and Semantic Guidance with Attention Loss Backward for T2I Diffusion Model
di: Li, Guandong
Pubblicazione: (2024)
di: Li, Guandong
Pubblicazione: (2024)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
di: Jang, Sangwon, et al.
Pubblicazione: (2025)
di: Jang, Sangwon, et al.
Pubblicazione: (2025)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
di: Liu, Yaofang, et al.
Pubblicazione: (2025)
di: Liu, Yaofang, et al.
Pubblicazione: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
SFPNet: Sparse Focal Point Network for Semantic Segmentation on General LiDAR Point Clouds
di: Wang, Yanbo, et al.
Pubblicazione: (2024)
di: Wang, Yanbo, et al.
Pubblicazione: (2024)
Distribution Guidance Network for Weakly Supervised Point Cloud Semantic Segmentation
di: Pan, Zhiyi, et al.
Pubblicazione: (2024)
di: Pan, Zhiyi, et al.
Pubblicazione: (2024)
TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
di: Deng, Yufan, et al.
Pubblicazione: (2026)
di: Deng, Yufan, et al.
Pubblicazione: (2026)
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality
di: Tao, Chaofan, et al.
Pubblicazione: (2024)
di: Tao, Chaofan, et al.
Pubblicazione: (2024)
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
di: Chen, Liuhan, et al.
Pubblicazione: (2024)
di: Chen, Liuhan, et al.
Pubblicazione: (2024)
Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
di: Xu, Jingyi, et al.
Pubblicazione: (2025)
di: Xu, Jingyi, et al.
Pubblicazione: (2025)
DualDiff+: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance
di: Yang, Zhao, et al.
Pubblicazione: (2025)
di: Yang, Zhao, et al.
Pubblicazione: (2025)
Enhance-A-Video: Better Generated Video for Free
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
LayerDiffusion: Layered Controlled Image Editing with Diffusion Models
di: Li, Pengzhi, et al.
Pubblicazione: (2023)
di: Li, Pengzhi, et al.
Pubblicazione: (2023)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
di: Feng, Ruoyu, et al.
Pubblicazione: (2023)
di: Feng, Ruoyu, et al.
Pubblicazione: (2023)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance
di: Sun, Shengyang, et al.
Pubblicazione: (2026)
di: Sun, Shengyang, et al.
Pubblicazione: (2026)
Manifold-Optimal Guidance: A Unified Riemannian Control View of Diffusion Guidance
di: Jia, Zexi, et al.
Pubblicazione: (2026)
di: Jia, Zexi, et al.
Pubblicazione: (2026)
Variable Aperture Bokeh Rendering via Customized Focal Plane Guidance
di: Chen, Kang, et al.
Pubblicazione: (2024)
di: Chen, Kang, et al.
Pubblicazione: (2024)
Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
di: Yang, Zizheng, et al.
Pubblicazione: (2025)
di: Yang, Zizheng, et al.
Pubblicazione: (2025)
SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models
di: Lian, Jiesong, et al.
Pubblicazione: (2026)
di: Lian, Jiesong, et al.
Pubblicazione: (2026)
GO-MLVTON: Garment Occlusion-Aware Multi-Layer Virtual Try-On with Diffusion Models
di: Yu, Yang, et al.
Pubblicazione: (2026)
di: Yu, Yang, et al.
Pubblicazione: (2026)
Semantic Guidance Tuning for Text-To-Image Diffusion Models
di: Kang, Hyun, et al.
Pubblicazione: (2023)
di: Kang, Hyun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Helios: Real Real-Time Long Video Generation Model
di: Yuan, Shenghai, et al.
Pubblicazione: (2026) -
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
di: Deng, Yufan, et al.
Pubblicazione: (2025) -
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
di: Xu, Xiaojie, et al.
Pubblicazione: (2026) -
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
di: Deng, Yufan, et al.
Pubblicazione: (2025) -
Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
di: Yuan, Liangyu, et al.
Pubblicazione: (2026)