Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Yuanyang, Deng, Yufan, Yuan, Shenghai, Zhang, Kaipeng, Yang, Xiao, Zhao, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Helios: Real Real-Time Long Video Generation Model
par: Yuan, Shenghai, et autres
Publié: (2026)
par: Yuan, Shenghai, et autres
Publié: (2026)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
par: Xu, Xiaojie, et autres
Publié: (2026)
par: Xu, Xiaojie, et autres
Publié: (2026)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
par: Yuan, Liangyu, et autres
Publié: (2026)
par: Yuan, Liangyu, et autres
Publié: (2026)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
par: Xue, Naifu, et autres
Publié: (2025)
par: Xue, Naifu, et autres
Publié: (2025)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
par: Zhang, Hongyu, et autres
Publié: (2025)
par: Zhang, Hongyu, et autres
Publié: (2025)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation
par: Wu, Wangyu, et autres
Publié: (2023)
par: Wu, Wangyu, et autres
Publié: (2023)
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
par: Li, Zongjian, et autres
Publié: (2024)
par: Li, Zongjian, et autres
Publié: (2024)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
par: Guo, Xun, et autres
Publié: (2023)
par: Guo, Xun, et autres
Publié: (2023)
SplatSSC: Decoupled Depth-Guided Gaussian Splatting for Semantic Scene Completion
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion
par: Kang, Taewon, et autres
Publié: (2026)
par: Kang, Taewon, et autres
Publié: (2026)
SGBA: Semantic Gaussian Mixture Model-Based LiDAR Bundle Adjustment
par: Ji, Xingyu, et autres
Publié: (2024)
par: Ji, Xingyu, et autres
Publié: (2024)
3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
par: Xu, Xiaoxu, et autres
Publié: (2024)
par: Xu, Xiaoxu, et autres
Publié: (2024)
Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection
par: Yang, Zhiwei, et autres
Publié: (2024)
par: Yang, Zhiwei, et autres
Publié: (2024)
DRM: Diffusion-based Reward Model With Step-wise Guidance
par: Zhang, Jaxon, et autres
Publié: (2026)
par: Zhang, Jaxon, et autres
Publié: (2026)
Layout Control and Semantic Guidance with Attention Loss Backward for T2I Diffusion Model
par: Li, Guandong
Publié: (2024)
par: Li, Guandong
Publié: (2024)
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
par: Jang, Sangwon, et autres
Publié: (2025)
par: Jang, Sangwon, et autres
Publié: (2025)
Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation
par: Liu, Yaofang, et autres
Publié: (2025)
par: Liu, Yaofang, et autres
Publié: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
SFPNet: Sparse Focal Point Network for Semantic Segmentation on General LiDAR Point Clouds
par: Wang, Yanbo, et autres
Publié: (2024)
par: Wang, Yanbo, et autres
Publié: (2024)
Distribution Guidance Network for Weakly Supervised Point Cloud Semantic Segmentation
par: Pan, Zhiyi, et autres
Publié: (2024)
par: Pan, Zhiyi, et autres
Publié: (2024)
TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
HumanNet: Scaling Human-centric Video Learning to One Million Hours
par: Deng, Yufan, et autres
Publié: (2026)
par: Deng, Yufan, et autres
Publié: (2026)
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality
par: Tao, Chaofan, et autres
Publié: (2024)
par: Tao, Chaofan, et autres
Publié: (2024)
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
par: Chen, Liuhan, et autres
Publié: (2024)
par: Chen, Liuhan, et autres
Publié: (2024)
Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features
par: Xu, Jingyi, et autres
Publié: (2025)
par: Xu, Jingyi, et autres
Publié: (2025)
DualDiff+: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance
par: Yang, Zhao, et autres
Publié: (2025)
par: Yang, Zhao, et autres
Publié: (2025)
Enhance-A-Video: Better Generated Video for Free
par: Luo, Yang, et autres
Publié: (2025)
par: Luo, Yang, et autres
Publié: (2025)
LayerDiffusion: Layered Controlled Image Editing with Diffusion Models
par: Li, Pengzhi, et autres
Publié: (2023)
par: Li, Pengzhi, et autres
Publié: (2023)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
par: Feng, Ruoyu, et autres
Publié: (2023)
par: Feng, Ruoyu, et autres
Publié: (2023)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
par: Chen, Feng, et autres
Publié: (2024)
par: Chen, Feng, et autres
Publié: (2024)
Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance
par: Sun, Shengyang, et autres
Publié: (2026)
par: Sun, Shengyang, et autres
Publié: (2026)
Manifold-Optimal Guidance: A Unified Riemannian Control View of Diffusion Guidance
par: Jia, Zexi, et autres
Publié: (2026)
par: Jia, Zexi, et autres
Publié: (2026)
Variable Aperture Bokeh Rendering via Customized Focal Plane Guidance
par: Chen, Kang, et autres
Publié: (2024)
par: Chen, Kang, et autres
Publié: (2024)
Unleashing the Potential of the Semantic Latent Space in Diffusion Models for Image Dehazing
par: Yang, Zizheng, et autres
Publié: (2025)
par: Yang, Zizheng, et autres
Publié: (2025)
SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models
par: Lian, Jiesong, et autres
Publié: (2026)
par: Lian, Jiesong, et autres
Publié: (2026)
GO-MLVTON: Garment Occlusion-Aware Multi-Layer Virtual Try-On with Diffusion Models
par: Yu, Yang, et autres
Publié: (2026)
par: Yu, Yang, et autres
Publié: (2026)
Semantic Guidance Tuning for Text-To-Image Diffusion Models
par: Kang, Hyun, et autres
Publié: (2023)
par: Kang, Hyun, et autres
Publié: (2023)
Documents similaires
-
Helios: Real Real-Time Long Video Generation Model
par: Yuan, Shenghai, et autres
Publié: (2026) -
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025) -
WorldMark: A Unified Benchmark Suite for Interactive Video World Models
par: Xu, Xiaojie, et autres
Publié: (2026) -
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025) -
Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance
par: Yuan, Liangyu, et autres
Publié: (2026)