Dimension-Reduction Attack! Video Generative Models are Experts on Controllable Image Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Hengyuan, Feng, Yutong, Gong, Biao, Tian, Yijing, Lu, Yunhong, Liu, Chuang, Wang, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
por: Lu, Yunhong, et al.
Publicado: (2025)
por: Lu, Yunhong, et al.
Publicado: (2025)
Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs
por: Lu, Yunhong, et al.
Publicado: (2026)
por: Lu, Yunhong, et al.
Publicado: (2026)
DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models
por: Wang, Qichao, et al.
Publicado: (2026)
por: Wang, Qichao, et al.
Publicado: (2026)
Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation
por: Zhang, Jianzhang, et al.
Publicado: (2026)
por: Zhang, Jianzhang, et al.
Publicado: (2026)
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment
por: Lu, Yunhong, et al.
Publicado: (2025)
por: Lu, Yunhong, et al.
Publicado: (2025)
Check, Locate, Rectify: A Training-Free Layout Calibration System for Text-to-Image Generation
por: Gong, Biao, et al.
Publicado: (2023)
por: Gong, Biao, et al.
Publicado: (2023)
OmniTry: Virtual Try-On Anything without Masks
por: Feng, Yutong, et al.
Publicado: (2025)
por: Feng, Yutong, et al.
Publicado: (2025)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
por: Huang, Siteng, et al.
Publicado: (2023)
por: Huang, Siteng, et al.
Publicado: (2023)
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
por: Lu, Yunhong, et al.
Publicado: (2025)
por: Lu, Yunhong, et al.
Publicado: (2025)
AtomoVideo: High Fidelity Image-to-Video Generation
por: Gong, Litong, et al.
Publicado: (2024)
por: Gong, Litong, et al.
Publicado: (2024)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
por: Feng, Yutong, et al.
Publicado: (2023)
por: Feng, Yutong, et al.
Publicado: (2023)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
por: Cao, Pu, et al.
Publicado: (2024)
por: Cao, Pu, et al.
Publicado: (2024)
Mimir: Improving Video Diffusion Models for Precise Text Understanding
por: Tan, Shuai, et al.
Publicado: (2024)
por: Tan, Shuai, et al.
Publicado: (2024)
SpatialLock: Precise Spatial Control in Text-to-Image Synthesis
por: Liu, Biao, et al.
Publicado: (2025)
por: Liu, Biao, et al.
Publicado: (2025)
Generic Knowledge Boosted Pre-training For Remote Sensing Images
por: Huang, Ziyue, et al.
Publicado: (2024)
por: Huang, Ziyue, et al.
Publicado: (2024)
Preconditioned Score-based Generative Models
por: Ma, Hengyuan, et al.
Publicado: (2023)
por: Ma, Hengyuan, et al.
Publicado: (2023)
Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
por: Zeng, Jianshu, et al.
Publicado: (2025)
por: Zeng, Jianshu, et al.
Publicado: (2025)
Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation
por: Li, Weijie, et al.
Publicado: (2024)
por: Li, Weijie, et al.
Publicado: (2024)
$\infty$-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite Dimensions
por: Le, Minh-Quan, et al.
Publicado: (2024)
por: Le, Minh-Quan, et al.
Publicado: (2024)
CtxMIM: Context-Enhanced Masked Image Modeling for Remote Sensing Image Understanding
por: Zhang, Mingming, et al.
Publicado: (2023)
por: Zhang, Mingming, et al.
Publicado: (2023)
FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics
por: Li, Yixuan, et al.
Publicado: (2025)
por: Li, Yixuan, et al.
Publicado: (2025)
SPMTrack: Spatio-Temporal Parameter-Efficient Fine-Tuning with Mixture of Experts for Scalable Visual Tracking
por: Cai, Wenrui, et al.
Publicado: (2025)
por: Cai, Wenrui, et al.
Publicado: (2025)
AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis
por: Cao, Shipeng, et al.
Publicado: (2026)
por: Cao, Shipeng, et al.
Publicado: (2026)
Decoupled Video Generation with Chain of Training-free Diffusion Model Experts
por: Li, Wenhao, et al.
Publicado: (2024)
por: Li, Wenhao, et al.
Publicado: (2024)
Attack Deterministic Conditional Image Generative Models for Diverse and Controllable Generation
por: Chu, Tianyi, et al.
Publicado: (2024)
por: Chu, Tianyi, et al.
Publicado: (2024)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
por: Zhang, Haiyu, et al.
Publicado: (2024)
por: Zhang, Haiyu, et al.
Publicado: (2024)
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
por: He, Yunhong, et al.
Publicado: (2025)
por: He, Yunhong, et al.
Publicado: (2025)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
por: Lin, Yijing, et al.
Publicado: (2025)
por: Lin, Yijing, et al.
Publicado: (2025)
AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset
por: Zhang, Haiyu, et al.
Publicado: (2025)
por: Zhang, Haiyu, et al.
Publicado: (2025)
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
por: Yang, Zhuoyi, et al.
Publicado: (2024)
por: Yang, Zhuoyi, et al.
Publicado: (2024)
TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
por: Su, Tongtong, et al.
Publicado: (2025)
por: Su, Tongtong, et al.
Publicado: (2025)
EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation
por: Wei, Tianyu, et al.
Publicado: (2024)
por: Wei, Tianyu, et al.
Publicado: (2024)
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning
por: Zhong, Hanwen, et al.
Publicado: (2025)
por: Zhong, Hanwen, et al.
Publicado: (2025)
DAFT-GAN: Dual Affine Transformation Generative Adversarial Network for Text-Guided Image Inpainting
por: Lee, Jihoon, et al.
Publicado: (2024)
por: Lee, Jihoon, et al.
Publicado: (2024)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
por: Cao, Yu, et al.
Publicado: (2024)
por: Cao, Yu, et al.
Publicado: (2024)
StyleTokenizer: Defining Image Style by a Single Instance for Controlling Diffusion Models
por: Li, Wen, et al.
Publicado: (2024)
por: Li, Wen, et al.
Publicado: (2024)
MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation
por: Shi, Shuwei, et al.
Publicado: (2024)
por: Shi, Shuwei, et al.
Publicado: (2024)
DDAE++: Enhancing Diffusion Models Towards Unified Generative and Discriminative Learning
por: Xiang, Weilai, et al.
Publicado: (2025)
por: Xiang, Weilai, et al.
Publicado: (2025)
MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation
por: Xing, Jinbo, et al.
Publicado: (2025)
por: Xing, Jinbo, et al.
Publicado: (2025)
Ejemplares similares
-
Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
por: Lu, Yunhong, et al.
Publicado: (2025) -
Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs
por: Lu, Yunhong, et al.
Publicado: (2026) -
DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models
por: Wang, Qichao, et al.
Publicado: (2026) -
Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation
por: Zhang, Jianzhang, et al.
Publicado: (2026) -
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment
por: Lu, Yunhong, et al.
Publicado: (2025)