SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yufan, Zhang, Ruiyi, Gu, Jiuxiang, Zhao, Nanxuan, Shi, Jing, Sun, Tong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Customization Assistant for Text-to-image Generation
di: Zhou, Yufan, et al.
Pubblicazione: (2023)
di: Zhou, Yufan, et al.
Pubblicazione: (2023)
Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation
di: Zhou, Yufan, et al.
Pubblicazione: (2024)
di: Zhou, Yufan, et al.
Pubblicazione: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
di: Wei, Yujie, et al.
Pubblicazione: (2024)
di: Wei, Yujie, et al.
Pubblicazione: (2024)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
TRINS: Towards Multimodal Language Models that Can Read
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
MMR: Evaluating Reading Ability of Large Multimodal Models
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
Style Customization of Text-to-Vector Generation with Image Diffusion Priors
di: Zhang, Peiying, et al.
Pubblicazione: (2025)
di: Zhang, Peiying, et al.
Pubblicazione: (2025)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models
di: Ren, Yixuan, et al.
Pubblicazione: (2024)
di: Ren, Yixuan, et al.
Pubblicazione: (2024)
CustomVideoX: 3D Reference Attention Driven Dynamic Adaptation for Zero-Shot Customized Video Diffusion Transformers
di: She, D., et al.
Pubblicazione: (2025)
di: She, D., et al.
Pubblicazione: (2025)
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
di: Kim, Daneul, et al.
Pubblicazione: (2025)
di: Kim, Daneul, et al.
Pubblicazione: (2025)
More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
di: Just, Hoang Anh, et al.
Pubblicazione: (2025)
di: Just, Hoang Anh, et al.
Pubblicazione: (2025)
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
di: Zhou, Zhenghong, et al.
Pubblicazione: (2026)
di: Zhou, Zhenghong, et al.
Pubblicazione: (2026)
Text-to-Vector Generation with Neural Path Representation
di: Zhang, Peiying, et al.
Pubblicazione: (2024)
di: Zhang, Peiying, et al.
Pubblicazione: (2024)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation
di: Shin, Chaehun, et al.
Pubblicazione: (2025)
di: Shin, Chaehun, et al.
Pubblicazione: (2025)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
di: Guo, Ziyu, et al.
Pubblicazione: (2024)
di: Guo, Ziyu, et al.
Pubblicazione: (2024)
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
di: Cai, Yuanhao, et al.
Pubblicazione: (2025)
di: Cai, Yuanhao, et al.
Pubblicazione: (2025)
Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator
di: Shin, Chaehun, et al.
Pubblicazione: (2024)
di: Shin, Chaehun, et al.
Pubblicazione: (2024)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
di: Chen, Hong, et al.
Pubblicazione: (2023)
di: Chen, Hong, et al.
Pubblicazione: (2023)
Linear Image Generation by Synthesizing Exposure Brackets
di: Dai, Yuekun, et al.
Pubblicazione: (2026)
di: Dai, Yuekun, et al.
Pubblicazione: (2026)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
di: Chen, Nan, et al.
Pubblicazione: (2024)
di: Chen, Nan, et al.
Pubblicazione: (2024)
MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing
di: Lin, Zihao, et al.
Pubblicazione: (2026)
di: Lin, Zihao, et al.
Pubblicazione: (2026)
CrowdMoGen: Zero-Shot Text-Driven Collective Motion Generation
di: Cao, Yukang, et al.
Pubblicazione: (2024)
di: Cao, Yukang, et al.
Pubblicazione: (2024)
SubZero: Composing Subject, Style, and Action via Zero-Shot Personalization
di: Borse, Shubhankar, et al.
Pubblicazione: (2025)
di: Borse, Shubhankar, et al.
Pubblicazione: (2025)
SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation
di: Xu, Xuancheng, et al.
Pubblicazione: (2025)
di: Xu, Xuancheng, et al.
Pubblicazione: (2025)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2025)
VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing
di: Couairon, Paul, et al.
Pubblicazione: (2023)
di: Couairon, Paul, et al.
Pubblicazione: (2023)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
di: Wei, Yujie, et al.
Pubblicazione: (2026)
di: Wei, Yujie, et al.
Pubblicazione: (2026)
DreamInsert: Zero-Shot Image-to-Video Object Insertion from A Single Image
di: Zhao, Qi, et al.
Pubblicazione: (2025)
di: Zhao, Qi, et al.
Pubblicazione: (2025)
OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner
di: Jiang, Haoyang, et al.
Pubblicazione: (2026)
di: Jiang, Haoyang, et al.
Pubblicazione: (2026)
SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
di: Ye, Qilang, et al.
Pubblicazione: (2025)
di: Ye, Qilang, et al.
Pubblicazione: (2025)
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
di: Wang, Tong, et al.
Pubblicazione: (2026)
di: Wang, Tong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Customization Assistant for Text-to-image Generation
di: Zhou, Yufan, et al.
Pubblicazione: (2023) -
Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation
di: Zhou, Yufan, et al.
Pubblicazione: (2024) -
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024) -
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
di: Wei, Yujie, et al.
Pubblicazione: (2024) -
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)