Non-confusing Generation of Customized Concepts in Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Wang, Chen, Jingyuan, Shi, Jiaxin, Zhu, Yichen, Liang, Chen, Miao, Junzhong, Jin, Tao, Zhao, Zhou, Wu, Fei, Yan, Shuicheng, Zhang, Hanwang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
di: Lin, Wang, et al.
Pubblicazione: (2025)
di: Lin, Wang, et al.
Pubblicazione: (2025)
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
di: Zhu, Jingyuan, et al.
Pubblicazione: (2024)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2024)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)
Real-Time Motion-Controllable Autoregressive Video Diffusion
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
Seeing World Dynamics in a Nutshell
di: Shen, Qiuhong, et al.
Pubblicazione: (2025)
di: Shen, Qiuhong, et al.
Pubblicazione: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation
di: Li, Zisu, et al.
Pubblicazione: (2025)
di: Li, Zisu, et al.
Pubblicazione: (2025)
Gamba: Marry Gaussian Splatting with Mamba for single view 3D reconstruction
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
di: Shen, Qiuhong, et al.
Pubblicazione: (2024)
FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept Composition
di: Ding, Ganggui, et al.
Pubblicazione: (2024)
di: Ding, Ganggui, et al.
Pubblicazione: (2024)
Modeling Cross-vision Synergy for Unified Large Vision Model
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
Invariant Feature Learning for Generalized Long-Tailed Classification
di: Tang, Kaihua, et al.
Pubblicazione: (2022)
di: Tang, Kaihua, et al.
Pubblicazione: (2022)
LogoSticker: Inserting Logos into Diffusion Models for Customized Generation
di: Zhu, Mingkang, et al.
Pubblicazione: (2024)
di: Zhu, Mingkang, et al.
Pubblicazione: (2024)
Unbiased Scene Graph Generation from Biased Training
di: Tang, Kaihua, et al.
Pubblicazione: (2020)
di: Tang, Kaihua, et al.
Pubblicazione: (2020)
WisdomBot: Tuning Large Language Models with Artificial Intelligence Knowledge
di: Chen, Jingyuan, et al.
Pubblicazione: (2025)
di: Chen, Jingyuan, et al.
Pubblicazione: (2025)
MVGamba: Unify 3D Content Generation as State Space Sequence Modeling
di: Yi, Xuanyu, et al.
Pubblicazione: (2024)
di: Yi, Xuanyu, et al.
Pubblicazione: (2024)
Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
di: Zhan, Wengyi, et al.
Pubblicazione: (2024)
di: Zhan, Wengyi, et al.
Pubblicazione: (2024)
CusConcept: Customized Visual Concept Decomposition with Diffusion Models
di: Xu, Zhi, et al.
Pubblicazione: (2024)
di: Xu, Zhi, et al.
Pubblicazione: (2024)
Infusion: Preventing Customized Text-to-Image Diffusion from Overfitting
di: Zeng, Weili, et al.
Pubblicazione: (2024)
di: Zeng, Weili, et al.
Pubblicazione: (2024)
Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction
di: Wu, Tao, et al.
Pubblicazione: (2025)
di: Wu, Tao, et al.
Pubblicazione: (2025)
AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding
di: Huang, Zihan, et al.
Pubblicazione: (2024)
di: Huang, Zihan, et al.
Pubblicazione: (2024)
Generalized Visual Relation Detection with Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
Dynamic Chunking for Diffusion Language Models
di: Zhu, Yichen, et al.
Pubblicazione: (2026)
di: Zhu, Yichen, et al.
Pubblicazione: (2026)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
di: Song, Xue, et al.
Pubblicazione: (2024)
di: Song, Xue, et al.
Pubblicazione: (2024)
LoRA-Composer: Leveraging Low-Rank Adaptation for Multi-Concept Customization in Training-Free Diffusion Models
di: Yang, Yang, et al.
Pubblicazione: (2024)
di: Yang, Yang, et al.
Pubblicazione: (2024)
DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation using Limited Data
di: Zhu, Jingyuan, et al.
Pubblicazione: (2023)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2023)
Knowledge is Power: Harnessing Large Language Models for Enhanced Cognitive Diagnosis
di: Dong, Zhiang, et al.
Pubblicazione: (2025)
di: Dong, Zhiang, et al.
Pubblicazione: (2025)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
MoH: Multi-Head Attention as Mixture-of-Head Attention
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
Diffusion Time-step Curriculum for One Image to 3D Generation
di: Yi, Xuanyu, et al.
Pubblicazione: (2024)
di: Yi, Xuanyu, et al.
Pubblicazione: (2024)
Generative Augmented Reality: Paradigms, Technologies, and Future Applications
di: Liang, Chen, et al.
Pubblicazione: (2025)
di: Liang, Chen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024) -
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
di: Lin, Wang, et al.
Pubblicazione: (2025) -
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
di: Zhu, Jingyuan, et al.
Pubblicazione: (2024) -
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
di: Gao, Kaifeng, et al.
Pubblicazione: (2024) -
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2024)