Non-confusing Generation of Customized Concepts in Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Wang, Chen, Jingyuan, Shi, Jiaxin, Zhu, Yichen, Liang, Chen, Miao, Junzhong, Jin, Tao, Zhao, Zhou, Wu, Fei, Yan, Shuicheng, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
par: Lin, Wang, et autres
Publié: (2025)
par: Lin, Wang, et autres
Publié: (2025)
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
par: Zhu, Jingyuan, et autres
Publié: (2024)
par: Zhu, Jingyuan, et autres
Publié: (2024)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
par: Gao, Kaifeng, et autres
Publié: (2024)
par: Gao, Kaifeng, et autres
Publié: (2024)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
par: Gao, Kaifeng, et autres
Publié: (2024)
par: Gao, Kaifeng, et autres
Publié: (2024)
Real-Time Motion-Controllable Autoregressive Video Diffusion
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
par: Lyu, Hengye, et autres
Publié: (2026)
par: Lyu, Hengye, et autres
Publié: (2026)
CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
Seeing World Dynamics in a Nutshell
par: Shen, Qiuhong, et autres
Publié: (2025)
par: Shen, Qiuhong, et autres
Publié: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation
par: Li, Zisu, et autres
Publié: (2025)
par: Li, Zisu, et autres
Publié: (2025)
Gamba: Marry Gaussian Splatting with Mamba for single view 3D reconstruction
par: Shen, Qiuhong, et autres
Publié: (2024)
par: Shen, Qiuhong, et autres
Publié: (2024)
FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept Composition
par: Ding, Ganggui, et autres
Publié: (2024)
par: Ding, Ganggui, et autres
Publié: (2024)
Modeling Cross-vision Synergy for Unified Large Vision Model
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Invariant Feature Learning for Generalized Long-Tailed Classification
par: Tang, Kaihua, et autres
Publié: (2022)
par: Tang, Kaihua, et autres
Publié: (2022)
LogoSticker: Inserting Logos into Diffusion Models for Customized Generation
par: Zhu, Mingkang, et autres
Publié: (2024)
par: Zhu, Mingkang, et autres
Publié: (2024)
Unbiased Scene Graph Generation from Biased Training
par: Tang, Kaihua, et autres
Publié: (2020)
par: Tang, Kaihua, et autres
Publié: (2020)
WisdomBot: Tuning Large Language Models with Artificial Intelligence Knowledge
par: Chen, Jingyuan, et autres
Publié: (2025)
par: Chen, Jingyuan, et autres
Publié: (2025)
MVGamba: Unify 3D Content Generation as State Space Sequence Modeling
par: Yi, Xuanyu, et autres
Publié: (2024)
par: Yi, Xuanyu, et autres
Publié: (2024)
Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
par: Zhan, Wengyi, et autres
Publié: (2024)
par: Zhan, Wengyi, et autres
Publié: (2024)
CusConcept: Customized Visual Concept Decomposition with Diffusion Models
par: Xu, Zhi, et autres
Publié: (2024)
par: Xu, Zhi, et autres
Publié: (2024)
Infusion: Preventing Customized Text-to-Image Diffusion from Overfitting
par: Zeng, Weili, et autres
Publié: (2024)
par: Zeng, Weili, et autres
Publié: (2024)
Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding
par: Huang, Zihan, et autres
Publié: (2024)
par: Huang, Zihan, et autres
Publié: (2024)
Generalized Visual Relation Detection with Diffusion Models
par: Gao, Kaifeng, et autres
Publié: (2025)
par: Gao, Kaifeng, et autres
Publié: (2025)
Dynamic Chunking for Diffusion Language Models
par: Zhu, Yichen, et autres
Publié: (2026)
par: Zhu, Yichen, et autres
Publié: (2026)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
par: Song, Xue, et autres
Publié: (2024)
par: Song, Xue, et autres
Publié: (2024)
LoRA-Composer: Leveraging Low-Rank Adaptation for Multi-Concept Customization in Training-Free Diffusion Models
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
DomainStudio: Fine-Tuning Diffusion Models for Domain-Driven Image Generation using Limited Data
par: Zhu, Jingyuan, et autres
Publié: (2023)
par: Zhu, Jingyuan, et autres
Publié: (2023)
Knowledge is Power: Harnessing Large Language Models for Enhanced Cognitive Diagnosis
par: Dong, Zhiang, et autres
Publié: (2025)
par: Dong, Zhiang, et autres
Publié: (2025)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
MoH: Multi-Head Attention as Mixture-of-Head Attention
par: Jin, Peng, et autres
Publié: (2024)
par: Jin, Peng, et autres
Publié: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
par: Gao, Shanghua, et autres
Publié: (2023)
par: Gao, Shanghua, et autres
Publié: (2023)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
par: Bai, Jinbin, et autres
Publié: (2024)
par: Bai, Jinbin, et autres
Publié: (2024)
Diffusion Time-step Curriculum for One Image to 3D Generation
par: Yi, Xuanyu, et autres
Publié: (2024)
par: Yi, Xuanyu, et autres
Publié: (2024)
Generative Augmented Reality: Paradigms, Technologies, and Future Applications
par: Liang, Chen, et autres
Publié: (2025)
par: Liang, Chen, et autres
Publié: (2025)
Documents similaires
-
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
par: Fei, Hao, et autres
Publié: (2024) -
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
par: Lin, Wang, et autres
Publié: (2025) -
Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance
par: Zhu, Jingyuan, et autres
Publié: (2024) -
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
par: Gao, Kaifeng, et autres
Publié: (2024) -
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
par: Gao, Kaifeng, et autres
Publié: (2024)