SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chai, Shang, Lin, Zihang, Zhou, Min, Li, Xubin, Zhuang, Liansheng, Li, Houqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation
par: Chen, Hong, et autres
Publié: (2023)
par: Chen, Hong, et autres
Publié: (2023)
Flatness Guided Test-Time Adaptation for Vision-Language Models
par: Li, Aodi, et autres
Publié: (2025)
par: Li, Aodi, et autres
Publié: (2025)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
par: Wang, Zhendong, et autres
Publié: (2025)
par: Wang, Zhendong, et autres
Publié: (2025)
AttnDreamBooth: Towards Text-Aligned Personalized Text-to-Image Generation
par: Pang, Lianyu, et autres
Publié: (2024)
par: Pang, Lianyu, et autres
Publié: (2024)
MultiBooth: Towards Generating All Your Concepts in an Image from Text
par: Zhu, Chenyang, et autres
Publié: (2024)
par: Zhu, Chenyang, et autres
Publié: (2024)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven Generation
par: Guan, Shanyan, et autres
Publié: (2024)
par: Guan, Shanyan, et autres
Publié: (2024)
GroundingBooth: Grounding Text-to-Image Customization
par: Xiong, Zhexiao, et autres
Publié: (2024)
par: Xiong, Zhexiao, et autres
Publié: (2024)
PersonaBooth: Personalized Text-to-Motion Generation
par: Kim, Boeun, et autres
Publié: (2025)
par: Kim, Boeun, et autres
Publié: (2025)
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
par: Guo, Zhiyang, et autres
Publié: (2024)
par: Guo, Zhiyang, et autres
Publié: (2024)
ID-Booth: Identity-consistent Face Generation with Diffusion Models
par: Tomašević, Darian, et autres
Publié: (2025)
par: Tomašević, Darian, et autres
Publié: (2025)
InstructBooth: Instruction-following Personalized Text-to-Image Generation
par: Chae, Daewon, et autres
Publié: (2023)
par: Chae, Daewon, et autres
Publié: (2023)
EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
par: Dong, Ruixiao, et autres
Publié: (2025)
par: Dong, Ruixiao, et autres
Publié: (2025)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval
par: Du, Yongchao, et autres
Publié: (2024)
par: Du, Yongchao, et autres
Publié: (2024)
ROOT: VLM based System for Indoor Scene Understanding and Beyond
par: Wang, Yonghui, et autres
Publié: (2024)
par: Wang, Yonghui, et autres
Publié: (2024)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
Libra-MIL: Multimodal Prototypes Stereoscopic Infused with Task-specific Language Priors for Few-shot Whole Slide Image Classification
par: Zhuang, Zhenfeng, et autres
Publié: (2025)
par: Zhuang, Zhenfeng, et autres
Publié: (2025)
TextCtrl: Diffusion-based Scene Text Editing with Prior Guidance Control
par: Zeng, Weichao, et autres
Publié: (2024)
par: Zeng, Weichao, et autres
Publié: (2024)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
par: Luan, Bozhi, et autres
Publié: (2024)
par: Luan, Bozhi, et autres
Publié: (2024)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
par: Liu, Xiaoyang, et autres
Publié: (2024)
par: Liu, Xiaoyang, et autres
Publié: (2024)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
par: Wang, Yonghui, et autres
Publié: (2024)
par: Wang, Yonghui, et autres
Publié: (2024)
Dynamic Entity-Masked Graph Diffusion Model for histopathological image Representation Learning
par: Zhuang, Zhenfeng, et autres
Publié: (2024)
par: Zhuang, Zhenfeng, et autres
Publié: (2024)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
par: Lei, Xiaohan, et autres
Publié: (2024)
par: Lei, Xiaohan, et autres
Publié: (2024)
AgeBooth: Controllable Facial Aging and Rejuvenation via Diffusion Models
par: Zhu, Shihao, et autres
Publié: (2025)
par: Zhu, Shihao, et autres
Publié: (2025)
DreamScene: 3D Gaussian-based End-to-end Text-to-3D Scene Generation
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
A New Chinese Landscape Paintings Generation Model based on Stable Diffusion using DreamBooth
par: Gu, Yujia, et autres
Publié: (2024)
par: Gu, Yujia, et autres
Publié: (2024)
OmniBooth: Learning Latent Control for Image Synthesis with Multi-modal Instruction
par: Li, Leheng, et autres
Publié: (2024)
par: Li, Leheng, et autres
Publié: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
par: Liao, Zhaokang, et autres
Publié: (2024)
par: Liao, Zhaokang, et autres
Publié: (2024)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
par: Feng, Hao, et autres
Publié: (2024)
par: Feng, Hao, et autres
Publié: (2024)
Semantic Image Synthesis via Diffusion Models
par: Zhou, Wengang, et autres
Publié: (2022)
par: Zhou, Wengang, et autres
Publié: (2022)
RHanDS: Refining Malformed Hands for Generated Images with Decoupled Structure and Style Guidance
par: Wang, Chengrui, et autres
Publié: (2024)
par: Wang, Chengrui, et autres
Publié: (2024)
Evaluating Hallucination in Text-to-Image Diffusion Models with Scene-Graph based Question-Answering Agent
par: Qin, Ziyuan, et autres
Publié: (2024)
par: Qin, Ziyuan, et autres
Publié: (2024)
StyleBooth: Image Style Editing with Multimodal Instruction
par: Han, Zhen, et autres
Publié: (2024)
par: Han, Zhen, et autres
Publié: (2024)
DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern Sampling
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Geometric Disentanglement of Text Embeddings for Subject-Consistent Text-to-Image Generation using A Single Prompt
par: Li, Shangxun, et autres
Publié: (2025)
par: Li, Shangxun, et autres
Publié: (2025)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
par: Yang, Xiaomeng, et autres
Publié: (2023)
par: Yang, Xiaomeng, et autres
Publié: (2023)
PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
par: Zhou, Zhenghong, et autres
Publié: (2026)
par: Zhou, Zhenghong, et autres
Publié: (2026)
Sat2Scene: 3D Urban Scene Generation from Satellite Images with Diffusion
par: Li, Zuoyue, et autres
Publié: (2024)
par: Li, Zuoyue, et autres
Publié: (2024)
Documents similaires
-
DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation
par: Chen, Hong, et autres
Publié: (2023) -
Flatness Guided Test-Time Adaptation for Vision-Language Models
par: Li, Aodi, et autres
Publié: (2025) -
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
par: Wang, Zhendong, et autres
Publié: (2025) -
AttnDreamBooth: Towards Text-Aligned Personalized Text-to-Image Generation
par: Pang, Lianyu, et autres
Publié: (2024) -
MultiBooth: Towards Generating All Your Concepts in an Image from Text
par: Zhu, Chenyang, et autres
Publié: (2024)