Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Cao, Pu, Zhou, Feng, Yang, Lu, Huang, Tianrui, Song, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics
di: Musso, Chiara, et al.
Pubblicazione: (2026)
di: Musso, Chiara, et al.
Pubblicazione: (2026)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
di: Qin, You, et al.
Pubblicazione: (2024)
di: Qin, You, et al.
Pubblicazione: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
Failures to Surface Harmful Contents in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
di: Cai, Qi, et al.
Pubblicazione: (2025)
di: Cai, Qi, et al.
Pubblicazione: (2025)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
Boosting Diffusion Models with Moving Average Sampling in Frequency Domain
di: Qian, Yurui, et al.
Pubblicazione: (2024)
di: Qian, Yurui, et al.
Pubblicazione: (2024)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
di: Yao, Ziyu, et al.
Pubblicazione: (2024)
di: Yao, Ziyu, et al.
Pubblicazione: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
di: Cao, Pu, et al.
Pubblicazione: (2024)
di: Cao, Pu, et al.
Pubblicazione: (2024)
CIV-DG: Conditional Instrumental Variables for Domain Generalization in Medical Imaging
di: Bai, Shaojin, et al.
Pubblicazione: (2026)
di: Bai, Shaojin, et al.
Pubblicazione: (2026)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Improving Virtual Try-On with Garment-focused Diffusion Models
di: Wan, Siqi, et al.
Pubblicazione: (2024)
di: Wan, Siqi, et al.
Pubblicazione: (2024)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates
di: Lu, Lei, et al.
Pubblicazione: (2025)
di: Lu, Lei, et al.
Pubblicazione: (2025)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
Kiss3DGen: Repurposing Image Diffusion Models for 3D Asset Generation
di: Lin, Jiantao, et al.
Pubblicazione: (2025)
di: Lin, Jiantao, et al.
Pubblicazione: (2025)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
Deep Reversible Consistency Learning for Cross-modal Retrieval
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
Seeing What You Say: Expressive Image Generation from Speech
di: Lee, Jiyoung, et al.
Pubblicazione: (2025)
di: Lee, Jiyoung, et al.
Pubblicazione: (2025)
REArtGS: Reconstructing and Generating Articulated Objects via 3D Gaussian Splatting with Geometric and Motion Constraints
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
di: Masui, Kento, et al.
Pubblicazione: (2024)
di: Masui, Kento, et al.
Pubblicazione: (2024)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models
di: Kim, Jihyun, et al.
Pubblicazione: (2025)
di: Kim, Jihyun, et al.
Pubblicazione: (2025)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
di: Ding, Yiming, et al.
Pubblicazione: (2026)
di: Ding, Yiming, et al.
Pubblicazione: (2026)
Scalable Diffusion Models with State Space Backbone
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
di: Huang, Yiheng, et al.
Pubblicazione: (2024)
di: Huang, Yiheng, et al.
Pubblicazione: (2024)
InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
Palmprint De-Identification Using Diffusion Model for High-Quality and Diverse Synthesis
di: Yan, Licheng, et al.
Pubblicazione: (2025)
di: Yan, Licheng, et al.
Pubblicazione: (2025)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
di: Chen, Zhihui, et al.
Pubblicazione: (2025)
di: Chen, Zhihui, et al.
Pubblicazione: (2025)
Hand1000: Generating Realistic Hands from Text with Only 1,000 Images
di: Zhang, Haozhuo, et al.
Pubblicazione: (2024)
di: Zhang, Haozhuo, et al.
Pubblicazione: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
SFFNet: Synergistic Feature Fusion Network With Dual-Domain Edge Enhancement for UAV Image Object Detection
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics
di: Musso, Chiara, et al.
Pubblicazione: (2026) -
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
di: Qin, You, et al.
Pubblicazione: (2024) -
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024) -
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
di: Huang, Zhijian, et al.
Pubblicazione: (2024) -
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)