An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Zhiyu, Yang, Mengping, Qin, Luozheng, Yang, Hao, Qian, Ye, Zhou, Qiang, Zhang, Cheng, Li, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
di: Li, Binglei, et al.
Pubblicazione: (2026)
di: Li, Binglei, et al.
Pubblicazione: (2026)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
di: Li, Binglei, et al.
Pubblicazione: (2026)
di: Li, Binglei, et al.
Pubblicazione: (2026)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
di: Yang, Mengping, et al.
Pubblicazione: (2026)
di: Yang, Mengping, et al.
Pubblicazione: (2026)
Attention Calibration for Disentangled Text-to-Image Personalization
di: Zhang, Yanbing, et al.
Pubblicazione: (2024)
di: Zhang, Yanbing, et al.
Pubblicazione: (2024)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
di: Van, Minh-Hao, et al.
Pubblicazione: (2024)
di: Van, Minh-Hao, et al.
Pubblicazione: (2024)
Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation
di: Wang, Junyan, et al.
Pubblicazione: (2024)
di: Wang, Junyan, et al.
Pubblicazione: (2024)
Motion Control for Enhanced Complex Action Video Generation
di: Zhou, Qiang, et al.
Pubblicazione: (2024)
di: Zhou, Qiang, et al.
Pubblicazione: (2024)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
di: Wang, Yibin, et al.
Pubblicazione: (2024)
di: Wang, Yibin, et al.
Pubblicazione: (2024)
Image Synthesis under Limited Data: A Survey and Taxonomy
di: Yang, Mengping, et al.
Pubblicazione: (2023)
di: Yang, Mengping, et al.
Pubblicazione: (2023)
DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation
di: Tan, Binhong, et al.
Pubblicazione: (2026)
di: Tan, Binhong, et al.
Pubblicazione: (2026)
TextFusion: Unveiling the Power of Textual Semantics for Controllable Image Fusion
di: Cheng, Chunyang, et al.
Pubblicazione: (2023)
di: Cheng, Chunyang, et al.
Pubblicazione: (2023)
FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
di: Zhang, Yanbing, et al.
Pubblicazione: (2025)
di: Zhang, Yanbing, et al.
Pubblicazione: (2025)
Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis
di: Chen, Muxi, et al.
Pubblicazione: (2024)
di: Chen, Muxi, et al.
Pubblicazione: (2024)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
di: Zhu, Zhiyu, et al.
Pubblicazione: (2025)
di: Zhu, Zhiyu, et al.
Pubblicazione: (2025)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
di: Chen, Hesen, et al.
Pubblicazione: (2025)
di: Chen, Hesen, et al.
Pubblicazione: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
di: Yang, Hongji, et al.
Pubblicazione: (2025)
di: Yang, Hongji, et al.
Pubblicazione: (2025)
OrienText: Surface Oriented Textual Image Generation
di: Paliwal, Shubham Singh, et al.
Pubblicazione: (2025)
di: Paliwal, Shubham Singh, et al.
Pubblicazione: (2025)
MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
di: Liu, Jiarun, et al.
Pubblicazione: (2024)
Learning Joint ID-Textual Representation for ID-Preserving Image Synthesis
di: Liu, Zichuan, et al.
Pubblicazione: (2025)
di: Liu, Zichuan, et al.
Pubblicazione: (2025)
Efficient Personalized Text-to-image Generation by Leveraging Textual Subspace
di: Du, Shian, et al.
Pubblicazione: (2024)
di: Du, Shian, et al.
Pubblicazione: (2024)
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
di: Zhao, Chenxi, et al.
Pubblicazione: (2026)
di: Zhao, Chenxi, et al.
Pubblicazione: (2026)
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
di: Cheng, Hao, et al.
Pubblicazione: (2024)
di: Cheng, Hao, et al.
Pubblicazione: (2024)
A Preliminary Study on GPT-Image Generation Model for Image Restoration
di: Yang, Hao, et al.
Pubblicazione: (2025)
di: Yang, Hao, et al.
Pubblicazione: (2025)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
Directional Textual Inversion for Personalized Text-to-Image Generation
di: Kim, Kunhee, et al.
Pubblicazione: (2025)
di: Kim, Kunhee, et al.
Pubblicazione: (2025)
TextToucher: Fine-Grained Text-to-Touch Generation
di: Tu, Jiahang, et al.
Pubblicazione: (2024)
di: Tu, Jiahang, et al.
Pubblicazione: (2024)
Aligning Medical Images with General Knowledge from Large Language Models
di: Fang, Xiao, et al.
Pubblicazione: (2024)
di: Fang, Xiao, et al.
Pubblicazione: (2024)
From Image to Video: An Empirical Study of Diffusion Representations
di: Vélez, Pedro, et al.
Pubblicazione: (2025)
di: Vélez, Pedro, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024) -
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025) -
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025) -
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2024) -
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
di: Qin, Luozheng, et al.
Pubblicazione: (2025)