Improving Long-Text Alignment for Text-to-Image Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Luping, Du, Chao, Pang, Tianyu, Wang, Zehan, Li, Chongxuan, Xu, Dong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
Deep Learning-based Text-in-Image Watermarking
di: Karki, Bishwa, et al.
Pubblicazione: (2024)
di: Karki, Bishwa, et al.
Pubblicazione: (2024)
Text-Guided Image Invariant Feature Learning for Robust Image Watermarking
di: Ahtesham, Muhammad, et al.
Pubblicazione: (2025)
di: Ahtesham, Muhammad, et al.
Pubblicazione: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
di: Ouyang, Pengxiang, et al.
Pubblicazione: (2025)
di: Ouyang, Pengxiang, et al.
Pubblicazione: (2025)
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024)
di: Lu, Dong, et al.
Pubblicazione: (2024)
Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies
di: Smith, Megan, et al.
Pubblicazione: (2026)
di: Smith, Megan, et al.
Pubblicazione: (2026)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
Benchmarking Large Multimodal Models against Common Corruptions
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing
di: Qi, Leyi, et al.
Pubblicazione: (2026)
di: Qi, Leyi, et al.
Pubblicazione: (2026)
STIV: Scalable Text and Image Conditioned Video Generation
di: Lin, Zongyu, et al.
Pubblicazione: (2024)
di: Lin, Zongyu, et al.
Pubblicazione: (2024)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
di: Lin, Zhiqiu, et al.
Pubblicazione: (2024)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2024)
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning
di: Chen, Weifeng, et al.
Pubblicazione: (2023)
di: Chen, Weifeng, et al.
Pubblicazione: (2023)
Long-Range Feature Propagating for Natural Image Matting
di: Liu, Qinglin, et al.
Pubblicazione: (2021)
di: Liu, Qinglin, et al.
Pubblicazione: (2021)
V-FAT: Benchmarking Visual Fidelity Against Text-bias
di: Wang, Ziteng, et al.
Pubblicazione: (2026)
di: Wang, Ziteng, et al.
Pubblicazione: (2026)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
An Efficient and Explanatory Image and Text Clustering System with Multimodal Autoencoder Architecture
di: Shi, Tiancheng, et al.
Pubblicazione: (2024)
di: Shi, Tiancheng, et al.
Pubblicazione: (2024)
OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
On Memorization in Diffusion Models
di: Gu, Xiangming, et al.
Pubblicazione: (2023)
di: Gu, Xiangming, et al.
Pubblicazione: (2023)
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
di: Zhu, Xiangru, et al.
Pubblicazione: (2024)
di: Zhu, Xiangru, et al.
Pubblicazione: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2023)
Instant3D: Instant Text-to-3D Generation
di: Li, Ming, et al.
Pubblicazione: (2023)
di: Li, Ming, et al.
Pubblicazione: (2023)
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
di: Li, Baiqi, et al.
Pubblicazione: (2024)
di: Li, Baiqi, et al.
Pubblicazione: (2024)
Improving Visual Representation Alignment Generation with GRPO
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
4D Multimodal Co-attention Fusion Network with Latent Contrastive Alignment for Alzheimer's Diagnosis
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
di: Girdhar, Rohit, et al.
Pubblicazione: (2023)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
Minecraft-ify: Minecraft Style Image Generation with Text-guided Image Editing for In-Game Application
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
Residual Prior-driven Frequency-aware Network for Image Fusion
di: Zheng, Guan, et al.
Pubblicazione: (2025)
di: Zheng, Guan, et al.
Pubblicazione: (2025)
Finetuning Text-to-Image Diffusion Models for Fairness
di: Shen, Xudong, et al.
Pubblicazione: (2023)
di: Shen, Xudong, et al.
Pubblicazione: (2023)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
GroMo: Plant Growth Modeling with Multiview Images
di: Bhatt, Ruchi, et al.
Pubblicazione: (2025)
di: Bhatt, Ruchi, et al.
Pubblicazione: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
di: Luo, Jianjie, et al.
Pubblicazione: (2024) -
Deep Learning-based Text-in-Image Watermarking
di: Karki, Bishwa, et al.
Pubblicazione: (2024) -
Text-Guided Image Invariant Feature Learning for Robust Image Watermarking
di: Ahtesham, Muhammad, et al.
Pubblicazione: (2025) -
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024) -
PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval
di: Ouyang, Pengxiang, et al.
Pubblicazione: (2025)