How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Brack, Manuel, Katakol, Sudeep, Friedrich, Felix, Schramowski, Patrick, Ravi, Hareesh, Kersting, Kristian, Kale, Ajinkya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
par: Li, Kevin, et autres
Publié: (2025)
par: Li, Kevin, et autres
Publié: (2025)
Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis
par: Struppek, Lukas, et autres
Publié: (2022)
par: Struppek, Lukas, et autres
Publié: (2022)
Core Tokensets for Data-efficient Sequential Training of Transformers
par: Paul, Subarnaduti, et autres
Publié: (2024)
par: Paul, Subarnaduti, et autres
Publié: (2024)
No Safe Dose: How Training Data Drives Unsafe Image Generation
par: Friedrich, Felix, et autres
Publié: (2026)
par: Friedrich, Felix, et autres
Publié: (2026)
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
par: Helff, Lukas, et autres
Publié: (2024)
par: Helff, Lukas, et autres
Publié: (2024)
LEDITS++: Limitless Image Editing using Text-to-Image Models
par: Brack, Manuel, et autres
Publié: (2023)
par: Brack, Manuel, et autres
Publié: (2023)
Does CLIP Know My Face?
par: Hintersdorf, Dominik, et autres
Publié: (2022)
par: Hintersdorf, Dominik, et autres
Publié: (2022)
Beyond Overcorrection: Evaluating Diversity in T2I Models with DivBench
par: Friedrich, Felix, et autres
Publié: (2025)
par: Friedrich, Felix, et autres
Publié: (2025)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
par: Friedrich, Felix, et autres
Publié: (2024)
par: Friedrich, Felix, et autres
Publié: (2024)
DeiSAM: Segment Anything with Deictic Prompting
par: Shindo, Hikaru, et autres
Publié: (2024)
par: Shindo, Hikaru, et autres
Publié: (2024)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
par: Härle, Ruben, et autres
Publié: (2024)
par: Härle, Ruben, et autres
Publié: (2024)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
par: Deiseroth, Björn, et autres
Publié: (2024)
par: Deiseroth, Björn, et autres
Publié: (2024)
Measuring and Guiding Monosemanticity
par: Härle, Ruben, et autres
Publié: (2025)
par: Härle, Ruben, et autres
Publié: (2025)
A Typology for Exploring the Mitigation of Shortcut Behavior
par: Friedrich, Felix, et autres
Publié: (2022)
par: Friedrich, Felix, et autres
Publié: (2022)
AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation
par: Deiseroth, Björn, et autres
Publié: (2023)
par: Deiseroth, Björn, et autres
Publié: (2023)
LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies
par: Friedrich, Felix, et autres
Publié: (2024)
par: Friedrich, Felix, et autres
Publié: (2024)
LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings
par: Sztwiertnia, Sebastian, et autres
Publié: (2025)
par: Sztwiertnia, Sebastian, et autres
Publié: (2025)
ActivationReasoning: Logical Reasoning in Latent Activation Spaces
par: Helff, Lukas, et autres
Publié: (2025)
par: Helff, Lukas, et autres
Publié: (2025)
ART: Adaptive Relation Tuning for Generalized Relation Prediction
par: Sudhakaran, Gopika, et autres
Publié: (2025)
par: Sudhakaran, Gopika, et autres
Publié: (2025)
CHRONOBERG: Capturing Language Evolution and Temporal Awareness in Foundation Models
par: Hegde, Niharika, et autres
Publié: (2025)
par: Hegde, Niharika, et autres
Publié: (2025)
Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods
par: Cho, Wonwoong, et autres
Publié: (2023)
par: Cho, Wonwoong, et autres
Publié: (2023)
Improving Text Generation on Images with Synthetic Captions
par: Koh, Jun Young, et autres
Publié: (2024)
par: Koh, Jun Young, et autres
Publié: (2024)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
par: Fonseca, Rui, et autres
Publié: (2025)
par: Fonseca, Rui, et autres
Publié: (2025)
Learning by Self-Explaining
par: Stammer, Wolfgang, et autres
Publié: (2023)
par: Stammer, Wolfgang, et autres
Publié: (2023)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
par: Qiu, Longtian, et autres
Publié: (2024)
par: Qiu, Longtian, et autres
Publié: (2024)
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
par: Tedeschi, Simone, et autres
Publié: (2024)
par: Tedeschi, Simone, et autres
Publié: (2024)
Multilingual Training-Free Remote Sensing Image Captioning
par: Rebelo, Carlos, et autres
Publié: (2025)
par: Rebelo, Carlos, et autres
Publié: (2025)
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
par: Shindo, Hikaru, et autres
Publié: (2026)
par: Shindo, Hikaru, et autres
Publié: (2026)
Adaptive Rational Activations to Boost Deep Reinforcement Learning
par: Delfosse, Quentin, et autres
Publié: (2021)
par: Delfosse, Quentin, et autres
Publié: (2021)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
NSYNC: Negative Synthetic Image Generation for Contrastive Training to Improve Stylized Text-To-Image Translation
par: Ozturk, Serkan, et autres
Publié: (2025)
par: Ozturk, Serkan, et autres
Publié: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
par: Cui, Tianyu, et autres
Publié: (2025)
par: Cui, Tianyu, et autres
Publié: (2025)
EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition
par: Schuhmann, Christoph, et autres
Publié: (2025)
par: Schuhmann, Christoph, et autres
Publié: (2025)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
par: Xu, Zitong, et autres
Publié: (2026)
par: Xu, Zitong, et autres
Publié: (2026)
Training Convolutional Neural Networks with the Forward-Forward algorithm
par: Scodellaro, Riccardo, et autres
Publié: (2023)
par: Scodellaro, Riccardo, et autres
Publié: (2023)
L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training
par: Li, Li, et autres
Publié: (2025)
par: Li, Li, et autres
Publié: (2025)
Exploiting Multiple Sequence Lengths in Fast End to End Training for Image Captioning
par: Hu, Jia Cheng, et autres
Publié: (2022)
par: Hu, Jia Cheng, et autres
Publié: (2022)
Documents similaires
-
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
par: Li, Kevin, et autres
Publié: (2025) -
Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis
par: Struppek, Lukas, et autres
Publié: (2022) -
Core Tokensets for Data-efficient Sequential Training of Transformers
par: Paul, Subarnaduti, et autres
Publié: (2024) -
No Safe Dose: How Training Data Drives Unsafe Image Generation
par: Friedrich, Felix, et autres
Publié: (2026) -
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
par: Helff, Lukas, et autres
Publié: (2024)