Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Huizhuo, Chen, Zixiang, Ji, Kaixuan, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
par: Chen, Zixiang, et autres
Publié: (2024)
par: Chen, Zixiang, et autres
Publié: (2024)
Self-Play Preference Optimization for Language Model Alignment
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
par: Lewandowski, Basile, et autres
Publié: (2025)
par: Lewandowski, Basile, et autres
Publié: (2025)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
par: Zhao, Linxi, et autres
Publié: (2024)
par: Zhao, Linxi, et autres
Publié: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)
par: He, Jiafan, et autres
Publié: (2024)
VisPlay: Self-Evolving Vision-Language Models from Images
par: He, Yicheng, et autres
Publié: (2025)
par: He, Yicheng, et autres
Publié: (2025)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
par: Chen, Wenting, et autres
Publié: (2023)
par: Chen, Wenting, et autres
Publié: (2023)
CRCE: Coreference-Retention Concept Erasure in Text-to-Image Diffusion Models
par: Xue, Yuyang, et autres
Publié: (2025)
par: Xue, Yuyang, et autres
Publié: (2025)
Deep Delta Learning
par: Zhang, Yifan, et autres
Publié: (2026)
par: Zhang, Yifan, et autres
Publié: (2026)
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Efficient Pruning of Text-to-Image Models: Insights from Pruning Stable Diffusion
par: Ramesh, Samarth N, et autres
Publié: (2024)
par: Ramesh, Samarth N, et autres
Publié: (2024)
From Pampas to Pixels: Fine-Tuning Diffusion Models for Gaúcho Heritage
par: Amadeus, Marcellus, et autres
Publié: (2024)
par: Amadeus, Marcellus, et autres
Publié: (2024)
SurGen: Text-Guided Diffusion Model for Surgical Video Generation
par: Cho, Joseph, et autres
Publié: (2024)
par: Cho, Joseph, et autres
Publié: (2024)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
par: Chen, Wenting, et autres
Publié: (2024)
par: Chen, Wenting, et autres
Publié: (2024)
Discriminative Probing and Tuning for Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Interleaving Reasoning for Better Text-to-Image Generation
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Translation-Enhanced Multilingual Text-to-Image Generation
par: Li, Yaoyiran, et autres
Publié: (2023)
par: Li, Yaoyiran, et autres
Publié: (2023)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
Flexible-length Text Infilling for Discrete Diffusion Models
par: Zhang, Andrew, et autres
Publié: (2025)
par: Zhang, Andrew, et autres
Publié: (2025)
Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
par: Kim, Hyungjin, et autres
Publié: (2025)
par: Kim, Hyungjin, et autres
Publié: (2025)
Erasing with Precision: Evaluating Specific Concept Erasure from Text-to-Image Generative Models
par: Fuchi, Masane, et autres
Publié: (2025)
par: Fuchi, Masane, et autres
Publié: (2025)
Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation
par: Zhang, Yuhui, et autres
Publié: (2023)
par: Zhang, Yuhui, et autres
Publié: (2023)
Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control
par: Gupta, Gunshi, et autres
Publié: (2024)
par: Gupta, Gunshi, et autres
Publié: (2024)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
par: Cao, Anh-Quan, et autres
Publié: (2024)
par: Cao, Anh-Quan, et autres
Publié: (2024)
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
ElaLoRA: Elastic & Learnable Low-Rank Adaptation for Efficient Model Fine-Tuning
par: Chang, Huandong, et autres
Publié: (2025)
par: Chang, Huandong, et autres
Publié: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
par: Zhai, Yuexiang, et autres
Publié: (2024)
par: Zhai, Yuexiang, et autres
Publié: (2024)
MambaPEFT: Exploring Parameter-Efficient Fine-Tuning for Mamba
par: Yoshimura, Masakazu, et autres
Publié: (2024)
par: Yoshimura, Masakazu, et autres
Publié: (2024)
TIAM -- A Metric for Evaluating Alignment in Text-to-Image Generation
par: Grimal, Paul, et autres
Publié: (2023)
par: Grimal, Paul, et autres
Publié: (2023)
Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
par: Hossain, Md Zarif, et autres
Publié: (2024)
par: Hossain, Md Zarif, et autres
Publié: (2024)
DePT: Decomposed Prompt Tuning for Parameter-Efficient Fine-tuning
par: Shi, Zhengxiang, et autres
Publié: (2023)
par: Shi, Zhengxiang, et autres
Publié: (2023)
DoMIX: An Efficient Framework for Exploiting Domain Knowledge in Fine-Tuning
par: Kim, Dohoon, et autres
Publié: (2025)
par: Kim, Dohoon, et autres
Publié: (2025)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
par: Lyu, Mengyao, et autres
Publié: (2025)
par: Lyu, Mengyao, et autres
Publié: (2025)
A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation
par: Wang, Andrew Z., et autres
Publié: (2025)
par: Wang, Andrew Z., et autres
Publié: (2025)
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
par: He, Yutong, et autres
Publié: (2024)
par: He, Yutong, et autres
Publié: (2024)
Documents similaires
-
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
par: Chen, Zixiang, et autres
Publié: (2024) -
Self-Play Preference Optimization for Language Model Alignment
par: Wu, Yue, et autres
Publié: (2024) -
Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
par: Lewandowski, Basile, et autres
Publié: (2025) -
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
par: Zhao, Linxi, et autres
Publié: (2024) -
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)