Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Chaofeng, Wang, Annan, Wu, Haoning, Liao, Liang, Sun, Wenxiu, Yan, Qiong, Lin, Weisi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Q-Ground: Image Quality Grounding with Large Multi-modality Models
von: Chen, Chaofeng, et al.
Veröffentlicht: (2024)
von: Chen, Chaofeng, et al.
Veröffentlicht: (2024)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
Towards Open-ended Visual Quality Comparison
von: Wu, Haoning, et al.
Veröffentlicht: (2024)
von: Wu, Haoning, et al.
Veröffentlicht: (2024)
G-Refine: A General Quality Refiner for Text-to-Image Generation
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
Teaching LMMs for Image Quality Scoring and Interpreting
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
von: Wang, Lifu, et al.
Veröffentlicht: (2025)
von: Wang, Lifu, et al.
Veröffentlicht: (2025)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
von: Lu, Yiting, et al.
Veröffentlicht: (2025)
von: Lu, Yiting, et al.
Veröffentlicht: (2025)
BADiff: Bandwidth Adaptive Diffusion Model
von: Zhang, Xi, et al.
Veröffentlicht: (2025)
von: Zhang, Xi, et al.
Veröffentlicht: (2025)
Explore the Hallucination on Low-level Perception for MLLMs
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
von: Xu, Xiaogang, et al.
Veröffentlicht: (2025)
von: Xu, Xiaogang, et al.
Veröffentlicht: (2025)
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
von: Kou, Siqi, et al.
Veröffentlicht: (2026)
von: Kou, Siqi, et al.
Veröffentlicht: (2026)
VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder
von: Tang, Zhicong, et al.
Veröffentlicht: (2023)
von: Tang, Zhicong, et al.
Veröffentlicht: (2023)
Image Quality Assessment for Machines: Paradigm, Large-scale Database, and Models
von: Wang, Xiaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoqi, et al.
Veröffentlicht: (2025)
One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models
von: Li, Senmao, et al.
Veröffentlicht: (2025)
von: Li, Senmao, et al.
Veröffentlicht: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
Evolving Storytelling: Benchmarks and Methods for New Character Customization with Diffusion Models
von: Wang, Xiyu, et al.
Veröffentlicht: (2024)
von: Wang, Xiyu, et al.
Veröffentlicht: (2024)
Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation
von: Liu, Yifei, et al.
Veröffentlicht: (2026)
von: Liu, Yifei, et al.
Veröffentlicht: (2026)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
Towards A Better Metric for Text-to-Video Generation
von: Wu, Jay Zhangjie, et al.
Veröffentlicht: (2024)
von: Wu, Jay Zhangjie, et al.
Veröffentlicht: (2024)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
von: Liu, Chang, et al.
Veröffentlicht: (2023)
von: Liu, Chang, et al.
Veröffentlicht: (2023)
SUDO: Enhancing Text-to-Image Diffusion Models with Self-Supervised Direct Preference Optimization
von: Peng, Liang, et al.
Veröffentlicht: (2025)
von: Peng, Liang, et al.
Veröffentlicht: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
DiffPCN: Latent Diffusion Model Based on Multi-view Depth Images for Point Cloud Completion
von: Li, Zijun, et al.
Veröffentlicht: (2025)
von: Li, Zijun, et al.
Veröffentlicht: (2025)
MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning
von: Wu, Haoning, et al.
Veröffentlicht: (2024)
von: Wu, Haoning, et al.
Veröffentlicht: (2024)
Unified Multimodal Models as Auto-Encoders
von: Yan, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Yan, Zhiyuan, et al.
Veröffentlicht: (2025)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare
von: Zhu, Hanwei, et al.
Veröffentlicht: (2024)
von: Zhu, Hanwei, et al.
Veröffentlicht: (2024)
Faster Diffusion: Rethinking the Role of the Encoder for Diffusion Model Inference
von: Li, Senmao, et al.
Veröffentlicht: (2023)
von: Li, Senmao, et al.
Veröffentlicht: (2023)
Efficient Reinforcement Learning Through Adaptively Pretrained Visual Encoder
von: Zhang, Yuhan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuhan, et al.
Veröffentlicht: (2025)
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
von: Zou, Jialv, et al.
Veröffentlicht: (2025)
von: Zou, Jialv, et al.
Veröffentlicht: (2025)
Language-Image Alignment with Fixed Text Encoders
von: Yang, Jingfeng, et al.
Veröffentlicht: (2025)
von: Yang, Jingfeng, et al.
Veröffentlicht: (2025)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
von: Khan, Faizan Farooq, et al.
Veröffentlicht: (2025)
von: Khan, Faizan Farooq, et al.
Veröffentlicht: (2025)
StyleBlend: Enhancing Style-Specific Content Creation in Text-to-Image Diffusion Models
von: Chen, Zichong, et al.
Veröffentlicht: (2025)
von: Chen, Zichong, et al.
Veröffentlicht: (2025)
Text4Seg: Reimagining Image Segmentation as Text Generation
von: Lan, Mengcheng, et al.
Veröffentlicht: (2024)
von: Lan, Mengcheng, et al.
Veröffentlicht: (2024)
Latent Diffusion Models with Masked AutoEncoders
von: Lee, Junho, et al.
Veröffentlicht: (2025)
von: Lee, Junho, et al.
Veröffentlicht: (2025)
Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis
von: Miao, Boming, et al.
Veröffentlicht: (2024)
von: Miao, Boming, et al.
Veröffentlicht: (2024)
3DTopia: Large Text-to-3D Generation Model with Hybrid Diffusion Priors
von: Hong, Fangzhou, et al.
Veröffentlicht: (2024)
von: Hong, Fangzhou, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Q-Ground: Image Quality Grounding with Large Multi-modality Models
von: Chen, Chaofeng, et al.
Veröffentlicht: (2024) -
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
von: Wu, Haoning, et al.
Veröffentlicht: (2023) -
Towards Open-ended Visual Quality Comparison
von: Wu, Haoning, et al.
Veröffentlicht: (2024) -
G-Refine: A General Quality Refiner for Text-to-Image Generation
von: Li, Chunyi, et al.
Veröffentlicht: (2024) -
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)