ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Duan, Zhongjie, Zhao, Qianyi, Chen, Cen, Chen, Daoyuan, Zhou, Wenmeng, Li, Yaliang, Chen, Yingda |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation
por: Li, Zhiwen, et al.
Publicado: (2025)
por: Li, Zhiwen, et al.
Publicado: (2025)
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
por: Ye, Jinyan, et al.
Publicado: (2026)
por: Ye, Jinyan, et al.
Publicado: (2026)
AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
por: Li, Zhiwen, et al.
Publicado: (2026)
por: Li, Zhiwen, et al.
Publicado: (2026)
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models
por: Chen, Die, et al.
Publicado: (2024)
por: Chen, Die, et al.
Publicado: (2024)
EliGen: Entity-Level Controlled Image Generation with Regional Attention
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
Transferability Bound Theory: Exploring Relationship between Adversarial Transferability and Flatness
por: Fan, Mingyuan, et al.
Publicado: (2023)
por: Fan, Mingyuan, et al.
Publicado: (2023)
Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion
por: Duan, Zhongjie, et al.
Publicado: (2026)
por: Duan, Zhongjie, et al.
Publicado: (2026)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
por: Jiao, Qirui, et al.
Publicado: (2025)
por: Jiao, Qirui, et al.
Publicado: (2025)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
por: Zhou, Ting, et al.
Publicado: (2024)
por: Zhou, Ting, et al.
Publicado: (2024)
MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?
por: Xu, Zhe, et al.
Publicado: (2025)
por: Xu, Zhe, et al.
Publicado: (2025)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
por: Duan, Chen, et al.
Publicado: (2024)
por: Duan, Chen, et al.
Publicado: (2024)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
por: Li, Yuyi, et al.
Publicado: (2025)
por: Li, Yuyi, et al.
Publicado: (2025)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
por: Fu, Pei, et al.
Publicado: (2025)
por: Fu, Pei, et al.
Publicado: (2025)
Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
Transferable Adversarial Examples with Bayes Approach
por: Fan, Mingyuan, et al.
Publicado: (2022)
por: Fan, Mingyuan, et al.
Publicado: (2022)
A Token-level Text Image Foundation Model for Document Understanding
por: Guan, Tongkun, et al.
Publicado: (2025)
por: Guan, Tongkun, et al.
Publicado: (2025)
Contact Matrix: Enhancing Dance Motion Synthesis with Precise Interaction Modeling
por: Chen, Xuhai, et al.
Publicado: (2026)
por: Chen, Xuhai, et al.
Publicado: (2026)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
por: Luan, Bozhi, et al.
Publicado: (2024)
por: Luan, Bozhi, et al.
Publicado: (2024)
Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
por: Wei, Tianyi, et al.
Publicado: (2024)
por: Wei, Tianyi, et al.
Publicado: (2024)
Text-Image Conditioned 3D Generation
por: Cen, Jiazhong, et al.
Publicado: (2026)
por: Cen, Jiazhong, et al.
Publicado: (2026)
PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
por: Chen, Junsong, et al.
Publicado: (2023)
por: Chen, Junsong, et al.
Publicado: (2023)
Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development
por: Chen, Daoyuan, et al.
Publicado: (2024)
por: Chen, Daoyuan, et al.
Publicado: (2024)
DreamArt: Generating Interactable Articulated Objects from a Single Image
por: Lu, Ruijie, et al.
Publicado: (2025)
por: Lu, Ruijie, et al.
Publicado: (2025)
PairAug: What Can Augmented Image-Text Pairs Do for Radiology?
por: Xie, Yutong, et al.
Publicado: (2024)
por: Xie, Yutong, et al.
Publicado: (2024)
Enhancing Spatial Understanding in Image Generation via Reward Modeling
por: Tang, Zhenyu, et al.
Publicado: (2026)
por: Tang, Zhenyu, et al.
Publicado: (2026)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Fine-grained Text to Image Synthesis
por: Ouyang, Xu, et al.
Publicado: (2024)
por: Ouyang, Xu, et al.
Publicado: (2024)
RATLIP: Generative Adversarial CLIP Text-to-Image Synthesis Based on Recurrent Affine Transformations
por: Lin, Chengde, et al.
Publicado: (2024)
por: Lin, Chengde, et al.
Publicado: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
por: Li, Xiaoming, et al.
Publicado: (2025)
por: Li, Xiaoming, et al.
Publicado: (2025)
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
por: Wang, Zining, et al.
Publicado: (2025)
por: Wang, Zining, et al.
Publicado: (2025)
DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation
por: Chen, Hong, et al.
Publicado: (2023)
por: Chen, Hong, et al.
Publicado: (2023)
Text-driven Multiplanar Visual Interaction for Semi-supervised Medical Image Segmentation
por: Huang, Kaiwen, et al.
Publicado: (2025)
por: Huang, Kaiwen, et al.
Publicado: (2025)
StyleBlend: Enhancing Style-Specific Content Creation in Text-to-Image Diffusion Models
por: Chen, Zichong, et al.
Publicado: (2025)
por: Chen, Zichong, et al.
Publicado: (2025)
Ejemplares similares
-
AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation
por: Li, Zhiwen, et al.
Publicado: (2025) -
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
por: Ye, Jinyan, et al.
Publicado: (2026) -
AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
por: Chen, Die, et al.
Publicado: (2025) -
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
por: Li, Zhiwen, et al.
Publicado: (2026) -
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
por: Duan, Zhongjie, et al.
Publicado: (2024)