RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xinchen, Yang, Ling, Cai, Yaqi, Yu, Zhaochen, Wang, Kai-Ni, Xie, Jiake, Tian, Ye, Xu, Minkai, Tang, Yong, Yang, Yujiu, Cui, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image Generation
di: Zhang, Xinchen, et al.
Pubblicazione: (2024)
di: Zhang, Xinchen, et al.
Pubblicazione: (2024)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
E-Compós
Pubblicazione: (2018)
Pubblicazione: (2018)
LiFi: Lightweight Controlled Text Generation with Fine-Grained Control Codes
di: Shi, Chufan, et al.
Pubblicazione: (2024)
di: Shi, Chufan, et al.
Pubblicazione: (2024)
HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
di: Kim, Jiwan, et al.
Pubblicazione: (2025)
di: Kim, Jiwan, et al.
Pubblicazione: (2025)
CompoDiff: Versatile Composed Image Retrieval With Latent Diffusion
di: Gu, Geonmo, et al.
Pubblicazione: (2023)
di: Gu, Geonmo, et al.
Pubblicazione: (2023)
MMaDA: Multimodal Large Diffusion Language Models
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout
di: Bai, Haotian, et al.
Pubblicazione: (2023)
di: Bai, Haotian, et al.
Pubblicazione: (2023)
Improving Diffusion-Based Image Synthesis with Context Prediction
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
VQGraph: Rethinking Graph Representation Space for Bridging GNNs and MLPs
di: Yang, Ling, et al.
Pubblicazione: (2023)
di: Yang, Ling, et al.
Pubblicazione: (2023)
Generative Universal Verifier as Multimodal Meta-Reasoner
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
Boundary-Constrained Diffusion Models for Floorplan Generation: Balancing Realism and Diversity
di: Stoppani, Leonardo, et al.
Pubblicazione: (2026)
di: Stoppani, Leonardo, et al.
Pubblicazione: (2026)
Trans4D: Realistic Geometry-Aware Transition for Compositional Text-to-4D Synthesis
di: Zeng, Bohan, et al.
Pubblicazione: (2024)
di: Zeng, Bohan, et al.
Pubblicazione: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
di: Wang, Lifu, et al.
Pubblicazione: (2025)
di: Wang, Lifu, et al.
Pubblicazione: (2025)
Text Anomaly Detection with Simplified Isolation Kernel
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
Towards Token-Level Text Anomaly Detection
di: Cao, Yang, et al.
Pubblicazione: (2026)
di: Cao, Yang, et al.
Pubblicazione: (2026)
Geometric Trajectory Diffusion Models
di: Han, Jiaqi, et al.
Pubblicazione: (2024)
di: Han, Jiaqi, et al.
Pubblicazione: (2024)
CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control
di: Slim, Habib, et al.
Pubblicazione: (2026)
di: Slim, Habib, et al.
Pubblicazione: (2026)
Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration
di: Sun, Haoze, et al.
Pubblicazione: (2024)
di: Sun, Haoze, et al.
Pubblicazione: (2024)
CompoST: A Benchmark for Analyzing the Ability of LLMs To Compositionally Interpret Questions in a QALD Setting
di: Schmidt, David Maria, et al.
Pubblicazione: (2025)
di: Schmidt, David Maria, et al.
Pubblicazione: (2025)
Efficient Distributed Exact Subgraph Matching via GNN-PE: Load Balancing, Cache Optimization, and Query Plan Ranking
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Training-free Diffusion Acceleration with Bottleneck Sampling
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition
di: Ni, Xinzhe, et al.
Pubblicazione: (2022)
di: Ni, Xinzhe, et al.
Pubblicazione: (2022)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
Realism Control One-step Diffusion for Real-World Image Super-Resolution
di: Wu, Zongliang, et al.
Pubblicazione: (2025)
di: Wu, Zongliang, et al.
Pubblicazione: (2025)
Consistency Flow Matching: Defining Straight Flows with Velocity Consistency
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Energy-Based Diffusion Language Models for Text Generation
di: Xu, Minkai, et al.
Pubblicazione: (2024)
di: Xu, Minkai, et al.
Pubblicazione: (2024)
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
di: Wang, Zhaochen, et al.
Pubblicazione: (2025)
di: Wang, Zhaochen, et al.
Pubblicazione: (2025)
MaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive Decoding
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
di: Deng, Jingyuan, et al.
Pubblicazione: (2025)
Structure-Guided Adversarial Training of Diffusion Models
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Isolation-based Spherical Ensemble Representations for Anomaly Detection
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement
di: Dang, Meihua, et al.
Pubblicazione: (2025)
di: Dang, Meihua, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image Generation
di: Zhang, Xinchen, et al.
Pubblicazione: (2024) -
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
di: Yang, Ling, et al.
Pubblicazione: (2024) -
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024) -
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
di: Tian, Ye, et al.
Pubblicazione: (2025) -
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
di: Yang, Ling, et al.
Pubblicazione: (2024)