DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lin, Xiaochuan, Chen, Xiangyong, Li, Xuan, Su, Yichen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
von: Chen, Xiangyong, et al.
Veröffentlicht: (2026)
von: Chen, Xiangyong, et al.
Veröffentlicht: (2026)
Safety of Multimodal Large Language Models on Images and Texts
von: Liu, Xin, et al.
Veröffentlicht: (2024)
von: Liu, Xin, et al.
Veröffentlicht: (2024)
Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning
von: Ruan, Penghui, et al.
Veröffentlicht: (2024)
von: Ruan, Penghui, et al.
Veröffentlicht: (2024)
HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation
von: Pang, Li, et al.
Veröffentlicht: (2026)
von: Pang, Li, et al.
Veröffentlicht: (2026)
LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
von: Li, Pengzhi, et al.
Veröffentlicht: (2025)
von: Li, Pengzhi, et al.
Veröffentlicht: (2025)
Textual Localization: Decomposing Multi-concept Images for Subject-Driven Text-to-Image Generation
von: Shentu, Junjie, et al.
Veröffentlicht: (2024)
von: Shentu, Junjie, et al.
Veröffentlicht: (2024)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
von: Luan, Bozhi, et al.
Veröffentlicht: (2024)
von: Luan, Bozhi, et al.
Veröffentlicht: (2024)
LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations
von: Li, Zejian, et al.
Veröffentlicht: (2024)
von: Li, Zejian, et al.
Veröffentlicht: (2024)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
von: Zhu, Sa, et al.
Veröffentlicht: (2026)
von: Zhu, Sa, et al.
Veröffentlicht: (2026)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
von: Liao, Jiaqi, et al.
Veröffentlicht: (2025)
Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images
von: Lu, Xiangyong, et al.
Veröffentlicht: (2024)
von: Lu, Xiangyong, et al.
Veröffentlicht: (2024)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
von: Lian, Long, et al.
Veröffentlicht: (2023)
von: Lian, Long, et al.
Veröffentlicht: (2023)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
von: Xie, Xing, et al.
Veröffentlicht: (2025)
von: Xie, Xing, et al.
Veröffentlicht: (2025)
Enhancing Reward Models for High-quality Image Generation: Beyond Text-Image Alignment
von: Ba, Ying, et al.
Veröffentlicht: (2025)
von: Ba, Ying, et al.
Veröffentlicht: (2025)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
von: Zhang, Jianyi, et al.
Veröffentlicht: (2024)
von: Zhang, Jianyi, et al.
Veröffentlicht: (2024)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model
von: Chen, Cheng, et al.
Veröffentlicht: (2024)
von: Chen, Cheng, et al.
Veröffentlicht: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
von: Meng, Chutian, et al.
Veröffentlicht: (2024)
von: Meng, Chutian, et al.
Veröffentlicht: (2024)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
von: Wang, Yeyuan, et al.
Veröffentlicht: (2024)
von: Wang, Yeyuan, et al.
Veröffentlicht: (2024)
AeroGen: Enhancing Remote Sensing Object Detection with Diffusion-Driven Data Generation
von: Tang, Datao, et al.
Veröffentlicht: (2024)
von: Tang, Datao, et al.
Veröffentlicht: (2024)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
von: Shou, Yuntao, et al.
Veröffentlicht: (2026)
von: Shou, Yuntao, et al.
Veröffentlicht: (2026)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
von: Yang, Siwei, et al.
Veröffentlicht: (2025)
von: Yang, Siwei, et al.
Veröffentlicht: (2025)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
CRS-Diff: Controllable Remote Sensing Image Generation with Diffusion Model
von: Tang, Datao, et al.
Veröffentlicht: (2024)
von: Tang, Datao, et al.
Veröffentlicht: (2024)
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
von: Wei, Tianyi, et al.
Veröffentlicht: (2024)
von: Wei, Tianyi, et al.
Veröffentlicht: (2024)
Aligning Medical Images with General Knowledge from Large Language Models
von: Fang, Xiao, et al.
Veröffentlicht: (2024)
von: Fang, Xiao, et al.
Veröffentlicht: (2024)
BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion
von: Ju, Xuan, et al.
Veröffentlicht: (2024)
von: Ju, Xuan, et al.
Veröffentlicht: (2024)
Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking
von: Xuan, Shiyu, et al.
Veröffentlicht: (2025)
von: Xuan, Shiyu, et al.
Veröffentlicht: (2025)
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
von: Shi, Hengyu, et al.
Veröffentlicht: (2025)
von: Shi, Hengyu, et al.
Veröffentlicht: (2025)
SG-Adapter: Enhancing Text-to-Image Generation with Scene Graph Guidance
von: Shen, Guibao, et al.
Veröffentlicht: (2024)
von: Shen, Guibao, et al.
Veröffentlicht: (2024)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
EvolveDirector: Approaching Advanced Text-to-Image Generation with Large Vision-Language Models
von: Zhao, Rui, et al.
Veröffentlicht: (2024)
von: Zhao, Rui, et al.
Veröffentlicht: (2024)
CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
von: Yan, Yichen, et al.
Veröffentlicht: (2025)
von: Yan, Yichen, et al.
Veröffentlicht: (2025)
Navigation Instruction Generation with BEV Perception and Large Language Models
von: Fan, Sheng, et al.
Veröffentlicht: (2024)
von: Fan, Sheng, et al.
Veröffentlicht: (2024)
Instruction-Guided Scene Text Recognition
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
von: Du, Yongkun, et al.
Veröffentlicht: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
von: Li, Xiaoming, et al.
Veröffentlicht: (2025)
von: Li, Xiaoming, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024) -
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
von: Chen, Xiangyong, et al.
Veröffentlicht: (2026) -
Safety of Multimodal Large Language Models on Images and Texts
von: Liu, Xin, et al.
Veröffentlicht: (2024) -
Enhancing Motion in Text-to-Video Generation with Decomposed Encoding and Conditioning
von: Ruan, Penghui, et al.
Veröffentlicht: (2024) -
HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation
von: Pang, Li, et al.
Veröffentlicht: (2026)