LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Pengzhi, Yu, Pengfei, Liu, Zide, He, Wei, Pan, Xuhao, Rao, Xudong, Wei, Tao, Chen, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
por: Wei, Zhixiang, et al.
Publicado: (2025)
por: Wei, Zhixiang, et al.
Publicado: (2025)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
por: Tang, Bingda, et al.
Publicado: (2025)
por: Tang, Bingda, et al.
Publicado: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
por: Wei, Canshi
Publicado: (2024)
por: Wei, Canshi
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
por: Pan, Hewen, et al.
Publicado: (2025)
por: Pan, Hewen, et al.
Publicado: (2025)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
por: Wei, Tianyi, et al.
Publicado: (2024)
por: Wei, Tianyi, et al.
Publicado: (2024)
StreamingClaw Technical Report
por: Chen, Jiawei, et al.
Publicado: (2026)
por: Chen, Jiawei, et al.
Publicado: (2026)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
por: Lan, Mengcheng, et al.
Publicado: (2025)
por: Lan, Mengcheng, et al.
Publicado: (2025)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
por: Zhu, Lei, et al.
Publicado: (2024)
por: Zhu, Lei, et al.
Publicado: (2024)
SegPoint: Segment Any Point Cloud via Large Language Model
por: He, Shuting, et al.
Publicado: (2024)
por: He, Shuting, et al.
Publicado: (2024)
TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models
por: Gong, Yuxin, et al.
Publicado: (2025)
por: Gong, Yuxin, et al.
Publicado: (2025)
Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
por: Yan, Siyuan, et al.
Publicado: (2024)
por: Yan, Siyuan, et al.
Publicado: (2024)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
por: Cao, Anjia, et al.
Publicado: (2024)
por: Cao, Anjia, et al.
Publicado: (2024)
Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models
por: Zhang, Yang, et al.
Publicado: (2024)
por: Zhang, Yang, et al.
Publicado: (2024)
Safety of Multimodal Large Language Models on Images and Texts
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
por: Yang, Jian, et al.
Publicado: (2025)
por: Yang, Jian, et al.
Publicado: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
por: Lu, Fan, et al.
Publicado: (2024)
por: Lu, Fan, et al.
Publicado: (2024)
EvolveDirector: Approaching Advanced Text-to-Image Generation with Large Vision-Language Models
por: Zhao, Rui, et al.
Publicado: (2024)
por: Zhao, Rui, et al.
Publicado: (2024)
Unified Scene Representation and Reconstruction for 3D Large Language Models
por: Chu, Tao, et al.
Publicado: (2024)
por: Chu, Tao, et al.
Publicado: (2024)
Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation
por: Jin, Jiongchao, et al.
Publicado: (2025)
por: Jin, Jiongchao, et al.
Publicado: (2025)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
por: An, Xiao, et al.
Publicado: (2024)
por: An, Xiao, et al.
Publicado: (2024)
Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
por: Zhao, Pengfei, et al.
Publicado: (2025)
por: Zhao, Pengfei, et al.
Publicado: (2025)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
por: Xie, Xing, et al.
Publicado: (2025)
por: Xie, Xing, et al.
Publicado: (2025)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
por: Lyu, Jiahao, et al.
Publicado: (2024)
por: Lyu, Jiahao, et al.
Publicado: (2024)
SAKED: Mitigating Hallucination in Large Vision-Language Models via Stability-Aware Knowledge Enhanced Decoding
por: Li, Zhaoxu, et al.
Publicado: (2026)
por: Li, Zhaoxu, et al.
Publicado: (2026)
Generating Daylight-driven Architectural Design via Diffusion Models
por: Li, Pengzhi, et al.
Publicado: (2024)
por: Li, Pengzhi, et al.
Publicado: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
por: Pan, Xichen, et al.
Publicado: (2023)
por: Pan, Xichen, et al.
Publicado: (2023)
Text-Driven Diffusion Model for Sign Language Production
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
por: Huang, Yu, et al.
Publicado: (2025)
por: Huang, Yu, et al.
Publicado: (2025)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
por: Tan, Chuangchuang, et al.
Publicado: (2025)
por: Tan, Chuangchuang, et al.
Publicado: (2025)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
por: Liu, Daizong, et al.
Publicado: (2024)
por: Liu, Daizong, et al.
Publicado: (2024)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
por: Tan, Zhiyu, et al.
Publicado: (2024)
por: Tan, Zhiyu, et al.
Publicado: (2024)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
por: Qu, Xiaoye, et al.
Publicado: (2024)
por: Qu, Xiaoye, et al.
Publicado: (2024)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
por: Meng, Chutian, et al.
Publicado: (2024)
por: Meng, Chutian, et al.
Publicado: (2024)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Ejemplares similares
-
MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
por: Chen, Wei, et al.
Publicado: (2025) -
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
por: Wei, Zhixiang, et al.
Publicado: (2025) -
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
por: Tang, Bingda, et al.
Publicado: (2025) -
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024) -
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
por: Wei, Canshi
Publicado: (2024)