Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Xing, Liu, Jiawei, Lin, Ziyue, Fan, Huijie, Han, Zhi, Tang, Yandong, Qu, Liangqiong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DVG-Diffusion: Dual-View Guided Diffusion Model for CT Reconstruction from X-Rays
by: Xie, Xing, et al.
Published: (2025)
by: Xie, Xing, et al.
Published: (2025)
Residual Denoising Diffusion Models
by: Liu, Jiawei, et al.
Published: (2023)
by: Liu, Jiawei, et al.
Published: (2023)
Distribution-aware Forgetting Compensation for Exemplar-Free Lifelong Person Re-identification
by: Liu, Shiben, et al.
Published: (2025)
by: Liu, Shiben, et al.
Published: (2025)
DSKC: Domain Style Modeling with Adaptive Knowledge Consolidation for Exemplar-free Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2025)
by: Liu, Shiben, et al.
Published: (2025)
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
by: Zhen, Yihao, et al.
Published: (2025)
by: Zhen, Yihao, et al.
Published: (2025)
Diverse Representation Embedding for Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2024)
by: Liu, Shiben, et al.
Published: (2024)
Unleashing the Potential of SAM for Medical Adaptation via Hierarchical Decoding
by: Cheng, Zhiheng, et al.
Published: (2024)
by: Cheng, Zhiheng, et al.
Published: (2024)
Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation
by: Lin, Ziyue, et al.
Published: (2026)
by: Lin, Ziyue, et al.
Published: (2026)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
by: Zheng, Weiying, et al.
Published: (2025)
by: Zheng, Weiying, et al.
Published: (2025)
Domain Consistency Representation Learning for Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2024)
by: Liu, Shiben, et al.
Published: (2024)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
by: Pan, Kaihang, et al.
Published: (2025)
by: Pan, Kaihang, et al.
Published: (2025)
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
by: Shi, Hengyu, et al.
Published: (2025)
by: Shi, Hengyu, et al.
Published: (2025)
Hawk: Leveraging Spatial Context for Faster Autoregressive Text-to-Image Generation
by: Chen, Zhi-Kai, et al.
Published: (2025)
by: Chen, Zhi-Kai, et al.
Published: (2025)
Rethinking Diffusion for Text-Driven Human Motion Generation: Redundant Representations, Evaluation, and Masked Autoregression
by: Meng, Zichong, et al.
Published: (2024)
by: Meng, Zichong, et al.
Published: (2024)
See Detail Say Clear: Towards Brain CT Report Generation via Pathological Clue-driven Representation Learning
by: Zheng, Chengxin, et al.
Published: (2024)
by: Zheng, Chengxin, et al.
Published: (2024)
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
by: Li, Baoteng, et al.
Published: (2026)
by: Li, Baoteng, et al.
Published: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
by: Li, Hengzhuang, et al.
Published: (2025)
by: Li, Hengzhuang, et al.
Published: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
HCMA: Hierarchical Cross-model Alignment for Grounded Text-to-Image Generation
by: Wang, Hang, et al.
Published: (2025)
by: Wang, Hang, et al.
Published: (2025)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
by: Song, Mingyang, et al.
Published: (2025)
by: Song, Mingyang, et al.
Published: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
by: Li, Yongqi, et al.
Published: (2024)
by: Li, Yongqi, et al.
Published: (2024)
Data-efficient Large Vision Models through Sequential Autoregression
by: Guo, Jianyuan, et al.
Published: (2024)
by: Guo, Jianyuan, et al.
Published: (2024)
MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
by: Liang, Qian, et al.
Published: (2025)
by: Liang, Qian, et al.
Published: (2025)
Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation
by: Lai, Bolin, et al.
Published: (2024)
by: Lai, Bolin, et al.
Published: (2024)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
by: Mao, Jiawei, et al.
Published: (2025)
by: Mao, Jiawei, et al.
Published: (2025)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
by: Liu, Yunze, et al.
Published: (2024)
by: Liu, Yunze, et al.
Published: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
by: Yu, JiangYong, et al.
Published: (2025)
by: Yu, JiangYong, et al.
Published: (2025)
Autoregressive Styled Text Image Generation, but Make it Reliable
by: Zaccagnino, Carmine, et al.
Published: (2025)
by: Zaccagnino, Carmine, et al.
Published: (2025)
Rethinking Structure Preservation in Text-Guided Image Editing with Visual Autoregressive Models
by: Xia, Tao, et al.
Published: (2026)
by: Xia, Tao, et al.
Published: (2026)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
by: Wei, Zhixiang, et al.
Published: (2026)
by: Wei, Zhixiang, et al.
Published: (2026)
Evaluating Attribute Confusion in Fashion Text-to-Image Generation
by: Liu, Ziyue, et al.
Published: (2025)
by: Liu, Ziyue, et al.
Published: (2025)
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
by: Wang, Alex Jinpeng, et al.
Published: (2025)
by: Wang, Alex Jinpeng, et al.
Published: (2025)
Unleashing Network Potentials for Semantic Scene Completion
by: Wang, Fengyun, et al.
Published: (2024)
by: Wang, Fengyun, et al.
Published: (2024)
Streaming Autoregressive Video Generation via Diagonal Distillation
by: Liu, Jinxiu, et al.
Published: (2026)
by: Liu, Jinxiu, et al.
Published: (2026)
Zero-Shot Styled Text Image Generation, but Make It Autoregressive
by: Pippi, Vittorio, et al.
Published: (2025)
by: Pippi, Vittorio, et al.
Published: (2025)
Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences through $f$-divergence Minimization
by: Sun, Haoyuan, et al.
Published: (2024)
by: Sun, Haoyuan, et al.
Published: (2024)
Visual Representation Alignment for Multimodal Large Language Models
by: Yoon, Heeji, et al.
Published: (2025)
by: Yoon, Heeji, et al.
Published: (2025)
Unleashing the Potential of Model Bias for Generalized Category Discovery
by: An, Wenbin, et al.
Published: (2024)
by: An, Wenbin, et al.
Published: (2024)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
by: Chow, Wei, et al.
Published: (2025)
by: Chow, Wei, et al.
Published: (2025)
IE-Bench: Advancing the Measurement of Text-Driven Image Editing for Human Perception Alignment
by: Sun, Shangkun, et al.
Published: (2025)
by: Sun, Shangkun, et al.
Published: (2025)
Similar Items
-
DVG-Diffusion: Dual-View Guided Diffusion Model for CT Reconstruction from X-Rays
by: Xie, Xing, et al.
Published: (2025) -
Residual Denoising Diffusion Models
by: Liu, Jiawei, et al.
Published: (2023) -
Distribution-aware Forgetting Compensation for Exemplar-Free Lifelong Person Re-identification
by: Liu, Shiben, et al.
Published: (2025) -
DSKC: Domain Style Modeling with Adaptive Knowledge Consolidation for Exemplar-free Lifelong Person Re-Identification
by: Liu, Shiben, et al.
Published: (2025) -
ATSTrack: Enhancing Visual-Language Tracking by Aligning Temporal and Spatial Scales
by: Zhen, Yihao, et al.
Published: (2025)