PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Runze, Cheng, Bo, Ma, Yuhang, Jia, Qingxiang, Liu, Shanyuan, Ma, Ao, Wu, Xiaoyu, Wu, Liebucha, Leng, Dawei, Yin, Yuhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
di: Cheng, Bo, et al.
Pubblicazione: (2024)
di: Cheng, Bo, et al.
Pubblicazione: (2024)
Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities
di: Liu, Shanyuan, et al.
Pubblicazione: (2023)
di: Liu, Shanyuan, et al.
Pubblicazione: (2023)
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
di: Ma, Yuhang, et al.
Pubblicazione: (2025)
di: Ma, Yuhang, et al.
Pubblicazione: (2025)
CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
di: Gong, Yue, et al.
Pubblicazione: (2025)
di: Gong, Yue, et al.
Pubblicazione: (2025)
RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition
di: Wang, Binhao, et al.
Pubblicazione: (2026)
di: Wang, Binhao, et al.
Pubblicazione: (2026)
RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing
di: Gong, Yue, et al.
Pubblicazione: (2026)
di: Gong, Yue, et al.
Pubblicazione: (2026)
NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
di: Liu, Shanyuan, et al.
Pubblicazione: (2025)
di: Liu, Shanyuan, et al.
Pubblicazione: (2025)
FLUX-Makeup: High-Fidelity, Identity-Consistent, and Robust Makeup Transfer via Diffusion Transformer
di: Zhu, Jian, et al.
Pubblicazione: (2025)
di: Zhu, Jian, et al.
Pubblicazione: (2025)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
di: Zhang, Zhanjie, et al.
Pubblicazione: (2025)
di: Zhang, Zhanjie, et al.
Pubblicazione: (2025)
RefTon: Reference person shot assist virtual Try-on
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2025)
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task
di: Wang, Jing, et al.
Pubblicazione: (2024)
di: Wang, Jing, et al.
Pubblicazione: (2024)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
LMM-Det: Make Large Multimodal Models Excel in Object Detection
di: Li, Jincheng, et al.
Pubblicazione: (2025)
di: Li, Jincheng, et al.
Pubblicazione: (2025)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
di: Fan, Zezhong, et al.
Pubblicazione: (2025)
di: Fan, Zezhong, et al.
Pubblicazione: (2025)
RL-Based Coverage Path Planning for Deformable Objects on 3D Surfaces
di: Zhang, Yuhang, et al.
Pubblicazione: (2026)
di: Zhang, Yuhang, et al.
Pubblicazione: (2026)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
di: Jian, Weijian, et al.
Pubblicazione: (2025)
di: Jian, Weijian, et al.
Pubblicazione: (2025)
IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
di: Qin, Jie, et al.
Pubblicazione: (2025)
di: Qin, Jie, et al.
Pubblicazione: (2025)
EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding
di: Zou, Kai, et al.
Pubblicazione: (2026)
di: Zou, Kai, et al.
Pubblicazione: (2026)
Auto-Regressively Generating Multi-View Consistent Images
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
di: Hu, JiaKui, et al.
Pubblicazione: (2025)
uLayout: Unified Room Layout Estimation for Perspective and Panoramic Images
di: Lee, Jonathan, et al.
Pubblicazione: (2025)
di: Lee, Jonathan, et al.
Pubblicazione: (2025)
Human-like AI-based Auto-Field-in-Field Whole-Brain Radiotherapy Treatment Planning With Conversation Large Language Model Feedback
di: Jafar, Adnan, et al.
Pubblicazione: (2026)
di: Jafar, Adnan, et al.
Pubblicazione: (2026)
A Propagation Framework for Network Regression
di: Ma, Yingying, et al.
Pubblicazione: (2026)
di: Ma, Yingying, et al.
Pubblicazione: (2026)
Traffic Regulation-aware Path Planning with Regulation Databases and Vision-Language Models
di: Han, Xu, et al.
Pubblicazione: (2025)
di: Han, Xu, et al.
Pubblicazione: (2025)
Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning
di: Lovelace, Justin, et al.
Pubblicazione: (2026)
di: Lovelace, Justin, et al.
Pubblicazione: (2026)
Using Left and Right Brains Together: Towards Vision and Language Planning
di: Cen, Jun, et al.
Pubblicazione: (2024)
di: Cen, Jun, et al.
Pubblicazione: (2024)
Robust Asynchronous Planning via Auto-Formalization
di: Zhang, Jiayi, et al.
Pubblicazione: (2026)
di: Zhang, Jiayi, et al.
Pubblicazione: (2026)
Nested AutoRegressive Models
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
Probing Visual Planning in Image Editing Models
di: Zhou, Zhimu, et al.
Pubblicazione: (2026)
di: Zhou, Zhimu, et al.
Pubblicazione: (2026)
GenPlanX. Generation of Plans and Execution
di: Borrajo, Daniel, et al.
Pubblicazione: (2025)
di: Borrajo, Daniel, et al.
Pubblicazione: (2025)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
di: Cao, Zouying, et al.
Pubblicazione: (2025)
di: Cao, Zouying, et al.
Pubblicazione: (2025)
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
di: Shan, Xiaojun, et al.
Pubblicazione: (2026)
di: Shan, Xiaojun, et al.
Pubblicazione: (2026)
A Watermark for Auto-Regressive Image Generation Models
di: Wu, Yihan, et al.
Pubblicazione: (2025)
di: Wu, Yihan, et al.
Pubblicazione: (2025)
TerraGen: A Unified Multi-Task Layout Generation Framework for Remote Sensing Data Augmentation
di: Tang, Datao, et al.
Pubblicazione: (2025)
di: Tang, Datao, et al.
Pubblicazione: (2025)
ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation
di: Xu, Ruihang, et al.
Pubblicazione: (2025)
di: Xu, Ruihang, et al.
Pubblicazione: (2025)
CogniPlan: Uncertainty-Guided Path Planning with Conditional Generative Layout Prediction
di: Wang, Yizhuo, et al.
Pubblicazione: (2025)
di: Wang, Yizhuo, et al.
Pubblicazione: (2025)
Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation
di: Zhou, Junwei, et al.
Pubblicazione: (2026)
di: Zhou, Junwei, et al.
Pubblicazione: (2026)
InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
di: Liu, Jinlai, et al.
Pubblicazione: (2025)
di: Liu, Jinlai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
di: Cheng, Bo, et al.
Pubblicazione: (2024) -
Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities
di: Liu, Shanyuan, et al.
Pubblicazione: (2023) -
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
di: Ma, Yuhang, et al.
Pubblicazione: (2025) -
CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
di: Gong, Yue, et al.
Pubblicazione: (2025) -
RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition
di: Wang, Binhao, et al.
Pubblicazione: (2026)