A Practical Investigation of Spatially-Controlled Image Generation with Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Guoxuan, Hanspal, Harleen, Tudosiu, Petru-Daniel, Zhang, Shifeng, Parisot, Sarah |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
di: Dutt, Raman, et al.
Pubblicazione: (2025)
di: Dutt, Raman, et al.
Pubblicazione: (2025)
Generating Compositional Scenes via Text-to-image RGBA Instance Generation
di: Fontanella, Alessandro, et al.
Pubblicazione: (2024)
di: Fontanella, Alessandro, et al.
Pubblicazione: (2024)
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024)
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024)
SceneForge: Structured World Supervision from 3D Interventions
di: Li, Jizhizi, et al.
Pubblicazione: (2026)
di: Li, Jizhizi, et al.
Pubblicazione: (2026)
An Extended Evaluation Split for DeepSpaceYoloDataset
di: Parisot, Olivier
Pubblicazione: (2026)
di: Parisot, Olivier
Pubblicazione: (2026)
Dynamic Mixture-of-Experts for Visual Autoregressive Model
di: Vincenti, Jort, et al.
Pubblicazione: (2025)
di: Vincenti, Jort, et al.
Pubblicazione: (2025)
Improving Object Detection via Local-global Contrastive Learning
di: Triantafyllidou, Danai, et al.
Pubblicazione: (2024)
di: Triantafyllidou, Danai, et al.
Pubblicazione: (2024)
Detecting streaks in smart telescopes images with Deep Learning
di: Parisot, Olivier, et al.
Pubblicazione: (2025)
di: Parisot, Olivier, et al.
Pubblicazione: (2025)
Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation
di: Franchi, Gianni, et al.
Pubblicazione: (2024)
di: Franchi, Gianni, et al.
Pubblicazione: (2024)
HemBLIP: A Vision-Language Model for Interpretable Leukemia Cell Morphology Analysis
di: van Logtestijn, Julie, et al.
Pubblicazione: (2026)
di: van Logtestijn, Julie, et al.
Pubblicazione: (2026)
LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Robustness analysis of Deep Sky Objects detection models on HPC
di: Parisot, Olivier, et al.
Pubblicazione: (2025)
di: Parisot, Olivier, et al.
Pubblicazione: (2025)
Test-time Controllable Image Generation by Explicit Spatial Constraint Enforcement
di: Zhang, Z., et al.
Pubblicazione: (2025)
di: Zhang, Z., et al.
Pubblicazione: (2025)
RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
di: Pang, Lexi, et al.
Pubblicazione: (2025)
di: Pang, Lexi, et al.
Pubblicazione: (2025)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
di: Image Team, et al.
Pubblicazione: (2025)
di: Image Team, et al.
Pubblicazione: (2025)
Feature Augmentation for Self-supervised Contrastive Learning: A Closer Look
di: Zhang, Yong, et al.
Pubblicazione: (2024)
di: Zhang, Yong, et al.
Pubblicazione: (2024)
Learning Shape-Independent Transformation via Spherical Representations for Category-Level Object Pose Estimation
di: Ren, Huan, et al.
Pubblicazione: (2025)
di: Ren, Huan, et al.
Pubblicazione: (2025)
Spatial-Aware Latent Initialization for Controllable Image Generation
di: Sun, Wenqiang, et al.
Pubblicazione: (2024)
di: Sun, Wenqiang, et al.
Pubblicazione: (2024)
Enhancing Shape Perception and Segmentation Consistency for Industrial Image Inspection
di: Mao, Guoxuan, et al.
Pubblicazione: (2025)
di: Mao, Guoxuan, et al.
Pubblicazione: (2025)
PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring
di: Motorcu, Hakki, et al.
Pubblicazione: (2025)
di: Motorcu, Hakki, et al.
Pubblicazione: (2025)
Practical No-box Adversarial Attacks with Training-free Hybrid Image Transformation
di: Zhang, Qilong, et al.
Pubblicazione: (2022)
di: Zhang, Qilong, et al.
Pubblicazione: (2022)
SpatialLock: Precise Spatial Control in Text-to-Image Synthesis
di: Liu, Biao, et al.
Pubblicazione: (2025)
di: Liu, Biao, et al.
Pubblicazione: (2025)
FSATFusion: Frequency-Spatial Attention Transformer for Infrared and Visible Image Fusion
di: Zhang, Tianpei, et al.
Pubblicazione: (2025)
di: Zhang, Tianpei, et al.
Pubblicazione: (2025)
StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation
di: He, Yinxi, et al.
Pubblicazione: (2026)
di: He, Yinxi, et al.
Pubblicazione: (2026)
LesionTABE: Equitable AI for Skin Lesion Detection
di: Diaz, Rocio Mexia, et al.
Pubblicazione: (2026)
di: Diaz, Rocio Mexia, et al.
Pubblicazione: (2026)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
di: Shou, Yuntao, et al.
Pubblicazione: (2026)
di: Shou, Yuntao, et al.
Pubblicazione: (2026)
Seal2Real: Prompt Prior Learning on Diffusion Model for Unsupervised Document Seal Data Generation and Realisation
di: Yan, Mingfu, et al.
Pubblicazione: (2023)
di: Yan, Mingfu, et al.
Pubblicazione: (2023)
GenSpace: Benchmarking Spatially-Aware Image Generation
di: Wang, Zehan, et al.
Pubblicazione: (2025)
di: Wang, Zehan, et al.
Pubblicazione: (2025)
GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
di: Zhang, Zhengqiang, et al.
Pubblicazione: (2025)
di: Zhang, Zhengqiang, et al.
Pubblicazione: (2025)
Component Adaptive Clustering for Generalized Category Discovery
di: Yan, Mingfu, et al.
Pubblicazione: (2025)
di: Yan, Mingfu, et al.
Pubblicazione: (2025)
Step1X-Edit: A Practical Framework for General Image Editing
di: Liu, Shiyu, et al.
Pubblicazione: (2025)
di: Liu, Shiyu, et al.
Pubblicazione: (2025)
Intelligent Image Search Algorithms Fusing Visual Large Models
di: Wang, Kehan, et al.
Pubblicazione: (2025)
di: Wang, Kehan, et al.
Pubblicazione: (2025)
Taming Transformer for Emotion-Controllable Talking Face Generation
di: Zhang, Ziqi, et al.
Pubblicazione: (2025)
di: Zhang, Ziqi, et al.
Pubblicazione: (2025)
Recursive Generalization Transformer for Image Super-Resolution
di: Chen, Zheng, et al.
Pubblicazione: (2023)
di: Chen, Zheng, et al.
Pubblicazione: (2023)
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
Lightweight Vision Transformer with Window and Spatial Attention for Food Image Classification
di: Gao, Xinle, et al.
Pubblicazione: (2025)
di: Gao, Xinle, et al.
Pubblicazione: (2025)
GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
di: Liang, Guang, et al.
Pubblicazione: (2025)
di: Liang, Guang, et al.
Pubblicazione: (2025)
TIPS: Text-Image Pretraining with Spatial awareness
di: Maninis, Kevis-Kokitsi, et al.
Pubblicazione: (2024)
di: Maninis, Kevis-Kokitsi, et al.
Pubblicazione: (2024)
Evaluating the Generation of Spatial Relations in Text and Image Generative Models
di: Sim, Shang Hong, et al.
Pubblicazione: (2024)
di: Sim, Shang Hong, et al.
Pubblicazione: (2024)
SSFT: A Lightweight Spectral-Spatial Fusion Transformer for Generic Hyperspectral Classification
di: Musiat, Alexander, et al.
Pubblicazione: (2026)
di: Musiat, Alexander, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
di: Dutt, Raman, et al.
Pubblicazione: (2025) -
Generating Compositional Scenes via Text-to-image RGBA Instance Generation
di: Fontanella, Alessandro, et al.
Pubblicazione: (2024) -
MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation
di: Tudosiu, Petru-Daniel, et al.
Pubblicazione: (2024) -
SceneForge: Structured World Supervision from 3D Interventions
di: Li, Jizhizi, et al.
Pubblicazione: (2026) -
An Extended Evaluation Split for DeepSpaceYoloDataset
di: Parisot, Olivier
Pubblicazione: (2026)