MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Zhicong, Zhang, Zhao, Chen, Jingye, Zhou, Mohan, Pu, Yifan, Liu, Yuchi, Bai, Yalong, Smith, Ethan, Yuan, Yuhui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
por: Pu, Yifan, et al.
Publicado: (2025)
por: Pu, Yifan, et al.
Publicado: (2025)
StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models
por: Zhou, Mohan, et al.
Publicado: (2024)
por: Zhou, Mohan, et al.
Publicado: (2024)
MRT: Learning Compact Representations with Mixed RWKV-Transformer for Extreme Image Compression
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
Masked Generative Transformer Is What You Need for Image Editing
por: Chow, Wei, et al.
Publicado: (2026)
por: Chow, Wei, et al.
Publicado: (2026)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets
por: Chen, Changjian, et al.
Publicado: (2024)
por: Chen, Changjian, et al.
Publicado: (2024)
Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing
por: Cai, Honghao, et al.
Publicado: (2026)
por: Cai, Honghao, et al.
Publicado: (2026)
STAR: Scale-wise Text-conditioned AutoRegressive image generation
por: Ma, Xiaoxiao, et al.
Publicado: (2024)
por: Ma, Xiaoxiao, et al.
Publicado: (2024)
Uniform Attention Maps: Boosting Image Fidelity in Reconstruction and Editing
por: Mo, Wenyi, et al.
Publicado: (2024)
por: Mo, Wenyi, et al.
Publicado: (2024)
DesignEdit: Multi-Layered Latent Decomposition and Fusion for Unified & Accurate Image Editing
por: Jia, Yueru, et al.
Publicado: (2024)
por: Jia, Yueru, et al.
Publicado: (2024)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
por: Zou, Siyu, et al.
Publicado: (2024)
por: Zou, Siyu, et al.
Publicado: (2024)
MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers
por: Ma, Haoyu, et al.
Publicado: (2023)
por: Ma, Haoyu, et al.
Publicado: (2023)
Learning User Preferences for Image Generation Model
por: Mo, Wenyi, et al.
Publicado: (2025)
por: Mo, Wenyi, et al.
Publicado: (2025)
InstructGIE: Towards Generalizable Image Editing
por: Meng, Zichong, et al.
Publicado: (2024)
por: Meng, Zichong, et al.
Publicado: (2024)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
por: Chen, Wenchao, et al.
Publicado: (2024)
por: Chen, Wenchao, et al.
Publicado: (2024)
FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing
por: Wei, Tianyi, et al.
Publicado: (2025)
por: Wei, Tianyi, et al.
Publicado: (2025)
From Scale to Speed: Adaptive Test-Time Scaling for Image Editing
por: Qu, Xiangyan, et al.
Publicado: (2026)
por: Qu, Xiangyan, et al.
Publicado: (2026)
CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning
por: Wu, Yuhui, et al.
Publicado: (2026)
por: Wu, Yuhui, et al.
Publicado: (2026)
MaskAnyNet: Rethinking Masked Image Regions as Valuable Information in Supervised Learning
por: Hong, Jingshan, et al.
Publicado: (2025)
por: Hong, Jingshan, et al.
Publicado: (2025)
RegionE: Adaptive Region-Aware Generation for Efficient Image Editing
por: Chen, Pengtao, et al.
Publicado: (2025)
por: Chen, Pengtao, et al.
Publicado: (2025)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
por: Cai, Lingling, et al.
Publicado: (2024)
por: Cai, Lingling, et al.
Publicado: (2024)
Data Collection-free Masked Video Modeling
por: Ishikawa, Yuchi, et al.
Publicado: (2024)
por: Ishikawa, Yuchi, et al.
Publicado: (2024)
Does Synthetic Layered Design Data Benefit Layered Design Decomposition?
por: Wu, Kam Man, et al.
Publicado: (2026)
por: Wu, Kam Man, et al.
Publicado: (2026)
Halton Scheduler For Masked Generative Image Transformer
por: Besnier, Victor, et al.
Publicado: (2025)
por: Besnier, Victor, et al.
Publicado: (2025)
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing
por: Wang, Kejie, et al.
Publicado: (2024)
por: Wang, Kejie, et al.
Publicado: (2024)
Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
por: Bai, Xiyue, et al.
Publicado: (2025)
por: Bai, Xiyue, et al.
Publicado: (2025)
Rethinking Layered Graphic Design Generation with a Top-Down Approach
por: Chen, Jingye, et al.
Publicado: (2025)
por: Chen, Jingye, et al.
Publicado: (2025)
PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
por: Chen, Junwen, et al.
Publicado: (2025)
por: Chen, Junwen, et al.
Publicado: (2025)
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
por: Chen, Ruidong, et al.
Publicado: (2026)
por: Chen, Ruidong, et al.
Publicado: (2026)
Dragging with Geometry: From Pixels to Geometry-Guided Image Editing
por: Pu, Xinyu, et al.
Publicado: (2025)
por: Pu, Xinyu, et al.
Publicado: (2025)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
por: Zhang, Zechuan, et al.
Publicado: (2025)
por: Zhang, Zechuan, et al.
Publicado: (2025)
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
por: Ma, Chenrui, et al.
Publicado: (2025)
por: Ma, Chenrui, et al.
Publicado: (2025)
Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer
por: Shao, Shitong, et al.
Publicado: (2024)
por: Shao, Shitong, et al.
Publicado: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
FlexEdit: Marrying Free-Shape Masks to VLLM for Flexible Image Editing
por: Yuan, Tianshuo, et al.
Publicado: (2024)
por: Yuan, Tianshuo, et al.
Publicado: (2024)
Click2Mask: Local Editing with Dynamic Mask Generation
por: Regev, Omer, et al.
Publicado: (2024)
por: Regev, Omer, et al.
Publicado: (2024)
Dynamic Prompt Optimizing for Text-to-Image Generation
por: Mo, Wenyi, et al.
Publicado: (2024)
por: Mo, Wenyi, et al.
Publicado: (2024)
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
por: Wang, Zihao, et al.
Publicado: (2026)
por: Wang, Zihao, et al.
Publicado: (2026)
Ejemplares similares
-
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
por: Pu, Yifan, et al.
Publicado: (2025) -
StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models
por: Zhou, Mohan, et al.
Publicado: (2024) -
MRT: Learning Compact Representations with Mixed RWKV-Transformer for Extreme Image Compression
por: Liu, Han, et al.
Publicado: (2025) -
Masked Generative Transformer Is What You Need for Image Editing
por: Chow, Wei, et al.
Publicado: (2026) -
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)