Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Bai, Jinbin, Ye, Tian, Chow, Wei, Song, Enxin, Li, Xiangtai, Dong, Zhen, Zhu, Lei, Yan, Shuicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Masked Generative Transformer Is What You Need for Image Editing
por: Chow, Wei, et al.
Publicado: (2026)
por: Chow, Wei, et al.
Publicado: (2026)
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
Integrating View Conditions for Image Synthesis
por: Bai, Jinbin, et al.
Publicado: (2023)
por: Bai, Jinbin, et al.
Publicado: (2023)
Bag of Design Choices for Inference of High-Resolution Masked Generative Transformer
por: Shao, Shitong, et al.
Publicado: (2024)
por: Shao, Shitong, et al.
Publicado: (2024)
UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios
por: Ye, Tian, et al.
Publicado: (2025)
por: Ye, Tian, et al.
Publicado: (2025)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
por: Gao, Shanghua, et al.
Publicado: (2023)
por: Gao, Shanghua, et al.
Publicado: (2023)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
por: Xie, Enze, et al.
Publicado: (2024)
por: Xie, Enze, et al.
Publicado: (2024)
From Masks to Worlds: A Hitchhiker's Guide to World Models
por: Bai, Jinbin, et al.
Publicado: (2025)
por: Bai, Jinbin, et al.
Publicado: (2025)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
por: Xu, Weili, et al.
Publicado: (2025)
por: Xu, Weili, et al.
Publicado: (2025)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
An Empirical Study of GPT-4o Image Generation Capabilities
por: Chen, Sixiang, et al.
Publicado: (2025)
por: Chen, Sixiang, et al.
Publicado: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
por: Cui, Tianyu, et al.
Publicado: (2025)
por: Cui, Tianyu, et al.
Publicado: (2025)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
por: Liu, Baolin, et al.
Publicado: (2023)
por: Liu, Baolin, et al.
Publicado: (2023)
DreamRelation: Bridging Customization and Relation Generation
por: Shi, Qingyu, et al.
Publicado: (2024)
por: Shi, Qingyu, et al.
Publicado: (2024)
Personalized Safety Alignment for Text-to-Image Diffusion Models
por: Lei, Yu, et al.
Publicado: (2025)
por: Lei, Yu, et al.
Publicado: (2025)
Native-Resolution Image Synthesis
por: Wang, Zidong, et al.
Publicado: (2025)
por: Wang, Zidong, et al.
Publicado: (2025)
PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution
por: Li, Wenxue, et al.
Publicado: (2026)
por: Li, Wenxue, et al.
Publicado: (2026)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
por: Zhou, Yikang, et al.
Publicado: (2024)
por: Zhou, Yikang, et al.
Publicado: (2024)
Seek for Incantations: Towards Accurate Text-to-Image Diffusion Synthesis through Prompt Engineering
por: Yu, Chang, et al.
Publicado: (2024)
por: Yu, Chang, et al.
Publicado: (2024)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
por: Zhao, Yu, et al.
Publicado: (2024)
por: Zhao, Yu, et al.
Publicado: (2024)
LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer
por: Fei, Song, et al.
Publicado: (2025)
por: Fei, Song, et al.
Publicado: (2025)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
Quiz Game Show With PowerPoint and Zoom: Revitalizing a Classical Tool for Modern Learners
por: Nazlee Sharmin, et al.
Publicado: (2026)
por: Nazlee Sharmin, et al.
Publicado: (2026)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
por: Kang, Wonjun, et al.
Publicado: (2025)
por: Kang, Wonjun, et al.
Publicado: (2025)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
PointDGRWKV: Generalizing RWKV-like Architecture to Unseen Domains for Point Cloud Classification
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
DGMamba: Domain Generalization via Generalized State Space Model
por: Long, Shaocong, et al.
Publicado: (2024)
por: Long, Shaocong, et al.
Publicado: (2024)
UltraPixel: Advancing Ultra-High-Resolution Image Synthesis to New Peaks
por: Ren, Jingjing, et al.
Publicado: (2024)
por: Ren, Jingjing, et al.
Publicado: (2024)
Efficient Transformer for High Resolution Image Motion Deblurring
por: Akmaral, Amanturdieva, et al.
Publicado: (2025)
por: Akmaral, Amanturdieva, et al.
Publicado: (2025)
Spikformer V2: Join the High Accuracy Club on ImageNet with an SNN Ticket
por: Zhou, Zhaokun, et al.
Publicado: (2024)
por: Zhou, Zhaokun, et al.
Publicado: (2024)
PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask Conditions
por: Bhosale, Mahesh, et al.
Publicado: (2025)
por: Bhosale, Mahesh, et al.
Publicado: (2025)
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
por: Esser, Patrick, et al.
Publicado: (2024)
por: Esser, Patrick, et al.
Publicado: (2024)
InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis
por: Han, Tao, et al.
Publicado: (2025)
por: Han, Tao, et al.
Publicado: (2025)
PointDGMamba: Domain Generalization of Point Cloud Classification via Generalized State Space Model
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
por: Wu, Shengqiong, et al.
Publicado: (2026)
por: Wu, Shengqiong, et al.
Publicado: (2026)
EfficientIML: Efficient High-Resolution Image Manipulation Localization
por: Li, Jinhan, et al.
Publicado: (2025)
por: Li, Jinhan, et al.
Publicado: (2025)
Ejemplares similares
-
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
por: Bai, Jinbin, et al.
Publicado: (2024) -
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025) -
Masked Generative Transformer Is What You Need for Image Editing
por: Chow, Wei, et al.
Publicado: (2026) -
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
por: Shi, Qingyu, et al.
Publicado: (2025) -
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
por: Wang, Chaoyang, et al.
Publicado: (2025)