FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Xueji, Ma, Liyuan, Zeng, Jianhao, Cao, Jinjin, Zhou, Mingyuan, Qi, Guo-Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
por: Ma, Liyuan, et al.
Publicado: (2026)
por: Ma, Liyuan, et al.
Publicado: (2026)
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
por: Fang, Xueji, et al.
Publicado: (2025)
por: Fang, Xueji, et al.
Publicado: (2025)
Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer
por: Zhou, Han, et al.
Publicado: (2025)
por: Zhou, Han, et al.
Publicado: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
por: Qi, Tianhao, et al.
Publicado: (2025)
por: Qi, Tianhao, et al.
Publicado: (2025)
DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation
por: Zeng, Chong, et al.
Publicado: (2024)
por: Zeng, Chong, et al.
Publicado: (2024)
MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation
por: Zhang, Guohui, et al.
Publicado: (2025)
por: Zhang, Guohui, et al.
Publicado: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
por: Cao, Jinjin, et al.
Publicado: (2025)
por: Cao, Jinjin, et al.
Publicado: (2025)
Self-Guidance: Boosting Flow and Diffusion Generation on Their Own
por: Li, Tiancheng, et al.
Publicado: (2024)
por: Li, Tiancheng, et al.
Publicado: (2024)
EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
por: Wang, Kun, et al.
Publicado: (2025)
por: Wang, Kun, et al.
Publicado: (2025)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
por: Zhu, Kaiwen, et al.
Publicado: (2026)
por: Zhu, Kaiwen, et al.
Publicado: (2026)
PixelDiT: Pixel Diffusion Transformers for Image Generation
por: Yu, Yongsheng, et al.
Publicado: (2025)
por: Yu, Yongsheng, et al.
Publicado: (2025)
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
por: Ma, Yiyang, et al.
Publicado: (2025)
por: Ma, Yiyang, et al.
Publicado: (2025)
MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation
por: Zuo, Ronglai, et al.
Publicado: (2026)
por: Zuo, Ronglai, et al.
Publicado: (2026)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations
por: Guo, Changlu, et al.
Publicado: (2026)
por: Guo, Changlu, et al.
Publicado: (2026)
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
por: Zhang, Ning, et al.
Publicado: (2026)
por: Zhang, Ning, et al.
Publicado: (2026)
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
por: Zhao, Tianchen, et al.
Publicado: (2024)
por: Zhao, Tianchen, et al.
Publicado: (2024)
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
por: Kumar, Raja, et al.
Publicado: (2025)
por: Kumar, Raja, et al.
Publicado: (2025)
FineDiffusion: Scaling up Diffusion Models for Fine-grained Image Generation with 10,000 Classes
por: Pan, Ziying, et al.
Publicado: (2024)
por: Pan, Ziying, et al.
Publicado: (2024)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
por: Yang, Yuhuan, et al.
Publicado: (2026)
por: Yang, Yuhuan, et al.
Publicado: (2026)
DriveDiTFit: Fine-tuning Diffusion Transformers for Autonomous Driving
por: Tu, Jiahang, et al.
Publicado: (2024)
por: Tu, Jiahang, et al.
Publicado: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
por: Shi, Junqi, et al.
Publicado: (2026)
por: Shi, Junqi, et al.
Publicado: (2026)
TerDiT: Ternary Diffusion Models with Transformers
por: Lu, Xudong, et al.
Publicado: (2024)
por: Lu, Xudong, et al.
Publicado: (2024)
Textual Query-Driven Mask Transformer for Domain Generalized Segmentation
por: Pak, Byeonghyun, et al.
Publicado: (2024)
por: Pak, Byeonghyun, et al.
Publicado: (2024)
EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation
por: Wei, Tianyu, et al.
Publicado: (2024)
por: Wei, Tianyu, et al.
Publicado: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
por: Ma, Zehong, et al.
Publicado: (2025)
por: Ma, Zehong, et al.
Publicado: (2025)
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
por: Nie, Ming, et al.
Publicado: (2026)
por: Nie, Ming, et al.
Publicado: (2026)
EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation
por: Kodavanti, Sravanth, et al.
Publicado: (2026)
por: Kodavanti, Sravanth, et al.
Publicado: (2026)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
por: Chen, Wenchao, et al.
Publicado: (2024)
por: Chen, Wenchao, et al.
Publicado: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
por: Gao, Shanghua, et al.
Publicado: (2023)
por: Gao, Shanghua, et al.
Publicado: (2023)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
por: Li, Zhimin, et al.
Publicado: (2024)
por: Li, Zhimin, et al.
Publicado: (2024)
ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression
por: Lee, Juneyong, et al.
Publicado: (2026)
por: Lee, Juneyong, et al.
Publicado: (2026)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
por: Yang, Lianwei, et al.
Publicado: (2025)
por: Yang, Lianwei, et al.
Publicado: (2025)
DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
por: Duan, Zheng-Peng, et al.
Publicado: (2025)
por: Duan, Zheng-Peng, et al.
Publicado: (2025)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis
por: Sastry, Srikumar, et al.
Publicado: (2026)
por: Sastry, Srikumar, et al.
Publicado: (2026)
VolDiT: Controllable Volumetric Medical Image Synthesis with Diffusion Transformers
por: Seyfarth, Marvin, et al.
Publicado: (2026)
por: Seyfarth, Marvin, et al.
Publicado: (2026)
Recursive Generalization Transformer for Image Super-Resolution
por: Chen, Zheng, et al.
Publicado: (2023)
por: Chen, Zheng, et al.
Publicado: (2023)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
por: Zhang, Zhanjie, et al.
Publicado: (2025)
por: Zhang, Zhanjie, et al.
Publicado: (2025)
Ejemplares similares
-
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
por: Ma, Liyuan, et al.
Publicado: (2026) -
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
por: Fang, Xueji, et al.
Publicado: (2025) -
Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer
por: Zhou, Han, et al.
Publicado: (2025) -
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
por: Qi, Tianhao, et al.
Publicado: (2025) -
DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation
por: Zeng, Chong, et al.
Publicado: (2024)