FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Xueji, Ma, Liyuan, Zeng, Jianhao, Cao, Jinjin, Zhou, Mingyuan, Qi, Guo-Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
par: Ma, Liyuan, et autres
Publié: (2026)
par: Ma, Liyuan, et autres
Publié: (2026)
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
par: Fang, Xueji, et autres
Publié: (2025)
par: Fang, Xueji, et autres
Publié: (2025)
Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)
par: Qi, Tianhao, et autres
Publié: (2025)
DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation
par: Zeng, Chong, et autres
Publié: (2024)
par: Zeng, Chong, et autres
Publié: (2024)
MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation
par: Zhang, Guohui, et autres
Publié: (2025)
par: Zhang, Guohui, et autres
Publié: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
par: Cao, Jinjin, et autres
Publié: (2025)
par: Cao, Jinjin, et autres
Publié: (2025)
Self-Guidance: Boosting Flow and Diffusion Generation on Their Own
par: Li, Tiancheng, et autres
Publié: (2024)
par: Li, Tiancheng, et autres
Publié: (2024)
EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
par: Wang, Kun, et autres
Publié: (2025)
par: Wang, Kun, et autres
Publié: (2025)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
par: Zhu, Kaiwen, et autres
Publié: (2026)
par: Zhu, Kaiwen, et autres
Publié: (2026)
PixelDiT: Pixel Diffusion Transformers for Image Generation
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
par: Ma, Yiyang, et autres
Publié: (2025)
par: Ma, Yiyang, et autres
Publié: (2025)
MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation
par: Zuo, Ronglai, et autres
Publié: (2026)
par: Zuo, Ronglai, et autres
Publié: (2026)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations
par: Guo, Changlu, et autres
Publié: (2026)
par: Guo, Changlu, et autres
Publié: (2026)
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
par: Zhang, Ning, et autres
Publié: (2026)
par: Zhang, Ning, et autres
Publié: (2026)
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
par: Zhao, Tianchen, et autres
Publié: (2024)
par: Zhao, Tianchen, et autres
Publié: (2024)
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
par: Kumar, Raja, et autres
Publié: (2025)
par: Kumar, Raja, et autres
Publié: (2025)
FineDiffusion: Scaling up Diffusion Models for Fine-grained Image Generation with 10,000 Classes
par: Pan, Ziying, et autres
Publié: (2024)
par: Pan, Ziying, et autres
Publié: (2024)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
par: Yang, Yuhuan, et autres
Publié: (2026)
par: Yang, Yuhuan, et autres
Publié: (2026)
DriveDiTFit: Fine-tuning Diffusion Transformers for Autonomous Driving
par: Tu, Jiahang, et autres
Publié: (2024)
par: Tu, Jiahang, et autres
Publié: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
par: Shi, Junqi, et autres
Publié: (2026)
par: Shi, Junqi, et autres
Publié: (2026)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Textual Query-Driven Mask Transformer for Domain Generalized Segmentation
par: Pak, Byeonghyun, et autres
Publié: (2024)
par: Pak, Byeonghyun, et autres
Publié: (2024)
EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation
par: Wei, Tianyu, et autres
Publié: (2024)
par: Wei, Tianyu, et autres
Publié: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
par: Nie, Ming, et autres
Publié: (2026)
par: Nie, Ming, et autres
Publié: (2026)
EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation
par: Kodavanti, Sravanth, et autres
Publié: (2026)
par: Kodavanti, Sravanth, et autres
Publié: (2026)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024)
par: Chen, Wenchao, et autres
Publié: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
par: Gao, Shanghua, et autres
Publié: (2023)
par: Gao, Shanghua, et autres
Publié: (2023)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
par: Li, Zhimin, et autres
Publié: (2024)
par: Li, Zhimin, et autres
Publié: (2024)
ADP-DiT: Text-Guided Diffusion Transformer for Brain Image Generation in Alzheimer's Disease Progression
par: Lee, Juneyong, et autres
Publié: (2026)
par: Lee, Juneyong, et autres
Publié: (2026)
LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation
par: Yang, Lianwei, et autres
Publié: (2025)
par: Yang, Lianwei, et autres
Publié: (2025)
DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
par: Duan, Zheng-Peng, et autres
Publié: (2025)
par: Duan, Zheng-Peng, et autres
Publié: (2025)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
GeoDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis
par: Sastry, Srikumar, et autres
Publié: (2026)
par: Sastry, Srikumar, et autres
Publié: (2026)
VolDiT: Controllable Volumetric Medical Image Synthesis with Diffusion Transformers
par: Seyfarth, Marvin, et autres
Publié: (2026)
par: Seyfarth, Marvin, et autres
Publié: (2026)
Recursive Generalization Transformer for Image Super-Resolution
par: Chen, Zheng, et autres
Publié: (2023)
par: Chen, Zheng, et autres
Publié: (2023)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
par: Zhang, Zhanjie, et autres
Publié: (2025)
par: Zhang, Zhanjie, et autres
Publié: (2025)
Documents similaires
-
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
par: Ma, Liyuan, et autres
Publié: (2026) -
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
par: Fang, Xueji, et autres
Publié: (2025) -
Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer
par: Zhou, Han, et autres
Publié: (2025) -
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025) -
DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation
par: Zeng, Chong, et autres
Publié: (2024)