EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Kun, Di, Donglin, Su, Tonghua, Fan, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
par: Feng, He, et autres
Publié: (2026)
par: Feng, He, et autres
Publié: (2026)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
par: Feng, He, et autres
Publié: (2025)
par: Feng, He, et autres
Publié: (2025)
FineDiffusion: Scaling up Diffusion Models for Fine-grained Image Generation with 10,000 Classes
par: Pan, Ziying, et autres
Publié: (2024)
par: Pan, Ziying, et autres
Publié: (2024)
Global-Local Aware Scene Text Editing
par: Yang, Fuxiang, et autres
Publié: (2025)
par: Yang, Fuxiang, et autres
Publié: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
Spatially Gene Expression Prediction using Dual-Scale Contrastive Learning
par: Qu, Mingcheng, et autres
Publié: (2025)
par: Qu, Mingcheng, et autres
Publié: (2025)
Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow
par: Ma, Yongjia, et autres
Publié: (2025)
par: Ma, Yongjia, et autres
Publié: (2025)
Multimodal Cancer Survival Analysis via Hypergraph Learning with Cross-Modality Rebalance
par: Qu, Mingcheng, et autres
Publié: (2025)
par: Qu, Mingcheng, et autres
Publié: (2025)
Memory-Augmented Incomplete Multimodal Survival Prediction via Cross-Slide and Gene-Attentive Hypergraph Learning
par: Qu, Mingcheng, et autres
Publié: (2025)
par: Qu, Mingcheng, et autres
Publié: (2025)
One-Shot Pose-Driving Face Animation Platform
par: Feng, He, et autres
Publié: (2024)
par: Feng, He, et autres
Publié: (2024)
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
par: Liu, Zhou, et autres
Publié: (2026)
par: Liu, Zhou, et autres
Publié: (2026)
DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation
par: Di, Donglin, et autres
Publié: (2024)
par: Di, Donglin, et autres
Publié: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
par: Fang, Xueji, et autres
Publié: (2026)
par: Fang, Xueji, et autres
Publié: (2026)
Real Face Video Animation Platform
par: Chen, Xiaokai, et autres
Publié: (2024)
par: Chen, Xiaokai, et autres
Publié: (2024)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
par: Hu, Jie, et autres
Publié: (2026)
par: Hu, Jie, et autres
Publié: (2026)
GUSLO: General and Unified Structured Light Optimization
par: Wan, Tinglei, et autres
Publié: (2025)
par: Wan, Tinglei, et autres
Publié: (2025)
Bridge to Non-Barrier Communication: Gloss-Prompted Fine-grained Cued Speech Gesture Generation with Diffusion Model
par: Lei, Wentao, et autres
Publié: (2024)
par: Lei, Wentao, et autres
Publié: (2024)
Chain of World: World Model Thinking in Latent Motion
par: Yang, Fuxiang, et autres
Publié: (2026)
par: Yang, Fuxiang, et autres
Publié: (2026)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
par: Yu, Haodong, et autres
Publié: (2026)
par: Yu, Haodong, et autres
Publié: (2026)
Fine-grained Defocus Blur Control for Generative Image Models
par: Shrivastava, Ayush, et autres
Publié: (2025)
par: Shrivastava, Ayush, et autres
Publié: (2025)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing
par: Zhang, Zhenghao, et autres
Publié: (2025)
par: Zhang, Zhenghao, et autres
Publié: (2025)
QDM: Quadtree-Based Region-Adaptive Sparse Diffusion Models for Efficient Image Super-Resolution
par: Yang, Donglin, et autres
Publié: (2025)
par: Yang, Donglin, et autres
Publié: (2025)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
par: Dai, Fengyuan, et autres
Publié: (2025)
par: Dai, Fengyuan, et autres
Publié: (2025)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
par: Liu, Ting, et autres
Publié: (2024)
par: Liu, Ting, et autres
Publié: (2024)
MA-Bench: Towards Fine-grained Micro-Action Understanding
par: Li, Kun, et autres
Publié: (2026)
par: Li, Kun, et autres
Publié: (2026)
Learning to Align Generative Appearance Priors for Fine-grained Image Retrieval
par: Wang, Shijie, et autres
Publié: (2026)
par: Wang, Shijie, et autres
Publié: (2026)
MV-VTON: Multi-View Virtual Try-On with Diffusion Models
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion
par: Ma, Yongjia, et autres
Publié: (2025)
par: Ma, Yongjia, et autres
Publié: (2025)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
par: Image Team, et autres
Publié: (2025)
par: Image Team, et autres
Publié: (2025)
ToCoAD: Two-Stage Contrastive Learning for Industrial Anomaly Detection
par: Liang, Yun, et autres
Publié: (2024)
par: Liang, Yun, et autres
Publié: (2024)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
par: Li, Minghan, et autres
Publié: (2025)
par: Li, Minghan, et autres
Publié: (2025)
EasyTune: Efficient Step-Aware Fine-Tuning for Diffusion-Based Motion Generation
par: Tan, Xiaofeng, et autres
Publié: (2026)
par: Tan, Xiaofeng, et autres
Publié: (2026)
DiLightNet: Fine-grained Lighting Control for Diffusion-based Image Generation
par: Zeng, Chong, et autres
Publié: (2024)
par: Zeng, Chong, et autres
Publié: (2024)
QR-LoRA: Efficient and Disentangled Fine-tuning via QR Decomposition for Customized Generation
par: Yang, Jiahui, et autres
Publié: (2025)
par: Yang, Jiahui, et autres
Publié: (2025)
GRPose: Learning Graph Relations for Human Image Generation with Pose Priors
par: Yin, Xiangchen, et autres
Publié: (2024)
par: Yin, Xiangchen, et autres
Publié: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Fine-grained Dynamic Network for Generic Event Boundary Detection
par: Zheng, Ziwei, et autres
Publié: (2024)
par: Zheng, Ziwei, et autres
Publié: (2024)
Causal Diffusion Transformers for Generative Modeling
par: Deng, Chaorui, et autres
Publié: (2024)
par: Deng, Chaorui, et autres
Publié: (2024)
Effective Diffusion Transformer Architecture for Image Super-Resolution
par: Cheng, Kun, et autres
Publié: (2024)
par: Cheng, Kun, et autres
Publié: (2024)
Documents similaires
-
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
par: Feng, He, et autres
Publié: (2026) -
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
par: Feng, He, et autres
Publié: (2025) -
FineDiffusion: Scaling up Diffusion Models for Fine-grained Image Generation with 10,000 Classes
par: Pan, Ziying, et autres
Publié: (2024) -
Global-Local Aware Scene Text Editing
par: Yang, Fuxiang, et autres
Publié: (2025) -
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
par: Sun, Hao, et autres
Publié: (2025)