ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Yiyang, Zhou, Feng, Yin, Xuedan, Cao, Pu, Dang, Yonghao, Yin, Jianqin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation
by: Zhou, Feng, et al.
Published: (2025)
by: Zhou, Feng, et al.
Published: (2025)
A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion
by: Cao, Pu, et al.
Published: (2026)
by: Cao, Pu, et al.
Published: (2026)
ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality
by: Xu, Guoliang, et al.
Published: (2024)
by: Xu, Guoliang, et al.
Published: (2024)
A Generically Contrastive Spatiotemporal Representation Enhancement for 3D Skeleton Action Recognition
by: Zhang, Shaojie, et al.
Published: (2023)
by: Zhang, Shaojie, et al.
Published: (2023)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
by: Jiang, Yuanyuan, et al.
Published: (2022)
by: Jiang, Yuanyuan, et al.
Published: (2022)
MaskSem: Semantic-Guided Masking for Learning 3D Hybrid High-Order Motion Representation
by: Wei, Wei, et al.
Published: (2025)
by: Wei, Wei, et al.
Published: (2025)
SiT-MLP: A Simple MLP with Point-wise Topology Feature Learning for Skeleton-based Action Recognition
by: Zhang, Shaojie, et al.
Published: (2023)
by: Zhang, Shaojie, et al.
Published: (2023)
L2HCount:Generalizing Crowd Counting from Low to High Crowd Density via Density Simulation
by: Xu, Guoliang, et al.
Published: (2025)
by: Xu, Guoliang, et al.
Published: (2025)
Physics-constrained Attack against Convolution-based Human Motion Prediction
by: Duan, Chengxu, et al.
Published: (2023)
by: Duan, Chengxu, et al.
Published: (2023)
MamKPD: A Simple Mamba Baseline for Real-Time 2D Keypoint Detection
by: Dang, Yonghao, et al.
Published: (2024)
by: Dang, Yonghao, et al.
Published: (2024)
Kinematics Modeling Network for Video-based Human Pose Estimation
by: Dang, Yonghao, et al.
Published: (2022)
by: Dang, Yonghao, et al.
Published: (2022)
Initialize to Generalize: A Stronger Initialization Pipeline for Sparse-View 3DGS
by: Zhou, Feng, et al.
Published: (2025)
by: Zhou, Feng, et al.
Published: (2025)
3DGAA: Realistic and Robust 3D Gaussian-based Adversarial Attack for Autonomous Driving
by: Zhang, Yixun, et al.
Published: (2025)
by: Zhang, Yixun, et al.
Published: (2025)
OMEGAS: Object Mesh Extraction from Large Scenes Guided by Gaussian Segmentation
by: Wang, Lizhi, et al.
Published: (2024)
by: Wang, Lizhi, et al.
Published: (2024)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
by: Li, Huilai, et al.
Published: (2025)
by: Li, Huilai, et al.
Published: (2025)
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
by: Chen, Meng, et al.
Published: (2024)
by: Chen, Meng, et al.
Published: (2024)
DHRNet: A Dual-Path Hierarchical Relation Network for Multi-Person Pose Estimation
by: Dang, Yonghao, et al.
Published: (2024)
by: Dang, Yonghao, et al.
Published: (2024)
A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition
by: Yin, Ruoqi, et al.
Published: (2023)
by: Yin, Ruoqi, et al.
Published: (2023)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
by: Li, Huilai, et al.
Published: (2026)
by: Li, Huilai, et al.
Published: (2026)
BiTAA: A Bi-Task Adversarial Attack for Object Detection and Depth Estimation via 3D Gaussian Splatting
by: Zhang, Yixun, et al.
Published: (2025)
by: Zhang, Yixun, et al.
Published: (2025)
Towards more realistic human motion prediction with attention to motion coordination
by: Ding, Pengxiang, et al.
Published: (2024)
by: Ding, Pengxiang, et al.
Published: (2024)
CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering
by: Jiang, Yuanyuan, et al.
Published: (2024)
by: Jiang, Yuanyuan, et al.
Published: (2024)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
by: Zhang, Zhanjie, et al.
Published: (2025)
by: Zhang, Zhanjie, et al.
Published: (2025)
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
by: Zhang, Shaojie, et al.
Published: (2025)
by: Zhang, Shaojie, et al.
Published: (2025)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
by: Fang, Xueji, et al.
Published: (2026)
by: Fang, Xueji, et al.
Published: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
by: Feng, Kunyu, et al.
Published: (2024)
by: Feng, Kunyu, et al.
Published: (2024)
CMIP-CIL: A Cross-Modal Benchmark for Image-Point Class Incremental Learning
by: Qi, Chao, et al.
Published: (2025)
by: Qi, Chao, et al.
Published: (2025)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
by: Yang, Zhuoyi, et al.
Published: (2024)
by: Yang, Zhuoyi, et al.
Published: (2024)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
by: Yuan, Zhihang, et al.
Published: (2024)
by: Yuan, Zhihang, et al.
Published: (2024)
DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
by: Duan, Zheng-Peng, et al.
Published: (2025)
by: Duan, Zheng-Peng, et al.
Published: (2025)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
by: Li, Yu, et al.
Published: (2024)
by: Li, Yu, et al.
Published: (2024)
ResAdapter: Domain Consistent Resolution Adapter for Diffusion Models
by: Cheng, Jiaxiang, et al.
Published: (2024)
by: Cheng, Jiaxiang, et al.
Published: (2024)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
by: Li, Zhimin, et al.
Published: (2024)
by: Li, Zhimin, et al.
Published: (2024)
ResDiff: Combining CNN and Diffusion Model for Image Super-Resolution
by: Shang, Shuyao, et al.
Published: (2023)
by: Shang, Shuyao, et al.
Published: (2023)
HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation
by: Gan, Qijun, et al.
Published: (2025)
by: Gan, Qijun, et al.
Published: (2025)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
by: Cao, Pu, et al.
Published: (2024)
by: Cao, Pu, et al.
Published: (2024)
TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
by: Yin, Zeyuan, et al.
Published: (2025)
by: Yin, Zeyuan, et al.
Published: (2025)
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
by: Fang, Yushun, et al.
Published: (2025)
by: Fang, Yushun, et al.
Published: (2025)
TopoDiT-3D: Topology-Aware Diffusion Transformer with Bottleneck Structure for 3D Point Cloud Generation
by: Guan, Zechao, et al.
Published: (2025)
by: Guan, Zechao, et al.
Published: (2025)
GaussianCAD: Robust Self-Supervised CAD Reconstruction from Three Orthographic Views Using 3D Gaussian Splatting
by: Zhou, Zheng, et al.
Published: (2025)
by: Zhou, Zheng, et al.
Published: (2025)
Similar Items
-
Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation
by: Zhou, Feng, et al.
Published: (2025) -
A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion
by: Cao, Pu, et al.
Published: (2026) -
ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality
by: Xu, Guoliang, et al.
Published: (2024) -
A Generically Contrastive Spatiotemporal Representation Enhancement for 3D Skeleton Action Recognition
by: Zhang, Shaojie, et al.
Published: (2023) -
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
by: Jiang, Yuanyuan, et al.
Published: (2022)