Saved in:
| Main Authors: | Guo, Qin, Zeng, Ailing, Yue, Dongxu, Yang, Ceyuan, Cao, Yang, Guo, Hanzhong, Shen, Fei, Liu, Wei, Liu, Xihui, Xu, Dan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2507.02713 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation
by: Sun, Yang-Tian, et al.
Published: (2025)
by: Sun, Yang-Tian, et al.
Published: (2025)
X-Pose: Detecting Any Keypoints
by: Yang, Jie, et al.
Published: (2023)
by: Yang, Jie, et al.
Published: (2023)
Taming Lookup Tables for Efficient Image Retouching
by: Yang, Sidi, et al.
Published: (2024)
by: Yang, Sidi, et al.
Published: (2024)
DreamWaltz-G: Expressive 3D Gaussian Avatars from Skeleton-Guided 2D Diffusion
by: Huang, Yukun, et al.
Published: (2024)
by: Huang, Yukun, et al.
Published: (2024)
VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer
by: Liu, Xinyu, et al.
Published: (2025)
by: Liu, Xinyu, et al.
Published: (2025)
Scaling Laws For Diffusion Transformers
by: Liang, Zhengyang, et al.
Published: (2024)
by: Liang, Zhengyang, et al.
Published: (2024)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
by: Zhao, Lei, et al.
Published: (2025)
by: Zhao, Lei, et al.
Published: (2025)
Representation Forcing for Bottleneck-Free Unified Multimodal Models
by: Wang, Yuqing, et al.
Published: (2026)
by: Wang, Yuqing, et al.
Published: (2026)
GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification
by: Liu, Xuedeng, et al.
Published: (2025)
by: Liu, Xuedeng, et al.
Published: (2025)
Explicit Critic Guidance for Aligning Diffusion Models
by: Liang, Zhengyang, et al.
Published: (2026)
by: Liang, Zhengyang, et al.
Published: (2026)
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation
by: Wang, Xiang, et al.
Published: (2024)
by: Wang, Xiang, et al.
Published: (2024)
UniShare: A Unified Framework for Joint Video and Receiver Recommendation in Social Sharing
by: Wang, Caimeng, et al.
Published: (2026)
by: Wang, Caimeng, et al.
Published: (2026)
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
by: Wang, Jianyi, et al.
Published: (2025)
by: Wang, Jianyi, et al.
Published: (2025)
UniSymNet: A Unified Symbolic Network Guided by Transformer
by: Li, Xinxin, et al.
Published: (2025)
by: Li, Xinxin, et al.
Published: (2025)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
by: Wang, Haoxuan, et al.
Published: (2025)
by: Wang, Haoxuan, et al.
Published: (2025)
UniHands: Unifying Various Wild-Collected Keypoints for Personalized Hand Reconstruction
by: Zhang, Menghe, et al.
Published: (2024)
by: Zhang, Menghe, et al.
Published: (2024)
UniViTAR: Unified Vision Transformer with Native Resolution
by: Qiao, Limeng, et al.
Published: (2025)
by: Qiao, Limeng, et al.
Published: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
by: Wang, Feng, et al.
Published: (2026)
by: Wang, Feng, et al.
Published: (2026)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
by: Guo, Yuwei, et al.
Published: (2025)
by: Guo, Yuwei, et al.
Published: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
by: Guo, Shoutao, et al.
Published: (2025)
by: Guo, Shoutao, et al.
Published: (2025)
Unveiling the Era of Spatial Computing
by: Cao, Hanzhong
Published: (2024)
by: Cao, Hanzhong
Published: (2024)
Light Aircraft Game : Basic Implementation and training results analysis
by: Cao, Hanzhong
Published: (2025)
by: Cao, Hanzhong
Published: (2025)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
by: Du, Chenpeng, et al.
Published: (2023)
by: Du, Chenpeng, et al.
Published: (2023)
A Unified Framework for Covariate Adjustment Under Stratified Randomisation
by: Fuyi Tu, et al.
Published: (2024)
by: Fuyi Tu, et al.
Published: (2024)
Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
by: Guo, Hanzhong, et al.
Published: (2026)
by: Guo, Hanzhong, et al.
Published: (2026)
Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion
by: Zhao, Fangmin, et al.
Published: (2025)
by: Zhao, Fangmin, et al.
Published: (2025)
Taming Generative Diffusion Prior for Universal Blind Image Restoration
by: Tu, Siwei, et al.
Published: (2024)
by: Tu, Siwei, et al.
Published: (2024)
K-Gen: A Multimodal Language-Conditioned Approach for Interpretable Keypoint-Guided Trajectory Generation
by: Mu, Mingxuan, et al.
Published: (2026)
by: Mu, Mingxuan, et al.
Published: (2026)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
by: Huang, Ziyuan, et al.
Published: (2025)
by: Huang, Ziyuan, et al.
Published: (2025)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
by: Liu, Zeyang, et al.
Published: (2025)
by: Liu, Zeyang, et al.
Published: (2025)
Real-time Identity Defenses against Malicious Personalization of Diffusion Models
by: Guo, Hanzhong, et al.
Published: (2024)
by: Guo, Hanzhong, et al.
Published: (2024)
Modality-Composable Diffusion Policy via Inference-Time Distribution-level Composition
by: Cao, Jiahang, et al.
Published: (2025)
by: Cao, Jiahang, et al.
Published: (2025)
Spiking Diffusion Models
by: Cao, Jiahang, et al.
Published: (2024)
by: Cao, Jiahang, et al.
Published: (2024)
UniT: Unified Geometry Learning with Group Autoregressive Transformer
by: Wang, Haotian, et al.
Published: (2026)
by: Wang, Haotian, et al.
Published: (2026)
The Dawn of Video Generation: Preliminary Explorations with SORA-like Models
by: Zeng, Ailing, et al.
Published: (2024)
by: Zeng, Ailing, et al.
Published: (2024)
UniDiffGrasp: A Unified Framework Integrating VLM Reasoning and VLM-Guided Part Diffusion for Open-Vocabulary Constrained Grasping with Dual Arms
by: Guo, Xueyang, et al.
Published: (2025)
by: Guo, Xueyang, et al.
Published: (2025)
Design-based theory for Lasso adjustment in randomized block experiments and rerandomized experiments
by: Zhu, Ke, et al.
Published: (2021)
by: Zhu, Ke, et al.
Published: (2021)
Neural Jumps for Option Pricing
by: Zheng, Duosi, et al.
Published: (2025)
by: Zheng, Duosi, et al.
Published: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
by: Feng, Tao, et al.
Published: (2025)
by: Feng, Tao, et al.
Published: (2025)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Similar Items
-
UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation
by: Sun, Yang-Tian, et al.
Published: (2025) -
X-Pose: Detecting Any Keypoints
by: Yang, Jie, et al.
Published: (2023) -
Taming Lookup Tables for Efficient Image Retouching
by: Yang, Sidi, et al.
Published: (2024) -
DreamWaltz-G: Expressive 3D Gaussian Avatars from Skeleton-Guided 2D Diffusion
by: Huang, Yukun, et al.
Published: (2024) -
VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer
by: Liu, Xinyu, et al.
Published: (2025)