DiVE: DiT-based Video Generation with Enhanced Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Junpeng, Hong, Gangyi, Zhou, Lijun, Ma, Enhui, Hu, Hengtong, Zhou, Xia, Xiang, Jie, Liu, Fan, Yu, Kaicheng, Sun, Haiyang, Zhan, Kun, Jia, Peng, Zhang, Miao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
par: Jiang, Junpeng, et autres
Publié: (2025)
par: Jiang, Junpeng, et autres
Publié: (2025)
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
par: Kumar, Raja, et autres
Publié: (2025)
par: Kumar, Raja, et autres
Publié: (2025)
A Direct Variance Estimation (DiVE) for Meta-Analysis of Median Differences
par: Okuda, Tadahisa, et autres
Publié: (2026)
par: Okuda, Tadahisa, et autres
Publié: (2026)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
par: Ma, Teli, et autres
Publié: (2026)
par: Ma, Teli, et autres
Publié: (2026)
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
par: Ma, Enhui, et autres
Publié: (2024)
par: Ma, Enhui, et autres
Publié: (2024)
DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration
par: Huo, Yanru, et autres
Publié: (2025)
par: Huo, Yanru, et autres
Publié: (2025)
MaterialPicker: Multi-Modal DiT-Based Material Generation
par: Ma, Xiaohe, et autres
Publié: (2024)
par: Ma, Xiaohe, et autres
Publié: (2024)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
par: Tan, Xin, et autres
Publié: (2025)
par: Tan, Xin, et autres
Publié: (2025)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
par: Zhou, Jingkai, et autres
Publié: (2025)
par: Zhou, Jingkai, et autres
Publié: (2025)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
par: Zhang, Jinxiao, et autres
Publié: (2026)
par: Zhang, Jinxiao, et autres
Publié: (2026)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
par: Feng, He, et autres
Publié: (2025)
par: Feng, He, et autres
Publié: (2025)
Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT
par: Liu, Dongyang, et autres
Publié: (2025)
par: Liu, Dongyang, et autres
Publié: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
par: Wang, Zhaoqing, et autres
Publié: (2024)
par: Wang, Zhaoqing, et autres
Publié: (2024)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
par: Lyu, Hengye, et autres
Publié: (2026)
par: Lyu, Hengye, et autres
Publié: (2026)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
par: Shi, Junqi, et autres
Publié: (2026)
par: Shi, Junqi, et autres
Publié: (2026)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
par: Fang, Jiarui, et autres
Publié: (2024)
par: Fang, Jiarui, et autres
Publié: (2024)
CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving
par: Ma, Enhui, et autres
Publié: (2025)
par: Ma, Enhui, et autres
Publié: (2025)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
Insert Anything: Image Insertion via In-Context Editing in DiT
par: Song, Wensong, et autres
Publié: (2025)
par: Song, Wensong, et autres
Publié: (2025)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
par: Shi, Yangming, et autres
Publié: (2026)
par: Shi, Yangming, et autres
Publié: (2026)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
par: Yang, Zhuoyi, et autres
Publié: (2024)
par: Yang, Zhuoyi, et autres
Publié: (2024)
3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
par: Mikaeili, Aryan, et autres
Publié: (2026)
par: Mikaeili, Aryan, et autres
Publié: (2026)
RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization
par: Yang, Kaicheng, et autres
Publié: (2025)
par: Yang, Kaicheng, et autres
Publié: (2025)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
par: Lin, Hangyu, et autres
Publié: (2026)
par: Lin, Hangyu, et autres
Publié: (2026)
Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
par: Zhang, Xun, et autres
Publié: (2026)
par: Zhang, Xun, et autres
Publié: (2026)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
par: Tian, Yuchuan, et autres
Publié: (2024)
par: Tian, Yuchuan, et autres
Publié: (2024)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
par: Ji, Seunghyun
Publié: (2026)
par: Ji, Seunghyun
Publié: (2026)
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
par: Wu, Chenyang, et autres
Publié: (2026)
par: Wu, Chenyang, et autres
Publié: (2026)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)
par: Qi, Tianhao, et autres
Publié: (2025)
DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
par: Zhou, Zihan, et autres
Publié: (2025)
par: Zhou, Zihan, et autres
Publié: (2025)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
par: Sun, Yasheng, et autres
Publié: (2025)
par: Sun, Yasheng, et autres
Publié: (2025)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
par: Zhou, Chao, et autres
Publié: (2026)
par: Zhou, Chao, et autres
Publié: (2026)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
par: Tang, Jian, et autres
Publié: (2026)
par: Tang, Jian, et autres
Publié: (2026)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
par: Wang, Kai, et autres
Publié: (2024)
par: Wang, Kai, et autres
Publié: (2024)
FD-DiT: Frequency Domain-Directed Diffusion Transformer for Low-Dose CT Reconstruction
par: Liu, Qiqing, et autres
Publié: (2025)
par: Liu, Qiqing, et autres
Publié: (2025)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
par: Deng, Juncan, et autres
Publié: (2024)
par: Deng, Juncan, et autres
Publié: (2024)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
par: Fang, Haipeng, et autres
Publié: (2025)
par: Fang, Haipeng, et autres
Publié: (2025)
Documents similaires
-
DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
par: Jiang, Junpeng, et autres
Publié: (2025) -
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
par: Kumar, Raja, et autres
Publié: (2025) -
A Direct Variance Estimation (DiVE) for Meta-Analysis of Median Differences
par: Okuda, Tadahisa, et autres
Publié: (2026) -
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
par: Ma, Teli, et autres
Publié: (2026) -
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
par: Ma, Enhui, et autres
Publié: (2024)