DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
Fuente:
arXiv
Guardado en:
| Autores principales: | Feng, He, Ma, Yongjia, Di, Donglin, Fan, Lei, Su, Tonghua, Wu, Xiangqian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
por: Feng, He, et al.
Publicado: (2026)
por: Feng, He, et al.
Publicado: (2026)
One-Shot Pose-Driving Face Animation Platform
por: Feng, He, et al.
Publicado: (2024)
por: Feng, He, et al.
Publicado: (2024)
Real Face Video Animation Platform
por: Chen, Xiaokai, et al.
Publicado: (2024)
por: Chen, Xiaokai, et al.
Publicado: (2024)
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024)
por: Jiang, Junpeng, et al.
Publicado: (2024)
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
por: Ma, Teli, et al.
Publicado: (2026)
por: Ma, Teli, et al.
Publicado: (2026)
DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation
por: Di, Donglin, et al.
Publicado: (2024)
por: Di, Donglin, et al.
Publicado: (2024)
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild
por: Zhou, Jingkai, et al.
Publicado: (2025)
por: Zhou, Jingkai, et al.
Publicado: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
por: Wang, Xiang, et al.
Publicado: (2025)
por: Wang, Xiang, et al.
Publicado: (2025)
SketchColour: Channel Concat Guided DiT-based Sketch-to-Colour Pipeline for 2D Animation
por: Sadihin, Bryan Constantine, et al.
Publicado: (2025)
por: Sadihin, Bryan Constantine, et al.
Publicado: (2025)
Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow
por: Ma, Yongjia, et al.
Publicado: (2025)
por: Ma, Yongjia, et al.
Publicado: (2025)
MeshCraft: Exploring Efficient and Controllable Mesh Generation with Flow-based DiTs
por: He, Xianglong, et al.
Publicado: (2025)
por: He, Xianglong, et al.
Publicado: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
DiT-HC: Enabling Efficient Training of Visual Generation Model DiT on HPC-oriented CPU Cluster
por: Zhang, Jinxiao, et al.
Publicado: (2026)
por: Zhang, Jinxiao, et al.
Publicado: (2026)
HiMat: DiT-based Ultra-High Resolution SVBRDF Generation
por: Wang, Zixiong, et al.
Publicado: (2025)
por: Wang, Zixiong, et al.
Publicado: (2025)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
Global-Local Aware Scene Text Editing
por: Yang, Fuxiang, et al.
Publicado: (2025)
por: Yang, Fuxiang, et al.
Publicado: (2025)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
por: Shi, Yangming, et al.
Publicado: (2026)
por: Shi, Yangming, et al.
Publicado: (2026)
TetriServe: Efficient DiT Serving for Heterogeneous Image Generation
por: Lu, Runyu, et al.
Publicado: (2025)
por: Lu, Runyu, et al.
Publicado: (2025)
EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
por: Wang, Kun, et al.
Publicado: (2025)
por: Wang, Kun, et al.
Publicado: (2025)
xDiT: an Inference Engine for Diffusion Transformers (DiTs) with Massive Parallelism
por: Fang, Jiarui, et al.
Publicado: (2024)
por: Fang, Jiarui, et al.
Publicado: (2024)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
por: Feng, Haoran, et al.
Publicado: (2025)
por: Feng, Haoran, et al.
Publicado: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
StyleTalk++: A Unified Framework for Controlling the Speaking Styles of Talking Heads
por: Wang, Suzhen, et al.
Publicado: (2024)
por: Wang, Suzhen, et al.
Publicado: (2024)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
por: Shi, Junqi, et al.
Publicado: (2026)
por: Shi, Junqi, et al.
Publicado: (2026)
MaterialPicker: Multi-Modal DiT-Based Material Generation
por: Ma, Xiaohe, et al.
Publicado: (2024)
por: Ma, Xiaohe, et al.
Publicado: (2024)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
por: Mikaeili, Aryan, et al.
Publicado: (2026)
por: Mikaeili, Aryan, et al.
Publicado: (2026)
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal
por: Wu, Chenyang, et al.
Publicado: (2026)
por: Wu, Chenyang, et al.
Publicado: (2026)
HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions
por: Xu, Shuolin, et al.
Publicado: (2025)
por: Xu, Shuolin, et al.
Publicado: (2025)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
por: Chen, Ruichen, et al.
Publicado: (2025)
por: Chen, Ruichen, et al.
Publicado: (2025)
LaVin-DiT: Large Vision Diffusion Transformer
por: Wang, Zhaoqing, et al.
Publicado: (2024)
por: Wang, Zhaoqing, et al.
Publicado: (2024)
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
por: Ji, Seunghyun
Publicado: (2026)
por: Ji, Seunghyun
Publicado: (2026)
DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration
por: Huo, Yanru, et al.
Publicado: (2025)
por: Huo, Yanru, et al.
Publicado: (2025)
SOAP: Style-Omniscient Animatable Portraits
por: Liao, Tingting, et al.
Publicado: (2025)
por: Liao, Tingting, et al.
Publicado: (2025)
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
por: Hu, Vincent Tao, et al.
Publicado: (2024)
por: Hu, Vincent Tao, et al.
Publicado: (2024)
GenMask: Adapting DiT for Segmentation via Direct Mask Generation
por: Yang, Yuhuan, et al.
Publicado: (2026)
por: Yang, Yuhuan, et al.
Publicado: (2026)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
por: Qi, Tianhao, et al.
Publicado: (2025)
por: Qi, Tianhao, et al.
Publicado: (2025)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
por: Fang, Haipeng, et al.
Publicado: (2025)
por: Fang, Haipeng, et al.
Publicado: (2025)
AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
por: Chen, Sixiang, et al.
Publicado: (2025)
por: Chen, Sixiang, et al.
Publicado: (2025)
TQ-DiT: Efficient Time-Aware Quantization for Diffusion Transformers
por: Hwang, Younghye, et al.
Publicado: (2025)
por: Hwang, Younghye, et al.
Publicado: (2025)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
por: Wu, Junyi, et al.
Publicado: (2024)
por: Wu, Junyi, et al.
Publicado: (2024)
Ejemplares similares
-
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
por: Feng, He, et al.
Publicado: (2026) -
One-Shot Pose-Driving Face Animation Platform
por: Feng, He, et al.
Publicado: (2024) -
Real Face Video Animation Platform
por: Chen, Xiaokai, et al.
Publicado: (2024) -
DiVE: DiT-based Video Generation with Enhanced Control
por: Jiang, Junpeng, et al.
Publicado: (2024) -
DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control
por: Ma, Teli, et al.
Publicado: (2026)