MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Krishnamurthy, Bharath, Rattani, Ajita |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DOOMGAN:High-Fidelity Dynamic Identity Obfuscation Ocular Generative Morphing
par: Krishnamurthy, Bharath, et autres
Publié: (2025)
par: Krishnamurthy, Bharath, et autres
Publié: (2025)
A Self-Supervised Learning Pipeline for Demographically Fair Facial Attribute Classification
par: Ramachandran, Sreeraj, et autres
Publié: (2024)
par: Ramachandran, Sreeraj, et autres
Publié: (2024)
Time Frequency Analysis of EMG Signal for Gesture Recognition using Fine grained Features
par: Aarotale, Parshuram N., et autres
Publié: (2025)
par: Aarotale, Parshuram N., et autres
Publié: (2025)
Unified Face Matching and Physical-Digital Spoofing Attack Detection
par: Kunwar, Arun, et autres
Publié: (2025)
par: Kunwar, Arun, et autres
Publié: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
Unveiling Redundancy in Diffusion Transformers (DiTs): A Systematic Study
par: Sun, Xibo, et autres
Publié: (2024)
par: Sun, Xibo, et autres
Publié: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
Social Media Authentication and Combating Deepfakes using Semi-fragile Invisible Image Watermarking
par: Nadimpalli, Aakash Varma, et autres
Publié: (2024)
par: Nadimpalli, Aakash Varma, et autres
Publié: (2024)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
par: Liu, Wenxuan, et autres
Publié: (2024)
par: Liu, Wenxuan, et autres
Publié: (2024)
FineFACE: Fair Facial Attribute Classification Leveraging Fine-grained Features
par: Manzoor, Ayesha, et autres
Publié: (2024)
par: Manzoor, Ayesha, et autres
Publié: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers
par: Zhang, Jiaji, et autres
Publié: (2026)
par: Zhang, Jiaji, et autres
Publié: (2026)
DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers
par: Deng, Juncan, et autres
Publié: (2024)
par: Deng, Juncan, et autres
Publié: (2024)
ZigMa: A DiT-style Zigzag Mamba Diffusion Model
par: Hu, Vincent Tao, et autres
Publié: (2024)
par: Hu, Vincent Tao, et autres
Publié: (2024)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
par: Lyu, Hengye, et autres
Publié: (2026)
par: Lyu, Hengye, et autres
Publié: (2026)
Machine Learning-based sEMG Signal Classification for Hand Gesture Recognition
par: Aarotale, Parshuram N., et autres
Publié: (2024)
par: Aarotale, Parshuram N., et autres
Publié: (2024)
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
par: Ji, Seunghyun
Publié: (2026)
par: Ji, Seunghyun
Publié: (2026)
VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping
par: Shao, Hao, et autres
Publié: (2024)
par: Shao, Hao, et autres
Publié: (2024)
DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking
par: Haridas, Akash, et autres
Publié: (2026)
par: Haridas, Akash, et autres
Publié: (2026)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space
par: Wang, Xiaoce, et autres
Publié: (2026)
par: Wang, Xiaoce, et autres
Publié: (2026)
Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
par: Cao, Yushe, et autres
Publié: (2025)
par: Cao, Yushe, et autres
Publié: (2025)
AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation
par: Zhang, Jian, et autres
Publié: (2026)
par: Zhang, Jian, et autres
Publié: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
par: Wang, Zhaoqing, et autres
Publié: (2024)
par: Wang, Zhaoqing, et autres
Publié: (2024)
AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose
par: Yu, Jongmin, et autres
Publié: (2026)
par: Yu, Jongmin, et autres
Publié: (2026)
CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image Generation
par: Mei, Kangfu, et autres
Publié: (2023)
par: Mei, Kangfu, et autres
Publié: (2023)
EdgeDiT: Hardware-Aware Diffusion Transformers for Efficient On-Device Image Generation
par: Kodavanti, Sravanth, et autres
Publié: (2026)
par: Kodavanti, Sravanth, et autres
Publié: (2026)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
par: Qi, Tianhao, et autres
Publié: (2025)
par: Qi, Tianhao, et autres
Publié: (2025)
DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing
par: Zhou, Zihan, et autres
Publié: (2025)
par: Zhou, Zihan, et autres
Publié: (2025)
Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
par: Zhou, Chao, et autres
Publié: (2026)
par: Zhou, Chao, et autres
Publié: (2026)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
par: Zeng, Weixuan, et autres
Publié: (2026)
par: Zeng, Weixuan, et autres
Publié: (2026)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
par: Wu, Junyi, et autres
Publié: (2024)
par: Wu, Junyi, et autres
Publié: (2024)
Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
par: Lee, Dong In, et autres
Publié: (2025)
par: Lee, Dong In, et autres
Publié: (2025)
DIFFUMA: High-Fidelity Spatio-Temporal Video Prediction via Dual-Path Mamba and Diffusion Enhancement
par: Xie, Xinyu, et autres
Publié: (2025)
par: Xie, Xinyu, et autres
Publié: (2025)
DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers
par: Wang, Lizhen, et autres
Publié: (2025)
par: Wang, Lizhen, et autres
Publié: (2025)
Documents similaires
-
DOOMGAN:High-Fidelity Dynamic Identity Obfuscation Ocular Generative Morphing
par: Krishnamurthy, Bharath, et autres
Publié: (2025) -
A Self-Supervised Learning Pipeline for Demographically Fair Facial Attribute Classification
par: Ramachandran, Sreeraj, et autres
Publié: (2024) -
Time Frequency Analysis of EMG Signal for Gesture Recognition using Fine grained Features
par: Aarotale, Parshuram N., et autres
Publié: (2025) -
Unified Face Matching and Physical-Digital Spoofing Attack Detection
par: Kunwar, Arun, et autres
Publié: (2025) -
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
par: Fang, Gongfan, et autres
Publié: (2024)