LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhenghao, Zhang, Ziying, Liao, Junchao, Meng, Xiangyu, Hu, Qiang, Zhu, Siyu, Zhang, Xiaoyun, Qin, Long, Wang, Weizhi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
by: Zhang, Zhenghao, et al.
Published: (2025)
by: Zhang, Zhenghao, et al.
Published: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
by: Liao, Junchao, et al.
Published: (2026)
by: Liao, Junchao, et al.
Published: (2026)
Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning
by: Meng, Xiangyu, et al.
Published: (2025)
by: Meng, Xiangyu, et al.
Published: (2025)
Tora: Trajectory-oriented Diffusion Transformer for Video Generation
by: Zhang, Zhenghao, et al.
Published: (2024)
by: Zhang, Zhenghao, et al.
Published: (2024)
TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis
by: Li, Menghao, et al.
Published: (2025)
by: Li, Menghao, et al.
Published: (2025)
EffiVED:Efficient Video Editing via Text-instruction Diffusion Models
by: Zhang, Zhenghao, et al.
Published: (2024)
by: Zhang, Zhenghao, et al.
Published: (2024)
TD-BFR: Truncated Diffusion Model for Efficient Blind Face Restoration
by: Zhang, Ziying, et al.
Published: (2025)
by: Zhang, Ziying, et al.
Published: (2025)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
by: Zhong, Weizhi, et al.
Published: (2024)
by: Zhong, Weizhi, et al.
Published: (2024)
E4S: Fine-grained Face Swapping via Editing With Regional GAN Inversion
by: Li, Maomao, et al.
Published: (2023)
by: Li, Maomao, et al.
Published: (2023)
FineDiffusion: Scaling up Diffusion Models for Fine-grained Image Generation with 10,000 Classes
by: Pan, Ziying, et al.
Published: (2024)
by: Pan, Ziying, et al.
Published: (2024)
DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization
by: Peng, Siran, et al.
Published: (2025)
by: Peng, Siran, et al.
Published: (2025)
MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization
by: Zhang, Yaning, et al.
Published: (2026)
by: Zhang, Yaning, et al.
Published: (2026)
Modeling Spoof Noise by De-spoofing Diffusion and its Application in Face Anti-spoofing
by: Zhang, Bin, et al.
Published: (2024)
by: Zhang, Bin, et al.
Published: (2024)
MFCLIP: Multi-modal Fine-grained CLIP for Generalizable Diffusion Face Forgery Detection
by: Zhang, Yaning, et al.
Published: (2024)
by: Zhang, Yaning, et al.
Published: (2024)
UP-FacE: User-predictable Fine-grained Face Shape Editing
by: Strohm, Florian, et al.
Published: (2024)
by: Strohm, Florian, et al.
Published: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing
by: Shuai, Zitao, et al.
Published: (2024)
by: Shuai, Zitao, et al.
Published: (2024)
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution
by: Fang, Yushun, et al.
Published: (2025)
by: Fang, Yushun, et al.
Published: (2025)
Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers
by: Zhao, Yusheng, et al.
Published: (2026)
by: Zhao, Yusheng, et al.
Published: (2026)
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
by: Zhang, Xiangyu, et al.
Published: (2024)
by: Zhang, Xiangyu, et al.
Published: (2024)
A2BFR: Attribute-Aware Blind Face Restoration
by: Zhu, Chenxin, et al.
Published: (2026)
by: Zhu, Chenxin, et al.
Published: (2026)
F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration
by: Liu, Lu, et al.
Published: (2024)
by: Liu, Lu, et al.
Published: (2024)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
by: Li, Minghan, et al.
Published: (2025)
by: Li, Minghan, et al.
Published: (2025)
MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing
by: Li, Jiaqi, et al.
Published: (2024)
by: Li, Jiaqi, et al.
Published: (2024)
Variational Diffusion Channel Decoder
by: Zhang, Chengwei, et al.
Published: (2026)
by: Zhang, Chengwei, et al.
Published: (2026)
Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding
by: Zhang, Yuhui, et al.
Published: (2026)
by: Zhang, Yuhui, et al.
Published: (2026)
Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control
by: Chen, Hejia, et al.
Published: (2025)
by: Chen, Hejia, et al.
Published: (2025)
UVOSAM: A Mask-free Paradigm for Unsupervised Video Object Segmentation via Segment Anything Model
by: Zhang, Zhenghao, et al.
Published: (2023)
by: Zhang, Zhenghao, et al.
Published: (2023)
MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning
by: Wu, Haoning, et al.
Published: (2024)
by: Wu, Haoning, et al.
Published: (2024)
FABLE: Fine-grained Fact Anchoring for Unstructured Model Editing
by: Wang, Peng, et al.
Published: (2026)
by: Wang, Peng, et al.
Published: (2026)
Generalizable Face Landmarking Guided by Conditional Face Warping
by: Liang, Jiayi, et al.
Published: (2024)
by: Liang, Jiayi, et al.
Published: (2024)
Robust ID-Specific Face Restoration via Alignment Learning
by: Fang, Yushun, et al.
Published: (2025)
by: Fang, Yushun, et al.
Published: (2025)
GoodDrag: Towards Good Practices for Drag Editing with Diffusion Models
by: Zhang, Zewei, et al.
Published: (2024)
by: Zhang, Zewei, et al.
Published: (2024)
MuseFace: Text-driven Face Editing via Diffusion-based Mask Generation Approach
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint
by: Chen, Zhipeng, et al.
Published: (2024)
by: Chen, Zhipeng, et al.
Published: (2024)
Verification Challenges in Sparse Matrix Vector Multiplication in High Performance Computing: Part I
by: Zhang, Junchao
Published: (2025)
by: Zhang, Junchao
Published: (2025)
MapLocNet: Coarse-to-Fine Feature Registration for Visual Re-Localization in Navigation Maps
by: Wu, Hang, et al.
Published: (2024)
by: Wu, Hang, et al.
Published: (2024)
Proto-Former: Unified Facial Landmark Detection by Prototype Transformer
by: Hu, Shengkai, et al.
Published: (2025)
by: Hu, Shengkai, et al.
Published: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
by: Chen, Qian, et al.
Published: (2023)
by: Chen, Qian, et al.
Published: (2023)
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
by: Zhu, Jie, et al.
Published: (2026)
by: Zhu, Jie, et al.
Published: (2026)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
by: Zou, Siyu, et al.
Published: (2024)
by: Zou, Siyu, et al.
Published: (2024)
Similar Items
-
Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
by: Zhang, Zhenghao, et al.
Published: (2025) -
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
by: Liao, Junchao, et al.
Published: (2026) -
Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning
by: Meng, Xiangyu, et al.
Published: (2025) -
Tora: Trajectory-oriented Diffusion Transformer for Video Generation
by: Zhang, Zhenghao, et al.
Published: (2024) -
TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis
by: Li, Menghao, et al.
Published: (2025)