SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiong, Lingyu, Cheng, Xize, Tan, Jintao, Wu, Xianjia, Li, Xiandong, Zhu, Lei, Ma, Fei, Li, Minglei, Xu, Huang, Hu, Zhihu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation
por: Tan, Jintao, et al.
Publicado: (2024)
por: Tan, Jintao, et al.
Publicado: (2024)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
por: Du, Chenpeng, et al.
Publicado: (2023)
por: Du, Chenpeng, et al.
Publicado: (2023)
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
por: Ge, Shuheng, et al.
Publicado: (2024)
por: Ge, Shuheng, et al.
Publicado: (2024)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
por: Ling, Zeyu, et al.
Publicado: (2025)
por: Ling, Zeyu, et al.
Publicado: (2025)
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
por: Yu, Hongyun, et al.
Publicado: (2024)
por: Yu, Hongyun, et al.
Publicado: (2024)
Memories are One-to-Many Mapping Alleviators in Talking Face Generation
por: Tang, Anni, et al.
Publicado: (2022)
por: Tang, Anni, et al.
Publicado: (2022)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
por: Wu, Kangyi, et al.
Publicado: (2025)
por: Wu, Kangyi, et al.
Publicado: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026)
por: Ye, Zhen, et al.
Publicado: (2026)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting
por: Cho, Kyusun, et al.
Publicado: (2024)
por: Cho, Kyusun, et al.
Publicado: (2024)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
por: Jin, Yili, et al.
Publicado: (2024)
por: Jin, Yili, et al.
Publicado: (2024)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
por: Xu, Junhao, et al.
Publicado: (2025)
por: Xu, Junhao, et al.
Publicado: (2025)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
por: Cai, Lingling, et al.
Publicado: (2024)
por: Cai, Lingling, et al.
Publicado: (2024)
Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs
por: Hu, Yi, et al.
Publicado: (2026)
por: Hu, Yi, et al.
Publicado: (2026)
Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation
por: Shen, Nanhan, et al.
Publicado: (2026)
por: Shen, Nanhan, et al.
Publicado: (2026)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
por: Sun, Qianqian, et al.
Publicado: (2025)
por: Sun, Qianqian, et al.
Publicado: (2025)
GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer
por: Lin, Yihong, et al.
Publicado: (2024)
por: Lin, Yihong, et al.
Publicado: (2024)
GAIA: Zero-shot Talking Avatar Generation
por: He, Tianyu, et al.
Publicado: (2023)
por: He, Tianyu, et al.
Publicado: (2023)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
por: Zhong, Weizhi, et al.
Publicado: (2024)
por: Zhong, Weizhi, et al.
Publicado: (2024)
Talking-to-Build: How LLM-Assisted Interface Shapes Player Performance and Experience in Minecraft
por: Sun, Xin, et al.
Publicado: (2025)
por: Sun, Xin, et al.
Publicado: (2025)
SemanticGarment: Semantic-Controlled Generation and Editing of 3D Gaussian Garments
por: Wang, Ruiyan, et al.
Publicado: (2025)
por: Wang, Ruiyan, et al.
Publicado: (2025)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
por: Yao, Ziyu, et al.
Publicado: (2024)
por: Yao, Ziyu, et al.
Publicado: (2024)
NeRF-AD: Neural Radiance Field with Attention-based Disentanglement for Talking Face Synthesis
por: Bi, Chongke, et al.
Publicado: (2024)
por: Bi, Chongke, et al.
Publicado: (2024)
Beyond Forced Modality Balance: Intrinsic Information Budgets for Multimodal Learning
por: Xiong, Zechang, et al.
Publicado: (2026)
por: Xiong, Zechang, et al.
Publicado: (2026)
MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals
por: Yu, Lei, et al.
Publicado: (2024)
por: Yu, Lei, et al.
Publicado: (2024)
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
por: Li, Chengzhi, et al.
Publicado: (2026)
por: Li, Chengzhi, et al.
Publicado: (2026)
SFQA: A Comprehensive Perceptual Quality Assessment Dataset for Singing Face Generation
por: Gao, Zhilin, et al.
Publicado: (2026)
por: Gao, Zhilin, et al.
Publicado: (2026)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025)
por: Kang, Fang, et al.
Publicado: (2025)
CPSL: Representing Volumetric Video via Content-Promoted Scene Layers
por: Hu, Kaiyuan, et al.
Publicado: (2025)
por: Hu, Kaiyuan, et al.
Publicado: (2025)
EditEmoTalk: Controllable Speech-Driven 3D Facial Animation with Continuous Expression Editing
por: Jiang, Diqiong, et al.
Publicado: (2026)
por: Jiang, Diqiong, et al.
Publicado: (2026)
Knowledge-aware Diffusion-Enhanced Multimedia Recommendation
por: Mo, Xian, et al.
Publicado: (2025)
por: Mo, Xian, et al.
Publicado: (2025)
LATENTPATCH: A Non-Parametric Approach for Face Generation and Editing
por: Samuth, Benjamin, et al.
Publicado: (2024)
por: Samuth, Benjamin, et al.
Publicado: (2024)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
por: Li, Qingcao, et al.
Publicado: (2026)
por: Li, Qingcao, et al.
Publicado: (2026)
A H.265/HEVC Fine-Grained ROI Video Encryption Algorithm Based on Coding Unit and Prompt Segmentation
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
EmoFace: Emotion-Content Disentangled Speech-Driven 3D Talking Face Animation
por: Lin, Yihong, et al.
Publicado: (2024)
por: Lin, Yihong, et al.
Publicado: (2024)
Ejemplares similares
-
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation
por: Tan, Jintao, et al.
Publicado: (2024) -
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
por: Du, Chenpeng, et al.
Publicado: (2023) -
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
por: Ge, Shuheng, et al.
Publicado: (2024) -
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
por: Ling, Zeyu, et al.
Publicado: (2025) -
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
por: Yu, Hongyun, et al.
Publicado: (2024)