Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Rakesh, Vineet Kumar, Mazumdar, Soumya, Maity, Research Pratim, Pal, Sarbajit, Das, Amitabha, Samanta, Tapas
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866914267700133888
author Rakesh, Vineet Kumar
Mazumdar, Soumya
Maity, Research Pratim
Pal, Sarbajit
Das, Amitabha
Samanta, Tapas
author_facet Rakesh, Vineet Kumar
Mazumdar, Soumya
Maity, Research Pratim
Pal, Sarbajit
Das, Amitabha
Samanta, Tapas
contents Talking Head Generation (THG) has emerged as a transformative technology in computer vision, enabling the synthesis of realistic human faces synchronized with image, audio, text, or video inputs. This paper provides a comprehensive review of methodologies and frameworks for talking head generation, categorizing approaches into 2D--based, 3D--based, Neural Radiance Fields (NeRF)--based, diffusion--based, parameter-driven techniques and many other techniques. It evaluates algorithms, datasets, and evaluation metrics while highlighting advancements in perceptual realism and technical efficiency critical for applications such as digital avatars, video dubbing, ultra-low bitrate video conferencing, and online education. The study identifies challenges such as reliance on pre--trained models, extreme pose handling, multilingual synthesis, and temporal consistency. Future directions include modular architectures, multilingual datasets, hybrid models blending pre--trained and task-specific layers, and innovative loss functions. By synthesizing existing research and exploring emerging trends, this paper aims to provide actionable insights for researchers and practitioners in the field of talking head generation. For the complete survey, code, and curated resource list, visit our GitHub repository: https://github.com/VineetKumarRakesh/thg.
format Preprint
id arxiv_https___arxiv_org_abs_2507_02900
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
Rakesh, Vineet Kumar
Mazumdar, Soumya
Maity, Research Pratim
Pal, Sarbajit
Das, Amitabha
Samanta, Tapas
Computer Vision and Pattern Recognition
Artificial Intelligence
Graphics
Human-Computer Interaction
Multimedia
Talking Head Generation (THG) has emerged as a transformative technology in computer vision, enabling the synthesis of realistic human faces synchronized with image, audio, text, or video inputs. This paper provides a comprehensive review of methodologies and frameworks for talking head generation, categorizing approaches into 2D--based, 3D--based, Neural Radiance Fields (NeRF)--based, diffusion--based, parameter-driven techniques and many other techniques. It evaluates algorithms, datasets, and evaluation metrics while highlighting advancements in perceptual realism and technical efficiency critical for applications such as digital avatars, video dubbing, ultra-low bitrate video conferencing, and online education. The study identifies challenges such as reliance on pre--trained models, extreme pose handling, multilingual synthesis, and temporal consistency. Future directions include modular architectures, multilingual datasets, hybrid models blending pre--trained and task-specific layers, and innovative loss functions. By synthesizing existing research and exploring emerging trends, this paper aims to provide actionable insights for researchers and practitioners in the field of talking head generation. For the complete survey, code, and curated resource list, visit our GitHub repository: https://github.com/VineetKumarRakesh/thg.
title Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
topic Computer Vision and Pattern Recognition
Artificial Intelligence
Graphics
Human-Computer Interaction
Multimedia
url https://arxiv.org/abs/2507.02900