StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Min, Dongchan, Song, Minyoung, Ko, Eunji, Hwang, Sung Ju |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
par: Cao, Yuqin, et autres
Publié: (2024)
par: Cao, Yuqin, et autres
Publié: (2024)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
par: Eliav, Amit, et autres
Publié: (2024)
par: Eliav, Amit, et autres
Publié: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
par: Salaj, Ina, et autres
Publié: (2025)
par: Salaj, Ina, et autres
Publié: (2025)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
par: Aris, William, et autres
Publié: (2023)
par: Aris, William, et autres
Publié: (2023)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
par: Mingote, Victoria, et autres
Publié: (2024)
par: Mingote, Victoria, et autres
Publié: (2024)
DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming
par: Wen, Shuide, et autres
Publié: (2026)
par: Wen, Shuide, et autres
Publié: (2026)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
BUT System Description for CHiME-9 MCoRec Challenge
par: Klement, Dominik, et autres
Publié: (2026)
par: Klement, Dominik, et autres
Publié: (2026)
Bounds on Agreement between Subjective and Objective Measurements
par: Pieper, Jaden, et autres
Publié: (2026)
par: Pieper, Jaden, et autres
Publié: (2026)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
par: Yue, Xianghu, et autres
Publié: (2024)
par: Yue, Xianghu, et autres
Publié: (2024)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
par: Kim, Sungnyun, et autres
Publié: (2024)
par: Kim, Sungnyun, et autres
Publié: (2024)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
par: Farhadipour, Aref, et autres
Publié: (2025)
par: Farhadipour, Aref, et autres
Publié: (2025)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
par: Zhou, Huali, et autres
Publié: (2024)
par: Zhou, Huali, et autres
Publié: (2024)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
par: Park, Jay, et autres
Publié: (2025)
par: Park, Jay, et autres
Publié: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
par: Kossi, Koffi, et autres
Publié: (2024)
par: Kossi, Koffi, et autres
Publié: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Multimodal sensor fusion for real-time location-dependent defect detection in laser-directed energy deposition
par: Chen, Lequn, et autres
Publié: (2023)
par: Chen, Lequn, et autres
Publié: (2023)
Spatial and Semantic Embedding Integration for Stereo Sound Event Localization and Detection in Regular Videos
par: Berghi, Davide, et autres
Publié: (2025)
par: Berghi, Davide, et autres
Publié: (2025)
Event2Audio: Event-Based Optical Vibration Sensing
par: Cai, Mingxuan, et autres
Publié: (2025)
par: Cai, Mingxuan, et autres
Publié: (2025)
Listening without Looking: Modality Bias in Audio-Visual Captioning
par: Ishikawa, Yuchi, et autres
Publié: (2025)
par: Ishikawa, Yuchi, et autres
Publié: (2025)
Spoken question answering for visual queries
par: Shabtay, Nimrod, et autres
Publié: (2025)
par: Shabtay, Nimrod, et autres
Publié: (2025)
RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned Prior
par: Lee, Ching-Hua, et autres
Publié: (2025)
par: Lee, Ching-Hua, et autres
Publié: (2025)
Efficient Test-Time Adaptation through Latent Subspace Coefficients Search
par: Luo, Xinyu, et autres
Publié: (2025)
par: Luo, Xinyu, et autres
Publié: (2025)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
par: Ragano, Alessandro, et autres
Publié: (2024)
par: Ragano, Alessandro, et autres
Publié: (2024)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
par: Buitrago, Pol, et autres
Publié: (2026)
par: Buitrago, Pol, et autres
Publié: (2026)
A Smart-Glasses for Emergency Medical Services via Multimodal Multitask Learning
par: Jin, Liuyi, et autres
Publié: (2025)
par: Jin, Liuyi, et autres
Publié: (2025)
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
par: Yeo, Jeong Hun, et autres
Publié: (2023)
par: Yeo, Jeong Hun, et autres
Publié: (2023)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation
par: Chen, Jiajun, et autres
Publié: (2023)
par: Chen, Jiajun, et autres
Publié: (2023)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)
par: Praveen, R. Gnana, et autres
Publié: (2021)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
par: Jang, Youngjoon, et autres
Publié: (2024)
par: Jang, Youngjoon, et autres
Publié: (2024)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
par: Wen, Liuyuan
Publié: (2024)
par: Wen, Liuyuan
Publié: (2024)
ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video
par: Berghi, Davide, et autres
Publié: (2026)
par: Berghi, Davide, et autres
Publié: (2026)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
par: Park, Se Jin, et autres
Publié: (2023)
par: Park, Se Jin, et autres
Publié: (2023)
Documents similaires
-
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
par: Cao, Yuqin, et autres
Publié: (2024) -
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
par: Eliav, Amit, et autres
Publié: (2024) -
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
par: Salaj, Ina, et autres
Publié: (2025) -
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
par: Aris, William, et autres
Publié: (2023) -
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
par: Yang, Wenhao, et autres
Publié: (2025)