Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Minki, Han, Wooseok, Yang, Eunho |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
par: Kang, Fang, et autres
Publié: (2025)
par: Kang, Fang, et autres
Publié: (2025)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
par: Goncalves, Lucas, et autres
Publié: (2024)
par: Goncalves, Lucas, et autres
Publié: (2024)
Double Mixture: Towards Continual Event Detection from Speech
par: Kang, Jingqi, et autres
Publié: (2024)
par: Kang, Jingqi, et autres
Publié: (2024)
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
par: Ning, Jinzhong, et autres
Publié: (2025)
par: Ning, Jinzhong, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
par: Guan, Yiwen, et autres
Publié: (2025)
par: Guan, Yiwen, et autres
Publié: (2025)
Emotional Face-to-Speech
par: Ye, Jiaxin, et autres
Publié: (2025)
par: Ye, Jiaxin, et autres
Publié: (2025)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
Multi-modal Speech Transformer Decoders: When Do Multiple Modalities Improve Accuracy?
par: Guan, Yiwen, et autres
Publié: (2024)
par: Guan, Yiwen, et autres
Publié: (2024)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
par: Hegde, Sindhu, et autres
Publié: (2024)
par: Hegde, Sindhu, et autres
Publié: (2024)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
par: Li, Fengjin, et autres
Publié: (2025)
par: Li, Fengjin, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
par: Cui, Yang, et autres
Publié: (2025)
par: Cui, Yang, et autres
Publié: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
par: Shahin, Mostafa, et autres
Publié: (2025)
par: Shahin, Mostafa, et autres
Publié: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
par: Tan, Weiting, et autres
Publié: (2025)
par: Tan, Weiting, et autres
Publié: (2025)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
par: Ye, Zhen, et autres
Publié: (2025)
par: Ye, Zhen, et autres
Publié: (2025)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
par: Li, Cancan, et autres
Publié: (2025)
par: Li, Cancan, et autres
Publié: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
par: Bhagtani, Kratika, et autres
Publié: (2024)
par: Bhagtani, Kratika, et autres
Publié: (2024)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
par: Sun, Yujia, et autres
Publié: (2024)
par: Sun, Yujia, et autres
Publié: (2024)
Documents similaires
-
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024) -
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
par: Kang, Fang, et autres
Publié: (2025) -
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
par: Goncalves, Lucas, et autres
Publié: (2024) -
Double Mixture: Towards Continual Event Detection from Speech
par: Kang, Jingqi, et autres
Publié: (2024) -
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
par: Min, Anna, et autres
Publié: (2025)