Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
Fuente:
arXiv
Salvato in:
| Autori principali: | Fujita, Kenichi, Sato, Hiroshi, Ashihara, Takanori, Kanagawa, Hiroki, Delcroix, Marc, Moriya, Takafumi, Ijima, Yusuke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
di: Ashihara, Takanori, et al.
Pubblicazione: (2023)
di: Ashihara, Takanori, et al.
Pubblicazione: (2023)
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
Investigation of Speaker Representation for Target-Speaker Speech Processing
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
Multi-interaction TTS toward professional recording reproduction
di: Kanagawa, Hiroki, et al.
Pubblicazione: (2025)
di: Kanagawa, Hiroki, et al.
Pubblicazione: (2025)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
Sustainable self-supervised learning for speech representations
di: Lugo, Luis, et al.
Pubblicazione: (2024)
di: Lugo, Luis, et al.
Pubblicazione: (2024)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
di: Matsuura, Kohei, et al.
Pubblicazione: (2024)
di: Matsuura, Kohei, et al.
Pubblicazione: (2024)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
Emergent morpho-phonological representations in self-supervised speech models
di: Gauthier, Jon, et al.
Pubblicazione: (2025)
di: Gauthier, Jon, et al.
Pubblicazione: (2025)
Applying LLMs for Rescoring N-best ASR Hypotheses of Casual Conversations: Effects of Domain Adaptation and Context Carry-over
di: Ogawa, Atsunori, et al.
Pubblicazione: (2024)
di: Ogawa, Atsunori, et al.
Pubblicazione: (2024)
Investigation for Relative Voice Impression Estimation
di: Fujita, Kenichi, et al.
Pubblicazione: (2026)
di: Fujita, Kenichi, et al.
Pubblicazione: (2026)
Towards generalisable and calibrated synthetic speech detection with self-supervised representations
di: Pascu, Octavian, et al.
Pubblicazione: (2023)
di: Pascu, Octavian, et al.
Pubblicazione: (2023)
Orthogonality and isotropy of speaker and phonetic information in self-supervised speech representations
di: Mohamed, Mukhtar, et al.
Pubblicazione: (2024)
di: Mohamed, Mukhtar, et al.
Pubblicazione: (2024)
emg2speech: Synthesizing speech from electromyography using self-supervised speech models
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
Probing Self-supervised Learning Models with Target Speech Extraction
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
On the social bias of speech self-supervised models
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
AfriHuBERT: A self-supervised speech representation model for African languages
di: Alabi, Jesujoba O., et al.
Pubblicazione: (2024)
di: Alabi, Jesujoba O., et al.
Pubblicazione: (2024)
Do self-supervised speech and language models extract similar representations as human brain?
di: Chen, Peili, et al.
Pubblicazione: (2023)
di: Chen, Peili, et al.
Pubblicazione: (2023)
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
Acoustic-to-articulatory inversion for dysarthric speech: Are pre-trained self-supervised representations favorable?
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2023)
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2023)
Voice Impression Control in Zero-Shot TTS
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
A unified front-end framework for English text-to-speech synthesis
di: Ying, Zelin, et al.
Pubblicazione: (2023)
di: Ying, Zelin, et al.
Pubblicazione: (2023)
Text to speech synthesis
di: s, Harini, et al.
Pubblicazione: (2024)
di: s, Harini, et al.
Pubblicazione: (2024)
Audio-conditioned phonemic and prosodic annotation for building text-to-speech models from unlabeled speech data
di: Shirahata, Yuma, et al.
Pubblicazione: (2024)
di: Shirahata, Yuma, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Frontend Token Enhancement for Token-Based Speech Recognition
di: Ashihara, Takanori, et al.
Pubblicazione: (2026)
di: Ashihara, Takanori, et al.
Pubblicazione: (2026)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Self-supervised learning of speech representations with Dutch archival data
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
di: Wang, Hsuan-Fu, et al.
Pubblicazione: (2024)
di: Wang, Hsuan-Fu, et al.
Pubblicazione: (2024)
Probing self-attention in self-supervised speech models for cross-linguistic differences
di: Gopinath, Sai, et al.
Pubblicazione: (2024)
di: Gopinath, Sai, et al.
Pubblicazione: (2024)
Data-driven grapheme-to-phoneme representations for a lexicon-free text-to-speech
di: Garg, Abhinav, et al.
Pubblicazione: (2024)
di: Garg, Abhinav, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
di: Fujita, Kenichi, et al.
Pubblicazione: (2024) -
What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis
di: Ashihara, Takanori, et al.
Pubblicazione: (2024) -
Generic Speech Enhancement with Self-Supervised Representation Space Loss
di: Sato, Hiroshi, et al.
Pubblicazione: (2025) -
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024) -
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)