Text-To-Speech Synthesis In The Wild
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jung, Jee-weon, Zhang, Wangyou, Maiti, Soumi, Wu, Yihan, Wang, Xin, Kim, Ji-Hoon, Matsunaga, Yuta, Um, Seyun, Tian, Jinchuan, Shim, Hye-jin, Evans, Nicholas, Chung, Joon Son, Takamichi, Shinnosuke, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
par: Saeki, Takaaki, et autres
Publié: (2024)
par: Saeki, Takaaki, et autres
Publié: (2024)
WildSpoof Challenge Evaluation Plan
par: Wu, Yihan, et autres
Publié: (2025)
par: Wu, Yihan, et autres
Publié: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
par: Shim, Hye-jin, et autres
Publié: (2024)
par: Shim, Hye-jin, et autres
Publié: (2024)
To what extent can ASV systems naturally defend against spoofing attacks?
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023)
par: Maiti, Soumi, et autres
Publié: (2023)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
TMT: Tri-Modal Translation between Speech, Image, and Text by Processing Different Modalities as Different Languages
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
a-DCF: an architecture agnostic metric with application to spoofing-robust speaker verification
par: Shim, Hye-jin, et autres
Publié: (2024)
par: Shim, Hye-jin, et autres
Publié: (2024)
Who Finds This Voice Attractive? A Large-Scale Experiment Using In-the-Wild Data
par: Suda, Hitoshi, et autres
Publié: (2024)
par: Suda, Hitoshi, et autres
Publié: (2024)
Geolocation-Aware Robust Spoken Language Identification
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
Token-based Attractors and Cross-attention in Spoof Diarization
par: Koo, Kyo-Won, et autres
Publié: (2025)
par: Koo, Kyo-Won, et autres
Publié: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
UniCoM: A Universal Code-Switching Speech Generator
par: Lee, Sangmin, et autres
Publié: (2025)
par: Lee, Sangmin, et autres
Publié: (2025)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
YODAS: Youtube-Oriented Dataset for Audio and Speech
par: Li, Xinjian, et autres
Publié: (2024)
par: Li, Xinjian, et autres
Publié: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
par: Nam, KiHyun, et autres
Publié: (2024)
par: Nam, KiHyun, et autres
Publié: (2024)
SpeechMLC: Speech Multi-label Classification
par: Kim, Miseul, et autres
Publié: (2025)
par: Kim, Miseul, et autres
Publié: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data
par: Lu, Yichen, et autres
Publié: (2024)
par: Lu, Yichen, et autres
Publié: (2024)
Context-Driven Dynamic Pruning for Large Speech Foundation Models
par: Someki, Masao, et autres
Publié: (2025)
par: Someki, Masao, et autres
Publié: (2025)
ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
AugSumm: towards generalizable speech summarization using synthetic labels from large language model
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
par: Mishra, Jagabandhu, et autres
Publié: (2025)
par: Mishra, Jagabandhu, et autres
Publié: (2025)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
par: Suda, Hitoshi, et autres
Publié: (2025)
par: Suda, Hitoshi, et autres
Publié: (2025)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
Toward Universal Speech Enhancement for Diverse Input Conditions
par: Zhang, Wangyou, et autres
Publié: (2023)
par: Zhang, Wangyou, et autres
Publié: (2023)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
Documents similaires
-
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024) -
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
par: Saeki, Takaaki, et autres
Publié: (2024) -
WildSpoof Challenge Evaluation Plan
par: Wu, Yihan, et autres
Publié: (2025) -
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024) -
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
par: Shim, Hye-jin, et autres
Publié: (2024)