NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Zongyang, Chandra, Shreeram Suresh, Ulgen, Ismail Rasim, Mahapatra, Aurosweta, Salman, Ali N., Busso, Carlos, Sisman, Berrak |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline
par: Salman, Ali N., et autres
Publié: (2024)
par: Salman, Ali N., et autres
Publié: (2024)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Can Emotion Fool Anti-spoofing?
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
par: Du, Zongyang, et autres
Publié: (2024)
par: Du, Zongyang, et autres
Publié: (2024)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
par: Mahapatra, Aurosweta, et autres
Publié: (2026)
par: Mahapatra, Aurosweta, et autres
Publié: (2026)
Exploring speech style spaces with language models: Emotional TTS without emotion labels
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
Text-to-Speech for Unseen Speakers via Low-Complexity Discrete Unit-Based Frame Selection
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
par: Jawaid, Ahad, et autres
Publié: (2024)
par: Jawaid, Ahad, et autres
Publié: (2024)
Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection
par: Yeh, Hsiang-Chen, et autres
Publié: (2026)
par: Yeh, Hsiang-Chen, et autres
Publié: (2026)
Rethinking Speaker Embeddings for Speech Generation: Sub-Center Modeling for Capturing Intra-Speaker Diversity
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
par: Zhao, Xiutian, et autres
Publié: (2026)
par: Zhao, Xiutian, et autres
Publié: (2026)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2024)
par: Rajapakshe, Thejan, et autres
Publié: (2024)
Systematic FAIRness Assessment of Open Voice Biomarker Datasets for Mental Health and Neurodegenerative Diseases
par: Mahapatra, Ishaan, et autres
Publié: (2025)
par: Mahapatra, Ishaan, et autres
Publié: (2025)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
PromptEVC: Controllable Emotional Voice Conversion with Natural Language Prompts
par: Qi, Tianhua, et autres
Publié: (2025)
par: Qi, Tianhua, et autres
Publié: (2025)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
par: Xu, Rixi, et autres
Publié: (2026)
par: Xu, Rixi, et autres
Publié: (2026)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
par: Rajapakshe, Thejan, et autres
Publié: (2023)
par: Rajapakshe, Thejan, et autres
Publié: (2023)
The MSP-Podcast Corpus
par: Busso, Carlos, et autres
Publié: (2025)
par: Busso, Carlos, et autres
Publié: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Versatile audio-visual learning for emotion recognition
par: Goncalves, Lucas, et autres
Publié: (2023)
par: Goncalves, Lucas, et autres
Publié: (2023)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
par: Kameoka, Hirokazu, et autres
Publié: (2025)
par: Kameoka, Hirokazu, et autres
Publié: (2025)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
par: Kameoka, Hirokazu, et autres
Publié: (2020)
par: Kameoka, Hirokazu, et autres
Publié: (2020)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity
par: Qi, Tianhua, et autres
Publié: (2024)
par: Qi, Tianhua, et autres
Publié: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2026)
par: Wang, Zhichao, et autres
Publié: (2026)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
par: Chen, Meiying Melissa, et autres
Publié: (2025)
par: Chen, Meiying Melissa, et autres
Publié: (2025)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
par: Lam, Perry, et autres
Publié: (2022)
par: Lam, Perry, et autres
Publié: (2022)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
par: Kim, Heeseung, et autres
Publié: (2025)
par: Kim, Heeseung, et autres
Publié: (2025)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
par: Farhadipour, Aref, et autres
Publié: (2026)
par: Farhadipour, Aref, et autres
Publié: (2026)
Residual Speaker Representation for One-Shot Voice Conversion
par: Xu, Le, et autres
Publié: (2023)
par: Xu, Le, et autres
Publié: (2023)
Revolutionizing Personalized Voice Synthesis: The Journey towards Emotional and Individual Authenticity with DIVSE (Dynamic Individual Voice Synthesis Engine)
par: Shi, Fan
Publié: (2023)
par: Shi, Fan
Publié: (2023)
Documents similaires
-
Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline
par: Salman, Ali N., et autres
Publié: (2024) -
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025) -
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
par: Ulgen, Ismail Rasim, et autres
Publié: (2024) -
Can Emotion Fool Anti-spoofing?
par: Mahapatra, Aurosweta, et autres
Publié: (2025) -
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)