Universal Speech Content Factorization
Fuente:
arXiv
Salvato in:
| Autori principali: | Xinyuan, Henry Li, Cai, Zexin, Zhang, Lin, García-Perera, Leibny Paola, Sisman, Berrak, Khudanpur, Sanjeev, Andrews, Nicholas, Wiesner, Matthew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)
di: Garg, Ashi, et al.
Pubblicazione: (2025)
Can LLMs Help Localize Fake Words in Partially Fake Speech?
di: Zhang, Lin, et al.
Pubblicazione: (2026)
di: Zhang, Lin, et al.
Pubblicazione: (2026)
Integrated Spoofing-Robust Automatic Speaker Verification via a Three-Class Formulation and LLR
di: Tan, Kai, et al.
Pubblicazione: (2026)
di: Tan, Kai, et al.
Pubblicazione: (2026)
On Speaker Attribution with SURT
di: Raj, Desh, et al.
Pubblicazione: (2024)
di: Raj, Desh, et al.
Pubblicazione: (2024)
Rapidly Adapting to New Voice Spoofing: Few-Shot Detection of Synthesized Speech Under Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)
di: Garg, Ashi, et al.
Pubblicazione: (2025)
Scalable Controllable Accented TTS
di: Xinyuan, Henry Li, et al.
Pubblicazione: (2025)
di: Xinyuan, Henry Li, et al.
Pubblicazione: (2025)
GenVC: Self-Supervised Zero-Shot Voice Conversion
di: Cai, Zexin, et al.
Pubblicazione: (2025)
di: Cai, Zexin, et al.
Pubblicazione: (2025)
Privacy versus Emotion Preservation Trade-offs in Emotion-Preserving Speaker Anonymization
di: Cai, Zexin, et al.
Pubblicazione: (2024)
di: Cai, Zexin, et al.
Pubblicazione: (2024)
HLTCOE JHU Submission to the Voice Privacy Challenge 2024
di: Xinyuan, Henry Li, et al.
Pubblicazione: (2024)
di: Xinyuan, Henry Li, et al.
Pubblicazione: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2026)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2026)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
di: Lam, Perry, et al.
Pubblicazione: (2022)
di: Lam, Perry, et al.
Pubblicazione: (2022)
CASPER: A Large Scale Spontaneous Speech Dataset
di: Xiao, Cihan, et al.
Pubblicazione: (2025)
di: Xiao, Cihan, et al.
Pubblicazione: (2025)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
di: Hussein, Amir, et al.
Pubblicazione: (2025)
di: Hussein, Amir, et al.
Pubblicazione: (2025)
Modeling Overlapped Speech with Shuffles
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2024)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2024)
Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2023)
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2023)
Unsupervised Speech Enhancement using Data-defined Priors
di: Klement, Dominik, et al.
Pubblicazione: (2025)
di: Klement, Dominik, et al.
Pubblicazione: (2025)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024)
di: Du, Zongyang, et al.
Pubblicazione: (2024)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
di: Lee, Philip H., et al.
Pubblicazione: (2024)
di: Lee, Philip H., et al.
Pubblicazione: (2024)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
di: Jawaid, Ahad, et al.
Pubblicazione: (2024)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2024)
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2024)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Adversarial Attacks and Defenses for Speech Recognition Systems
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
SpatialEmb: Extract and Encode Spatial Information for 1-Stage Multi-channel Multi-speaker ASR on Arbitrary Microphone Arrays
di: Shao, Yiwen, et al.
Pubblicazione: (2026)
di: Shao, Yiwen, et al.
Pubblicazione: (2026)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
Can Emotion Fool Anti-spoofing?
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2025)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
di: Gong, Xun, et al.
Pubblicazione: (2024)
di: Gong, Xun, et al.
Pubblicazione: (2024)
Universal Score-based Speech Enhancement with High Content Preservation
di: Scheibler, Robin, et al.
Pubblicazione: (2024)
di: Scheibler, Robin, et al.
Pubblicazione: (2024)
Versatile audio-visual learning for emotion recognition
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
Self-supervised Reflective Learning through Self-distillation and Online Clustering for Speaker Representation Learning
di: Cai, Danwei, et al.
Pubblicazione: (2024)
di: Cai, Danwei, et al.
Pubblicazione: (2024)
ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2026)
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2026)
SecureSpeech: Prompt-based Speaker and Content Protection
di: Hui, Belinda Soh Hui, et al.
Pubblicazione: (2025)
di: Hui, Belinda Soh Hui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025) -
Can LLMs Help Localize Fake Words in Partially Fake Speech?
di: Zhang, Lin, et al.
Pubblicazione: (2026) -
Integrated Spoofing-Robust Automatic Speaker Verification via a Three-Class Formulation and LLR
di: Tan, Kai, et al.
Pubblicazione: (2026) -
On Speaker Attribution with SURT
di: Raj, Desh, et al.
Pubblicazione: (2024) -
Rapidly Adapting to New Voice Spoofing: Few-Shot Detection of Synthesized Speech Under Distribution Shifts
di: Garg, Ashi, et al.
Pubblicazione: (2025)