DarkStream: real-time speech anonymization with low latency
Fuente:
arXiv
Salvato in:
| Autori principali: | Quamer, Waris, Gutierrez-Osuna, Ricardo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
End-to-end streaming model for low-latency speech anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2024)
di: Quamer, Waris, et al.
Pubblicazione: (2024)
Disentangling segmental and prosodic factors to non-native speech comprehensibility
di: Quamer, Waris, et al.
Pubblicazione: (2024)
di: Quamer, Waris, et al.
Pubblicazione: (2024)
PHONOS: PHOnetic Neutralization for Online Streaming Applications
di: Quamer, Waris, et al.
Pubblicazione: (2026)
di: Quamer, Waris, et al.
Pubblicazione: (2026)
TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2026)
di: Quamer, Waris, et al.
Pubblicazione: (2026)
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
Perceptual implications of automatic anonymization in pathological speech
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2025)
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2025)
Introduction to speech recognition
di: Dauphin, Gabriel
Pubblicazione: (2024)
di: Dauphin, Gabriel
Pubblicazione: (2024)
Moshi: a speech-text foundation model for real-time dialogue
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
The evaluation of a code-switched Sepedi-English automatic speech recognition system
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
Speech foundation models in healthcare: Effect of layer selection on pathological speech feature prediction
di: Wiepert, Daniela A., et al.
Pubblicazione: (2024)
di: Wiepert, Daniela A., et al.
Pubblicazione: (2024)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
Self-supervised learning of speech representations with Dutch archival data
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
Navigating the Minefield of MT Beam Search in Cascaded Streaming Speech Translation
di: Rabatin, Rastislav, et al.
Pubblicazione: (2024)
di: Rabatin, Rastislav, et al.
Pubblicazione: (2024)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
di: Bai, Richard He, et al.
Pubblicazione: (2025)
di: Bai, Richard He, et al.
Pubblicazione: (2025)
Non-verbal information in spontaneous speech -- towards a new framework of analysis
di: Biron, Tirza, et al.
Pubblicazione: (2024)
di: Biron, Tirza, et al.
Pubblicazione: (2024)
Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR
di: Wu, Zelin, et al.
Pubblicazione: (2024)
di: Wu, Zelin, et al.
Pubblicazione: (2024)
WhisperRT -- Turning Whisper into a Causal Streaming Model
di: Krichli, Tomer, et al.
Pubblicazione: (2025)
di: Krichli, Tomer, et al.
Pubblicazione: (2025)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
di: Bai, Junwen, et al.
Pubblicazione: (2024)
di: Bai, Junwen, et al.
Pubblicazione: (2024)
IIITH-BUT system for IWSLT 2025 low-resource Bhojpuri to Hindi speech translation
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
A multilingual training strategy for low resource Text to Speech
di: Amalas, Asma, et al.
Pubblicazione: (2024)
di: Amalas, Asma, et al.
Pubblicazione: (2024)
Prominence-aware automatic speech recognition for conversational speech
di: Linke, Julian, et al.
Pubblicazione: (2025)
di: Linke, Julian, et al.
Pubblicazione: (2025)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
di: San, Nay, et al.
Pubblicazione: (2024)
di: San, Nay, et al.
Pubblicazione: (2024)
Two-component spatiotemporal template for activation-inhibition of speech in ECoG
di: Easthope, Eric
Pubblicazione: (2024)
di: Easthope, Eric
Pubblicazione: (2024)
Technical Report on classification of literature related to children speech disorder
di: Wang, Ziang, et al.
Pubblicazione: (2025)
di: Wang, Ziang, et al.
Pubblicazione: (2025)
More than words: Advancements and challenges in speech recognition for singing
di: Kruspe, Anna
Pubblicazione: (2024)
di: Kruspe, Anna
Pubblicazione: (2024)
End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
Developing multilingual speech synthesis system for Ojibwe, Mi'kmaq, and Maliseet
di: Wang, Shenran, et al.
Pubblicazione: (2025)
di: Wang, Shenran, et al.
Pubblicazione: (2025)
Target speaker anonymization in multi-speaker recordings
di: Tomashenko, Natalia, et al.
Pubblicazione: (2025)
di: Tomashenko, Natalia, et al.
Pubblicazione: (2025)
"KAN you hear me?" Exploring Kolmogorov-Arnold Networks for Spoken Language Understanding
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
Robust Unsupervised Adaptation of a Speech Recogniser Using Entropy Minimisation and Speaker Codes
di: van Dalen, Rogier C., et al.
Pubblicazione: (2025)
di: van Dalen, Rogier C., et al.
Pubblicazione: (2025)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
Mitigating Data Imbalance in Automated Speaking Assessment
di: Tsai, Fong-Chun, et al.
Pubblicazione: (2025)
di: Tsai, Fong-Chun, et al.
Pubblicazione: (2025)
Re-evaluating Minimum Bayes Risk Decoding for Automatic Speech Recognition
di: Jinnai, Yuu
Pubblicazione: (2025)
di: Jinnai, Yuu
Pubblicazione: (2025)
Scalable Frameworks for Real-World Audio-Visual Speech Recognition
di: Kim, Sungnyun
Pubblicazione: (2025)
di: Kim, Sungnyun
Pubblicazione: (2025)
Data-Centric Lessons To Improve Speech-Language Pretraining
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
di: Song, Yakun, et al.
Pubblicazione: (2025)
di: Song, Yakun, et al.
Pubblicazione: (2025)
Gender Bias in Instruction-Guided Speech Synthesis Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
Spoken Language Understanding on Unseen Tasks With In-Context Learning
di: Agrawal, Neeraj, et al.
Pubblicazione: (2025)
di: Agrawal, Neeraj, et al.
Pubblicazione: (2025)
Documenti analoghi
-
End-to-end streaming model for low-latency speech anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2024) -
Disentangling segmental and prosodic factors to non-native speech comprehensibility
di: Quamer, Waris, et al.
Pubblicazione: (2024) -
PHONOS: PHOnetic Neutralization for Online Streaming Applications
di: Quamer, Waris, et al.
Pubblicazione: (2026) -
TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2026) -
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)