End-to-end streaming model for low-latency speech anonymization
Fuente:
arXiv
Salvato in:
| Autori principali: | Quamer, Waris, Gutierrez-Osuna, Ricardo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DarkStream: real-time speech anonymization with low latency
di: Quamer, Waris, et al.
Pubblicazione: (2025)
di: Quamer, Waris, et al.
Pubblicazione: (2025)
Disentangling segmental and prosodic factors to non-native speech comprehensibility
di: Quamer, Waris, et al.
Pubblicazione: (2024)
di: Quamer, Waris, et al.
Pubblicazione: (2024)
PHONOS: PHOnetic Neutralization for Online Streaming Applications
di: Quamer, Waris, et al.
Pubblicazione: (2026)
di: Quamer, Waris, et al.
Pubblicazione: (2026)
TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2026)
di: Quamer, Waris, et al.
Pubblicazione: (2026)
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
Speech foundation models in healthcare: Effect of layer selection on pathological speech feature prediction
di: Wiepert, Daniela A., et al.
Pubblicazione: (2024)
di: Wiepert, Daniela A., et al.
Pubblicazione: (2024)
Perceptual implications of automatic anonymization in pathological speech
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2025)
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2025)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
di: C, Anandh, et al.
Pubblicazione: (2025)
di: C, Anandh, et al.
Pubblicazione: (2025)
Introduction to speech recognition
di: Dauphin, Gabriel
Pubblicazione: (2024)
di: Dauphin, Gabriel
Pubblicazione: (2024)
Towards End-to-End Spoken Grammatical Error Correction
di: Bannò, Stefano, et al.
Pubblicazione: (2023)
di: Bannò, Stefano, et al.
Pubblicazione: (2023)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2021)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2021)
The evaluation of a code-switched Sepedi-English automatic speech recognition system
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
A light-weight and efficient punctuation and word casing prediction model for on-device streaming ASR
di: You, Jian, et al.
Pubblicazione: (2024)
di: You, Jian, et al.
Pubblicazione: (2024)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
Self-supervised learning of speech representations with Dutch archival data
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
di: Vaessen, Nik, et al.
Pubblicazione: (2025)
End-to-End Spoken Grammatical Error Correction
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR
di: Huybrechts, Goeric, et al.
Pubblicazione: (2023)
di: Huybrechts, Goeric, et al.
Pubblicazione: (2023)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
Non-verbal information in spontaneous speech -- towards a new framework of analysis
di: Biron, Tirza, et al.
Pubblicazione: (2024)
di: Biron, Tirza, et al.
Pubblicazione: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
Optimizing Byte-level Representation for End-to-end ASR
di: Hsiao, Roger, et al.
Pubblicazione: (2024)
di: Hsiao, Roger, et al.
Pubblicazione: (2024)
Moshi: a speech-text foundation model for real-time dialogue
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
di: Défossez, Alexandre, et al.
Pubblicazione: (2024)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
Data Augmentation for End-to-end Code-switching Speech Recognition
di: Du, Chenpeng, et al.
Pubblicazione: (2020)
di: Du, Chenpeng, et al.
Pubblicazione: (2020)
asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
IIITH-BUT system for IWSLT 2025 low-resource Bhojpuri to Hindi speech translation
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
di: Akkiraju, Bhavana, et al.
Pubblicazione: (2025)
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
di: Hono, Yukiya, et al.
Pubblicazione: (2023)
di: Hono, Yukiya, et al.
Pubblicazione: (2023)
A multilingual training strategy for low resource Text to Speech
di: Amalas, Asma, et al.
Pubblicazione: (2024)
di: Amalas, Asma, et al.
Pubblicazione: (2024)
BabySLM: language-acquisition-friendly benchmark of self-supervised spoken language models
di: Lavechin, Marvin, et al.
Pubblicazione: (2023)
di: Lavechin, Marvin, et al.
Pubblicazione: (2023)
An Automated End-to-End Open-Source Software for High-Quality Text-to-Speech Dataset Generation
di: Gunduz, Ahmet, et al.
Pubblicazione: (2024)
di: Gunduz, Ahmet, et al.
Pubblicazione: (2024)
On the social bias of speech self-supervised models
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
emg2speech: Synthesizing speech from electromyography using self-supervised speech models
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
di: Gowda, Harshavardhana T., et al.
Pubblicazione: (2025)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
di: San, Nay, et al.
Pubblicazione: (2024)
di: San, Nay, et al.
Pubblicazione: (2024)
Prominence-aware automatic speech recognition for conversational speech
di: Linke, Julian, et al.
Pubblicazione: (2025)
di: Linke, Julian, et al.
Pubblicazione: (2025)
The Greek podcast corpus: Competitive speech models for low-resourced languages with weakly supervised data
di: Paraskevopoulos, Georgios, et al.
Pubblicazione: (2024)
di: Paraskevopoulos, Georgios, et al.
Pubblicazione: (2024)
Strategies for improving low resource speech to text translation relying on pre-trained ASR models
di: Kesiraju, Santosh, et al.
Pubblicazione: (2023)
di: Kesiraju, Santosh, et al.
Pubblicazione: (2023)
Documenti analoghi
-
DarkStream: real-time speech anonymization with low latency
di: Quamer, Waris, et al.
Pubblicazione: (2025) -
Disentangling segmental and prosodic factors to non-native speech comprehensibility
di: Quamer, Waris, et al.
Pubblicazione: (2024) -
PHONOS: PHOnetic Neutralization for Online Streaming Applications
di: Quamer, Waris, et al.
Pubblicazione: (2026) -
TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2026) -
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)