Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mariotte, Théo, Larcher, Anthony, Montrésor, Silvio, Thomas, Jean-Hugh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
par: Mariotte, Theo, et autres
Publié: (2024)
par: Mariotte, Theo, et autres
Publié: (2024)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
par: Perera, David, et autres
Publié: (2024)
par: Perera, David, et autres
Publié: (2024)
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
par: Chen, Xinhui, et autres
Publié: (2021)
par: Chen, Xinhui, et autres
Publié: (2021)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024)
par: Pálka, Petr, et autres
Publié: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
Do we really need Self-Attention for Streaming Automatic Speech Recognition?
par: Dkhissi, Youness, et autres
Publié: (2026)
par: Dkhissi, Youness, et autres
Publié: (2026)
Automatic Voice Identification after Speech Resynthesis using PPG
par: Gaudier, Thibault, et autres
Publié: (2024)
par: Gaudier, Thibault, et autres
Publié: (2024)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
par: Wang, Dongmei, et autres
Publié: (2023)
par: Wang, Dongmei, et autres
Publié: (2023)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Single-Microphone Speaker Separation and Voice Activity Detection in Noisy and Reverberant Environments
par: Opochinsky, Renana, et autres
Publié: (2024)
par: Opochinsky, Renana, et autres
Publié: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
par: Zhang, Yuewei, et autres
Publié: (2025)
par: Zhang, Yuewei, et autres
Publié: (2025)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Explainable by-design Audio Segmentation through Non-Negative Matrix Factorization and Probing
par: Lebourdais, Martin, et autres
Publié: (2024)
par: Lebourdais, Martin, et autres
Publié: (2024)
Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
RADE: A Neural Codec for Transmitting Speech over HF Radio Channels
par: Rowe, David, et autres
Publié: (2025)
par: Rowe, David, et autres
Publié: (2025)
Adaptive Central Frequencies Locally Competitive Algorithm for Speech
par: Bahadi, Soufiyan, et autres
Publié: (2025)
par: Bahadi, Soufiyan, et autres
Publié: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025)
par: Zeng, Bang, et autres
Publié: (2025)
Amplifying Artifacts with Speech Enhancement in Voice Anti-spoofing
par: Trachu, Thanapat, et autres
Publié: (2025)
par: Trachu, Thanapat, et autres
Publié: (2025)
Speech Synthesis along Perceptual Voice Quality Dimensions
par: Rautenberg, Frederik, et autres
Publié: (2025)
par: Rautenberg, Frederik, et autres
Publié: (2025)
Efficient Sparse Coding with the Adaptive Locally Competitive Algorithm for Speech Classification
par: Bahadi, Soufiyan, et autres
Publié: (2024)
par: Bahadi, Soufiyan, et autres
Publié: (2024)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024)
par: Li, Xuyuan, et autres
Publié: (2024)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
par: Bargum, Anders R., et autres
Publié: (2024)
par: Bargum, Anders R., et autres
Publié: (2024)
Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM
par: Sun, Zhaokai, et autres
Publié: (2025)
par: Sun, Zhaokai, et autres
Publié: (2025)
Perturbed Public Voices (P$^{2}$V): A Dataset for Robust Audio Deepfake Detection
par: Gao, Chongyang, et autres
Publié: (2025)
par: Gao, Chongyang, et autres
Publié: (2025)
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
An Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems
par: Zhang, You, et autres
Publié: (2021)
par: Zhang, You, et autres
Publié: (2021)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
par: Byun, Kyungguen, et autres
Publié: (2024)
par: Byun, Kyungguen, et autres
Publié: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
Loudspeaker Beamforming to Enhance Speech Recognition Performance of Voice Driven Applications
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
par: Kirdey, Stanislav
Publié: (2025)
par: Kirdey, Stanislav
Publié: (2025)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
par: Fan, Cunhang, et autres
Publié: (2023)
par: Fan, Cunhang, et autres
Publié: (2023)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Documents similaires
-
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
par: Mariotte, Theo, et autres
Publié: (2024) -
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
par: Perera, David, et autres
Publié: (2024) -
UR Channel-Robust Synthetic Speech Detection System for ASVspoof 2021
par: Chen, Xinhui, et autres
Publié: (2021) -
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024) -
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)