Noise-Robust Target-Speaker Voice Activity Detection Through Self-Supervised Pretraining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bovbjerg, Holger Severin, Østergaard, Jan, Jensen, Jesper, Tan, Zheng-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-supervised Pretraining for Robust Personalized Voice Activity Detection in Adverse Conditions
par: Bovbjerg, Holger Severin, et autres
Publié: (2023)
par: Bovbjerg, Holger Severin, et autres
Publié: (2023)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
par: Bovbjerg, Holger Severin, et autres
Publié: (2025)
par: Bovbjerg, Holger Severin, et autres
Publié: (2025)
Noise-Robust Keyword Spotting through Self-supervised Pretraining
par: Mørk, Jacob, et autres
Publié: (2024)
par: Mørk, Jacob, et autres
Publié: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)
par: Niizumi, Daisuke, et autres
Publié: (2026)
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
par: Li, Haowen, et autres
Publié: (2025)
par: Li, Haowen, et autres
Publié: (2025)
Audio-based Kinship Verification Using Age Domain Conversion
par: Sun, Qiyang, et autres
Publié: (2024)
par: Sun, Qiyang, et autres
Publié: (2024)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
par: Bokaei, Mohammad, et autres
Publié: (2024)
par: Bokaei, Mohammad, et autres
Publié: (2024)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
xLSTM-SENet: xLSTM for Single-Channel Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
par: Cheripally, Sowmya
Publié: (2024)
par: Cheripally, Sowmya
Publié: (2024)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
par: Poltronieri, Andrea, et autres
Publié: (2024)
par: Poltronieri, Andrea, et autres
Publié: (2024)
Symbolic Audio Classification via Modal Decision Tree Learning
par: Marzano, Enrico, et autres
Publié: (2025)
par: Marzano, Enrico, et autres
Publié: (2025)
Joint Minimum Processing Beamforming and Near-end Listening Enhancement
par: Fuglsig, Andreas J., et autres
Publié: (2023)
par: Fuglsig, Andreas J., et autres
Publié: (2023)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
par: Wang, Dongmei, et autres
Publié: (2023)
par: Wang, Dongmei, et autres
Publié: (2023)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025)
par: Zeng, Bang, et autres
Publié: (2025)
Experimental Study: Enhancing Voice Spoofing Detection Models with wav2vec 2.0
par: Kang, Taein, et autres
Publié: (2024)
par: Kang, Taein, et autres
Publié: (2024)
Monaural Multi-Speaker Speech Separation Using Efficient Transformer Model
par: Rijal, S., et autres
Publié: (2023)
par: Rijal, S., et autres
Publié: (2023)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
par: Liu, Yucheng, et autres
Publié: (2025)
par: Liu, Yucheng, et autres
Publié: (2025)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
DINO-VITS: Data-Efficient Zero-Shot TTS with Self-Supervised Speaker Verification Loss for Noise Robustness
par: Pankov, Vikentii, et autres
Publié: (2023)
par: Pankov, Vikentii, et autres
Publié: (2023)
Investigating the Design Space of Diffusion Models for Speech Enhancement
par: Gonzalez, Philippe, et autres
Publié: (2023)
par: Gonzalez, Philippe, et autres
Publié: (2023)
Diffusion-Based Speech Enhancement in Matched and Mismatched Conditions Using a Heun-Based Sampler
par: Gonzalez, Philippe, et autres
Publié: (2023)
par: Gonzalez, Philippe, et autres
Publié: (2023)
Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection
par: Cao, Xinwei, et autres
Publié: (2026)
par: Cao, Xinwei, et autres
Publié: (2026)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
TuneGenie: Reasoning-based LLM agents for preferential music generation
par: Pandey, Amitesh, et autres
Publié: (2025)
par: Pandey, Amitesh, et autres
Publié: (2025)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
par: Nzeyimana, Antoine
Publié: (2023)
par: Nzeyimana, Antoine
Publié: (2023)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
par: McKinnon, Max, et autres
Publié: (2026)
par: McKinnon, Max, et autres
Publié: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Documents similaires
-
Self-supervised Pretraining for Robust Personalized Voice Activity Detection in Adverse Conditions
par: Bovbjerg, Holger Severin, et autres
Publié: (2023) -
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
par: Bovbjerg, Holger Severin, et autres
Publié: (2025) -
Noise-Robust Keyword Spotting through Self-supervised Pretraining
par: Mørk, Jacob, et autres
Publié: (2024) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026) -
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
par: Li, Haowen, et autres
Publié: (2025)