HiSSNet: Sound Event Detection and Speaker Identification via Hierarchical Prototypical Networks for Low-Resource Headphones
Fuente:
arXiv
Salvato in:
| Autori principali: | Shashaank, N, Banar, Berker, Izadi, Mohammad Rasool, Kemmerer, Jeremy, Zhang, Shuo, Huang, Chuan-Che |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
"It is okay to be uncommon": Quantizing Sound Event Detection Networks on Hardware Accelerators with Uncommon Sub-Byte Support
di: Wu, Yushu, et al.
Pubblicazione: (2024)
di: Wu, Yushu, et al.
Pubblicazione: (2024)
Improving Music Source Separation with Diffusion and Consistency Refinement
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Exploring Variational Auto-Encoder Architectures, Configurations, and Datasets for Generative Music Explainable AI
di: Bryan-Kinns, Nick, et al.
Pubblicazione: (2023)
di: Bryan-Kinns, Nick, et al.
Pubblicazione: (2023)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Hierarchical Pooling Structure for Weakly Labeled Sound Event Detection
di: He, Ke-Xin, et al.
Pubblicazione: (2019)
di: He, Ke-Xin, et al.
Pubblicazione: (2019)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Prototype and Instance Contrastive Learning for Unsupervised Domain Adaptation in Speaker Verification
di: Huang, Wen, et al.
Pubblicazione: (2024)
di: Huang, Wen, et al.
Pubblicazione: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
FSD50K-Solo: Automated Curation of Single-Source Sound Events
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Multi-Label Training for Text-Independent Speaker Identification
di: Xue, Yuqi
Pubblicazione: (2022)
di: Xue, Yuqi
Pubblicazione: (2022)
Sound Event Bounding Boxes
di: Ebbers, Janek, et al.
Pubblicazione: (2024)
di: Ebbers, Janek, et al.
Pubblicazione: (2024)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
di: Imoto, Keisuke
Pubblicazione: (2025)
di: Imoto, Keisuke
Pubblicazione: (2025)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
Frequency Dynamic Convolutions for Sound Event Detection
di: Nam, Hyeonuk
Pubblicazione: (2025)
di: Nam, Hyeonuk
Pubblicazione: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers
di: Fu, Linya, et al.
Pubblicazione: (2025)
di: Fu, Linya, et al.
Pubblicazione: (2025)
Zero- and Few-shot Sound Event Localization and Detection
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
Towards Understanding of Frequency Dependence on Sound Event Detection
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
Sound Event Detection with Boundary-Aware Optimization and Inference
di: Schmid, Florian, et al.
Pubblicazione: (2026)
di: Schmid, Florian, et al.
Pubblicazione: (2026)
ChildAugment: Data Augmentation Methods for Zero-Resource Children's Speaker Verification
di: Singh, Vishwanath Pratap, et al.
Pubblicazione: (2024)
di: Singh, Vishwanath Pratap, et al.
Pubblicazione: (2024)
JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Ensemble Confidence Calibration for Sound Event Detection in Open-environment
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
Learning Emotion-Invariant Speaker Representations for Speaker Verification
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
"It is okay to be uncommon": Quantizing Sound Event Detection Networks on Hardware Accelerators with Uncommon Sub-Byte Support
di: Wu, Yushu, et al.
Pubblicazione: (2024) -
Improving Music Source Separation with Diffusion and Consistency Refinement
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024) -
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024) -
Exploring Variational Auto-Encoder Architectures, Configurations, and Datasets for Generative Music Explainable AI
di: Bryan-Kinns, Nick, et al.
Pubblicazione: (2023) -
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)