Towards Speaker Identification with Minimal Dataset and Constrained Resources using 1D-Convolution Neural Network
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shahan, Irfan Nafiz, Auvi, Pulok Ahmed |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
par: Ahmed, Alabi, et autres
Publié: (2026)
par: Ahmed, Alabi, et autres
Publié: (2026)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation
par: Bartolo, Matthias
Publié: (2024)
par: Bartolo, Matthias
Publié: (2024)
Acoustic Identification of Ae. aegypti Mosquitoes using Smartphone Apps and Residual Convolutional Neural Networks
par: Paim, Kayuã Oleques, et autres
Publié: (2023)
par: Paim, Kayuã Oleques, et autres
Publié: (2023)
Disentangling Age and Identity with a Mutual Information Minimization Approach for Cross-Age Speaker Verification
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
Raw Audio Classification with Cosine Convolutional Neural Network (CosCovNN)
par: Haque, Kazi Nazmul, et autres
Publié: (2024)
par: Haque, Kazi Nazmul, et autres
Publié: (2024)
Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers
par: Salameh, Raghad, et autres
Publié: (2024)
par: Salameh, Raghad, et autres
Publié: (2024)
Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
par: Deschênes, Anthony, et autres
Publié: (2025)
par: Deschênes, Anthony, et autres
Publié: (2025)
Developing an Effective Training Dataset to Enhance the Performance of AI-based Speaker Separation Systems
par: Melhem, Rawad, et autres
Publié: (2024)
par: Melhem, Rawad, et autres
Publié: (2024)
Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
par: Zhao, Xufang, et autres
Publié: (2025)
par: Zhao, Xufang, et autres
Publié: (2025)
Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks
par: Atif, Youness
Publié: (2025)
par: Atif, Youness
Publié: (2025)
Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers
par: Iatariene, Taous, et autres
Publié: (2025)
par: Iatariene, Taous, et autres
Publié: (2025)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
Towards Low-Latency Tracking of Multiple Speakers With Short-Context Speaker Embeddings
par: Iatariene, Taous, et autres
Publié: (2025)
par: Iatariene, Taous, et autres
Publié: (2025)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
par: Ma, Yi, et autres
Publié: (2025)
par: Ma, Yi, et autres
Publié: (2025)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
par: Singh, Arshdeep, et autres
Publié: (2025)
par: Singh, Arshdeep, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
par: Liu, Bei, et autres
Publié: (2024)
par: Liu, Bei, et autres
Publié: (2024)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
par: Wang, Kexue, et autres
Publié: (2026)
par: Wang, Kexue, et autres
Publié: (2026)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
A Multi-task Learning Balanced Attention Convolutional Neural Network Model for Few-shot Underwater Acoustic Target Recognition
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices
par: Grau-Haro, Jordi, et autres
Publié: (2025)
par: Grau-Haro, Jordi, et autres
Publié: (2025)
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
par: Hwang, Injune, et autres
Publié: (2024)
par: Hwang, Injune, et autres
Publié: (2024)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
par: Li, Zhaoyang, et autres
Publié: (2025)
par: Li, Zhaoyang, et autres
Publié: (2025)
Explainable Attribute-Based Speaker Verification
par: Wu, Xiaoliang, et autres
Publié: (2024)
par: Wu, Xiaoliang, et autres
Publié: (2024)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
par: Emon, Jakaria Islam, et autres
Publié: (2025)
par: Emon, Jakaria Islam, et autres
Publié: (2025)
From Modular to End-to-End Speaker Diarization
par: Landini, Federico
Publié: (2024)
par: Landini, Federico
Publié: (2024)
Certification of Speaker Recognition Models to Additive Perturbations
par: Korzh, Dmitrii, et autres
Publié: (2024)
par: Korzh, Dmitrii, et autres
Publié: (2024)
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
par: Pacheco, Eduardo, et autres
Publié: (2025)
par: Pacheco, Eduardo, et autres
Publié: (2025)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
par: Huh, Jaesung, et autres
Publié: (2024)
par: Huh, Jaesung, et autres
Publié: (2024)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
par: Singh, Prachi, et autres
Publié: (2024)
par: Singh, Prachi, et autres
Publié: (2024)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
par: Sheng, Zhengyan, et autres
Publié: (2025)
par: Sheng, Zhengyan, et autres
Publié: (2025)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Evaluating Speaker Identity Coding in Self-supervised Models and Humans
par: Elbanna, Gasser
Publié: (2024)
par: Elbanna, Gasser
Publié: (2024)
BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset
par: Fahad, Istiaq Ahmed, et autres
Publié: (2025)
par: Fahad, Istiaq Ahmed, et autres
Publié: (2025)
Towards Improving Speaker Distance Estimation through Generative Impulse Response Augmentation
par: Ratnarajah, Anton, et autres
Publié: (2026)
par: Ratnarajah, Anton, et autres
Publié: (2026)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
par: Ji, Zhoulin, et autres
Publié: (2024)
par: Ji, Zhoulin, et autres
Publié: (2024)
Documents similaires
-
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
par: Ahmed, Alabi, et autres
Publié: (2026) -
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024) -
Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation
par: Bartolo, Matthias
Publié: (2024) -
Acoustic Identification of Ae. aegypti Mosquitoes using Smartphone Apps and Residual Convolutional Neural Networks
par: Paim, Kayuã Oleques, et autres
Publié: (2023) -
Disentangling Age and Identity with a Mutual Information Minimization Approach for Cross-Age Speaker Verification
par: Zhang, Fengrun, et autres
Publié: (2024)