ICSD: An Open-source Dataset for Infant Cry and Snoring Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Qingyu, Song, Longfei, Xu, Dongxing, Long, Yanhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
por: Chen, Shuangyuan, et al.
Publicado: (2025)
por: Chen, Shuangyuan, et al.
Publicado: (2025)
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
por: Lee, Kyunghun, et al.
Publicado: (2024)
por: Lee, Kyunghun, et al.
Publicado: (2024)
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
por: Mei, Yuxiang, et al.
Publicado: (2026)
por: Mei, Yuxiang, et al.
Publicado: (2026)
SimuSOE: A Simulated Snoring Dataset for Obstructive Sleep Apnea-Hypopnea Syndrome Evaluation during Wakefulness
por: Lin, Jie, et al.
Publicado: (2024)
por: Lin, Jie, et al.
Publicado: (2024)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
por: Budaghyan, David, et al.
Publicado: (2023)
por: Budaghyan, David, et al.
Publicado: (2023)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
por: Zheng, Yuang, et al.
Publicado: (2026)
por: Zheng, Yuang, et al.
Publicado: (2026)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
LMU-Based Sequential Learning and Posterior Ensemble Fusion for Cross-Domain Infant Cry Classification
por: Jazaeri, Niloofar, et al.
Publicado: (2026)
por: Jazaeri, Niloofar, et al.
Publicado: (2026)
A Recall-First CNN for Sleep Apnea Screening from Snoring Audio
por: Mallick, Anushka, et al.
Publicado: (2025)
por: Mallick, Anushka, et al.
Publicado: (2025)
SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios
por: Yang, Yiming, et al.
Publicado: (2026)
por: Yang, Yiming, et al.
Publicado: (2026)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
por: Cui, Hanfang, et al.
Publicado: (2025)
por: Cui, Hanfang, et al.
Publicado: (2025)
Robust One-step Speech Enhancement via Consistency Distillation
por: Xu, Liang, et al.
Publicado: (2025)
por: Xu, Liang, et al.
Publicado: (2025)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
por: Geng, Haopeng, et al.
Publicado: (2026)
por: Geng, Haopeng, et al.
Publicado: (2026)
InfantCryNet: A Data-driven Framework for Intelligent Analysis of Infant Cries
por: Hong, Mengze, et al.
Publicado: (2024)
por: Hong, Mengze, et al.
Publicado: (2024)
Advancing Speech Quality Assessment Through Scientific Challenges and Open-source Activities
por: Huang, Wen-Chin
Publicado: (2025)
por: Huang, Wen-Chin
Publicado: (2025)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
por: Huang, Wen-Chin, et al.
Publicado: (2025)
por: Huang, Wen-Chin, et al.
Publicado: (2025)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
por: Xu, Kai-Tuo, et al.
Publicado: (2025)
ASPED: An Audio Dataset for Detecting Pedestrians
por: Seshadri, Pavan, et al.
Publicado: (2023)
por: Seshadri, Pavan, et al.
Publicado: (2023)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
por: Tang, Yuxun, et al.
Publicado: (2024)
por: Tang, Yuxun, et al.
Publicado: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2025)
por: Dai, Yuhang, et al.
Publicado: (2025)
Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
por: Nakata, Wataru, et al.
Publicado: (2025)
por: Nakata, Wataru, et al.
Publicado: (2025)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
por: Delgado, Pablo M., et al.
Publicado: (2025)
por: Delgado, Pablo M., et al.
Publicado: (2025)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
Ensemble Confidence Calibration for Sound Event Detection in Open-environment
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
Leveraging Prompt Learning and Pause Encoding for Alzheimer's Disease Detection
por: Liu, Yin-Long, et al.
Publicado: (2024)
por: Liu, Yin-Long, et al.
Publicado: (2024)
SEABAD: A Tropical Bird Activity Detection Dataset for Passive Acoustic Monitoring
por: Zabidi, Muhammad Mun'im Ahmad, et al.
Publicado: (2026)
por: Zabidi, Muhammad Mun'im Ahmad, et al.
Publicado: (2026)
Multichannel blind speech source separation with a disjoint constraint source model
por: Wang, Jianyu, et al.
Publicado: (2024)
por: Wang, Jianyu, et al.
Publicado: (2024)
LEAD Dataset: How Can Labels for Sound Event Detection Vary Depending on Annotators?
por: Koga, Naoki, et al.
Publicado: (2024)
por: Koga, Naoki, et al.
Publicado: (2024)
ACMID: Automatic Curation of Musical Instrument Dataset for 7-Stem Music Source Separation
por: Yu, Ji, et al.
Publicado: (2025)
por: Yu, Ji, et al.
Publicado: (2025)
WildDESED: An LLM-Powered Dataset for Wild Domestic Environment Sound Event Detection System
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Perturbed Public Voices (P$^{2}$V): A Dataset for Robust Audio Deepfake Detection
por: Gao, Chongyang, et al.
Publicado: (2025)
por: Gao, Chongyang, et al.
Publicado: (2025)
Descriptor:: Extended-Length Audio Dataset for Synthetic Voice Detection and Speaker Recognition (ELAD-SVDSR)
por: Vijaykumar, Rahul, et al.
Publicado: (2025)
por: Vijaykumar, Rahul, et al.
Publicado: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
por: Lu, Wenhuan, et al.
Publicado: (2025)
por: Lu, Wenhuan, et al.
Publicado: (2025)
Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training
por: Feng, Jianyuan, et al.
Publicado: (2025)
por: Feng, Jianyuan, et al.
Publicado: (2025)
Independent low-rank matrix analysis based on the Sinkhorn divergence source model for blind source separation
por: Wang, Jianyu, et al.
Publicado: (2024)
por: Wang, Jianyu, et al.
Publicado: (2024)
Adaptive high-precision sound source localization at low frequencies based on convolutional neural network
por: Ma, Wenbo, et al.
Publicado: (2024)
por: Ma, Wenbo, et al.
Publicado: (2024)
PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2024)
por: Hu, Jinbo, et al.
Publicado: (2024)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
por: Comanducci, Luca, et al.
Publicado: (2024)
por: Comanducci, Luca, et al.
Publicado: (2024)
Ejemplares similares
-
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
por: Chen, Shuangyuan, et al.
Publicado: (2025) -
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
por: Lee, Kyunghun, et al.
Publicado: (2024) -
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
por: Mei, Yuxiang, et al.
Publicado: (2026) -
SimuSOE: A Simulated Snoring Dataset for Obstructive Sleep Apnea-Hypopnea Syndrome Evaluation during Wakefulness
por: Lin, Jie, et al.
Publicado: (2024) -
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
por: Budaghyan, David, et al.
Publicado: (2023)