InfantCryNet: A Data-driven Framework for Intelligent Analysis of Infant Cries
Fuente:
arXiv
Salvato in:
| Autori principali: | Hong, Mengze, Zhang, Chen Jason, Yang, Lingxiao, Song, Yuanfeng, Jiang, Di |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ICSD: An Open-source Dataset for Infant Cry and Snoring Detection
di: Liu, Qingyu, et al.
Pubblicazione: (2024)
di: Liu, Qingyu, et al.
Pubblicazione: (2024)
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
di: Lee, Kyunghun, et al.
Pubblicazione: (2024)
di: Lee, Kyunghun, et al.
Pubblicazione: (2024)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
di: Budaghyan, David, et al.
Pubblicazione: (2023)
di: Budaghyan, David, et al.
Pubblicazione: (2023)
LMU-Based Sequential Learning and Posterior Ensemble Fusion for Cross-Domain Infant Cry Classification
di: Jazaeri, Niloofar, et al.
Pubblicazione: (2026)
di: Jazaeri, Niloofar, et al.
Pubblicazione: (2026)
Technical Report: A Practical Guide to Kaldi ASR Optimization
di: Hong, Mengze, et al.
Pubblicazione: (2025)
di: Hong, Mengze, et al.
Pubblicazione: (2025)
End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
Towards Reliable Audio Deepfake Attribution and Model Recognition: A Multi-Level Autoencoder-Based Framework
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
Interpretable Convolutional SyncNet
di: Park, Sungjoon, et al.
Pubblicazione: (2024)
di: Park, Sungjoon, et al.
Pubblicazione: (2024)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
di: Du, Fangyu, et al.
Pubblicazione: (2025)
di: Du, Fangyu, et al.
Pubblicazione: (2025)
Detection of Auditory Brainstem Response Peaks Using Image Processing Techniques in Infants with Normal Hearing Sensitivity
di: Majidpour, Amir, et al.
Pubblicazione: (2024)
di: Majidpour, Amir, et al.
Pubblicazione: (2024)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
di: Liang, Yunming, et al.
Pubblicazione: (2025)
di: Liang, Yunming, et al.
Pubblicazione: (2025)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
Automated Bioacoustic Monitoring for South African Bird Species on Unlabeled Data
di: Doell, Michael, et al.
Pubblicazione: (2024)
di: Doell, Michael, et al.
Pubblicazione: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
FSSUAVL: A Discriminative Framework using Vision Models for Federated Self-Supervised Audio and Image Understanding
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
Multimodal Emotion Recognition and Sentiment Analysis in Multi-Party Conversation Contexts
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
di: Ghaleb, Ali, et al.
Pubblicazione: (2024)
di: Ghaleb, Ali, et al.
Pubblicazione: (2024)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Multi-View Spectrogram Transformer for Respiratory Sound Classification
di: He, Wentao, et al.
Pubblicazione: (2023)
di: He, Wentao, et al.
Pubblicazione: (2023)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
di: Li, Yidi, et al.
Pubblicazione: (2024)
di: Li, Yidi, et al.
Pubblicazione: (2024)
Bidirectional Autoregressive Diffusion Model for Dance Generation
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
di: Zhang, Canyu, et al.
Pubblicazione: (2024)
Sonicmesh: Enhancing 3D Human Mesh Reconstruction in Vision-Impaired Environments With Acoustic Signals
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Liang, Xiaoxuan, et al.
Pubblicazione: (2024)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
di: Wang, Haotian, et al.
Pubblicazione: (2025)
di: Wang, Haotian, et al.
Pubblicazione: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Exploring Multi-Modal Control in Music-Driven Dance Generation
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
OmniAudio: Generating Spatial Audio from 360-Degree Video
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
Novel-View Acoustic Synthesis from 3D Reconstructed Rooms
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
di: Ahn, Byeongjoo, et al.
Pubblicazione: (2023)
Multimodal Fusion Method with Spatiotemporal Sequences and Relationship Learning for Valence-Arousal Estimation
di: Yu, Jun, et al.
Pubblicazione: (2024)
di: Yu, Jun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ICSD: An Open-source Dataset for Infant Cry and Snoring Detection
di: Liu, Qingyu, et al.
Pubblicazione: (2024) -
Enhancing Infant Crying Detection with Gradient Boosting for Improved Emotional and Mental Health Diagnostics
di: Lee, Kyunghun, et al.
Pubblicazione: (2024) -
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
di: Budaghyan, David, et al.
Pubblicazione: (2023) -
LMU-Based Sequential Learning and Posterior Ensemble Fusion for Cross-Domain Infant Cry Classification
di: Jazaeri, Niloofar, et al.
Pubblicazione: (2026) -
Technical Report: A Practical Guide to Kaldi ASR Optimization
di: Hong, Mengze, et al.
Pubblicazione: (2025)