Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Xufang, Tsimhoni, Omer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks
di: Atif, Youness
Pubblicazione: (2025)
di: Atif, Youness
Pubblicazione: (2025)
SwiftF0: Fast and Accurate Monophonic Pitch Detection
di: Nieradzik, Lars
Pubblicazione: (2025)
di: Nieradzik, Lars
Pubblicazione: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
di: Pham, Lam, et al.
Pubblicazione: (2024)
di: Pham, Lam, et al.
Pubblicazione: (2024)
A Real-Time Voice Activity Detection Based On Lightweight Neural
di: Jia, Jidong, et al.
Pubblicazione: (2024)
di: Jia, Jidong, et al.
Pubblicazione: (2024)
Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
di: Deschênes, Anthony, et al.
Pubblicazione: (2025)
di: Deschênes, Anthony, et al.
Pubblicazione: (2025)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
Raw Audio Classification with Cosine Convolutional Neural Network (CosCovNN)
di: Haque, Kazi Nazmul, et al.
Pubblicazione: (2024)
di: Haque, Kazi Nazmul, et al.
Pubblicazione: (2024)
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
di: Riou, Alain, et al.
Pubblicazione: (2025)
di: Riou, Alain, et al.
Pubblicazione: (2025)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Shao, Nian, et al.
Pubblicazione: (2025)
di: Shao, Nian, et al.
Pubblicazione: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
Incremental FastPitch: Chunk-based High Quality Text to Speech
di: Du, Muyang, et al.
Pubblicazione: (2024)
di: Du, Muyang, et al.
Pubblicazione: (2024)
Compressing Quaternion Convolutional Neural Networks for Audio Classification
di: Singh, Arshdeep, et al.
Pubblicazione: (2025)
di: Singh, Arshdeep, et al.
Pubblicazione: (2025)
Quantum-Trained Convolutional Neural Network for Deepfake Audio Detection
di: Lin, Chu-Hsuan Abraham, et al.
Pubblicazione: (2024)
di: Lin, Chu-Hsuan Abraham, et al.
Pubblicazione: (2024)
MAJL: A Model-Agnostic Joint Learning Framework for Music Source Separation and Pitch Estimation
di: Wei, Haojie, et al.
Pubblicazione: (2025)
di: Wei, Haojie, et al.
Pubblicazione: (2025)
A Multi-task Learning Balanced Attention Convolutional Neural Network Model for Few-shot Underwater Acoustic Target Recognition
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
di: Meng, Yigang
Pubblicazione: (2024)
di: Meng, Yigang
Pubblicazione: (2024)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
di: Chinchmalatpure, Prajwal, et al.
Pubblicazione: (2025)
di: Chinchmalatpure, Prajwal, et al.
Pubblicazione: (2025)
BERT-APC: A Reference-free Framework for Automatic Pitch Correction via Musical Context Inference
di: Kim, Sungjae, et al.
Pubblicazione: (2025)
di: Kim, Sungjae, et al.
Pubblicazione: (2025)
Selective Attention System (SAS): Device-Addressed Speech Detection for Real-Time On-Device Voice AI
di: Kim, David Joohun, et al.
Pubblicazione: (2026)
di: Kim, David Joohun, et al.
Pubblicazione: (2026)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
di: Elias, Noel
Pubblicazione: (2024)
di: Elias, Noel
Pubblicazione: (2024)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
di: Wen, Penghui, et al.
Pubblicazione: (2023)
di: Wen, Penghui, et al.
Pubblicazione: (2023)
Real-Time Speech Enhancement via a Hybrid ViT: A Dual-Input Acoustic-Image Feature Fusion
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
Learning Temporal Resolution in Spectrogram for Audio Classification
di: Liu, Haohe, et al.
Pubblicazione: (2022)
di: Liu, Haohe, et al.
Pubblicazione: (2022)
Classification of Heart Sounds Using Multi-Branch Deep Convolutional Network and LSTM-CNN
di: Latifi, Seyed Amir, et al.
Pubblicazione: (2024)
di: Latifi, Seyed Amir, et al.
Pubblicazione: (2024)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
di: Chen, Guo, et al.
Pubblicazione: (2025)
di: Chen, Guo, et al.
Pubblicazione: (2025)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
Reproducible Machine Learning-based Voice Pathology Detection: Introducing the Pitch Difference Feature
di: Vrba, Jan, et al.
Pubblicazione: (2024)
di: Vrba, Jan, et al.
Pubblicazione: (2024)
Notochord: a Flexible Probabilistic Model for Real-Time MIDI Performance
di: Shepardson, Victor, et al.
Pubblicazione: (2024)
di: Shepardson, Victor, et al.
Pubblicazione: (2024)
Real-world Music Plagiarism Detection With Music Segment Transcription System
di: Go, Seonghyeon
Pubblicazione: (2025)
di: Go, Seonghyeon
Pubblicazione: (2025)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
di: Choi, Joon-Seung, et al.
Pubblicazione: (2025)
di: Choi, Joon-Seung, et al.
Pubblicazione: (2025)
Hyperdimensional Intelligent Sensing for Efficient Real-Time Audio Processing on Extreme Edge
di: Yun, Sanggeon, et al.
Pubblicazione: (2025)
di: Yun, Sanggeon, et al.
Pubblicazione: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Dialogue in Resonance: An Interactive Music Piece for Piano and Real-Time Automatic Transcription System
di: Bang, Hayeon, et al.
Pubblicazione: (2025)
di: Bang, Hayeon, et al.
Pubblicazione: (2025)
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
A Lightweight and Real-Time Binaural Speech Enhancement Model with Spatial Cues Preservation
di: Wang, Jingyuan, et al.
Pubblicazione: (2024)
di: Wang, Jingyuan, et al.
Pubblicazione: (2024)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks
di: Atif, Youness
Pubblicazione: (2025) -
SwiftF0: Fast and Accurate Monophonic Pitch Detection
di: Nieradzik, Lars
Pubblicazione: (2025) -
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
di: Pham, Lam, et al.
Pubblicazione: (2024) -
A Real-Time Voice Activity Detection Based On Lightweight Neural
di: Jia, Jidong, et al.
Pubblicazione: (2024) -
Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
di: Deschênes, Anthony, et al.
Pubblicazione: (2025)