Spectrogram features for audio and speech analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | McLoughlin, Ian, Pham, Lam, Song, Yan, Miao, Xiaoxiao, Phan, Huy, Cai, Pengfei, Gu, Qing, Nan, Jiang, Song, Haoyu, Soh, Donny |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automated evaluation of children's speech fluency for low-resource languages
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
par: Cai, Pengfei, et autres
Publié: (2025)
par: Cai, Pengfei, et autres
Publié: (2025)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
par: Miao, Xiaoxiao, et autres
Publié: (2024)
par: Miao, Xiaoxiao, et autres
Publié: (2024)
Perceptual Evaluation of Extrapolated Spatial Room Impulse Responses From a Mono Source
par: Heritage, Ben, et autres
Publié: (2025)
par: Heritage, Ben, et autres
Publié: (2025)
Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
par: Mack, Wolfgang, et autres
Publié: (2025)
par: Mack, Wolfgang, et autres
Publié: (2025)
Comparison Performance of Spectrogram and Scalogram as Input of Acoustic Recognition Task
par: Phan, Dang Thoai
Publié: (2024)
par: Phan, Dang Thoai
Publié: (2024)
SecureSpeech: Prompt-based Speaker and Content Protection
par: Hui, Belinda Soh Hui, et autres
Publié: (2025)
par: Hui, Belinda Soh Hui, et autres
Publié: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
par: Pham, Lam, et autres
Publié: (2024)
par: Pham, Lam, et autres
Publié: (2024)
Real-time speech enhancement in noise for throat microphone using neural audio codec as foundation model
par: Hauret, Julien, et autres
Publié: (2025)
par: Hauret, Julien, et autres
Publié: (2025)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
par: Das, Sneha, et autres
Publié: (2020)
par: Das, Sneha, et autres
Publié: (2020)
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025)
par: Kammoun, Sofiene, et autres
Publié: (2025)
Forensic deepfake audio detection using segmental speech features
par: Yang, Tianle, et autres
Publié: (2025)
par: Yang, Tianle, et autres
Publié: (2025)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
Online incremental learning for audio classification using a pretrained audio model
par: Mulimani, Manjunath, et autres
Publié: (2025)
par: Mulimani, Manjunath, et autres
Publié: (2025)
ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis
par: Liu, Yunyi, et autres
Publié: (2024)
par: Liu, Yunyi, et autres
Publié: (2024)
A robust audio deepfake detection system via multi-view feature
par: Yang, Yujie, et autres
Publié: (2024)
par: Yang, Yujie, et autres
Publié: (2024)
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
par: Du, Hui-Peng, et autres
Publié: (2025)
par: Du, Hui-Peng, et autres
Publié: (2025)
Parameter-Efficient Transfer Learning of Audio Spectrogram Transformers
par: Cappellazzo, Umberto, et autres
Publié: (2023)
par: Cappellazzo, Umberto, et autres
Publié: (2023)
Towards audio language modeling -- an overview
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Detection of manatee vocalisations using the Audio Spectrogram Transformer
par: Schiappacasse, Stefano, et autres
Publié: (2024)
par: Schiappacasse, Stefano, et autres
Publié: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Joint Spectrogram Separation and TDOA Estimation using Optimal Transport
par: Fabiani, Linda, et autres
Publié: (2025)
par: Fabiani, Linda, et autres
Publié: (2025)
ASM: Audio Spectrogram Mixer
par: Ji, Qingfeng, et autres
Publié: (2024)
par: Ji, Qingfeng, et autres
Publié: (2024)
An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech
par: Deng, Qingkun, et autres
Publié: (2024)
par: Deng, Qingkun, et autres
Publié: (2024)
From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems
par: Zhang, Huan, et autres
Publié: (2025)
par: Zhang, Huan, et autres
Publié: (2025)
Joint decoding method for controllable contextual speech recognition based on Speech LLM
par: Fang, Yangui, et autres
Publié: (2025)
par: Fang, Yangui, et autres
Publié: (2025)
FAST: Fast Audio Spectrogram Transformer
par: Naman, Anugunj, et autres
Publié: (2025)
par: Naman, Anugunj, et autres
Publié: (2025)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
par: Okocha, Chibuzor, et autres
Publié: (2025)
par: Okocha, Chibuzor, et autres
Publié: (2025)
Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge
par: Li, Ze, et autres
Publié: (2026)
par: Li, Ze, et autres
Publié: (2026)
Fusion of Modulation Spectrogram and SSL with Multi-head Attention for Fake Speech Detection
par: N, Rishith Sadashiv T, et autres
Publié: (2025)
par: N, Rishith Sadashiv T, et autres
Publié: (2025)
On the reliability of feature attribution methods for speech classification
par: Shen, Gaofei, et autres
Publié: (2025)
par: Shen, Gaofei, et autres
Publié: (2025)
Towards Unsupervised Speaker Diarization System for Multilingual Telephone Calls Using Pre-trained Whisper Model and Mixture of Sparse Autoencoders
par: Lam, Phat, et autres
Publié: (2024)
par: Lam, Phat, et autres
Publié: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
par: Jezidžić, Marin, et autres
Publié: (2024)
par: Jezidžić, Marin, et autres
Publié: (2024)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
par: Langman, Ryan, et autres
Publié: (2024)
par: Langman, Ryan, et autres
Publié: (2024)
Documents similaires
-
Automated evaluation of children's speech fluency for low-resource languages
par: Zhang, Bowen, et autres
Publié: (2025) -
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
par: Cai, Pengfei, et autres
Publié: (2025) -
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024) -
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024) -
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
par: Miao, Xiaoxiao, et autres
Publié: (2024)