Explaining Spectrograms in Machine Learning: A Study on Neural Networks for Speech Classification
Fuente:
arXiv
Salvato in:
| Autori principali: | James, Jesin, T., Balamurali B., Abeysinghe, Binu, Liu, Junchen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
A Survey of Deep Learning for Complex Speech Spectrograms
di: Xie, Yuying, et al.
Pubblicazione: (2025)
di: Xie, Yuying, et al.
Pubblicazione: (2025)
Continual Learning in Machine Speech Chain Using Gradient Episodic Memory
di: Tyndall, Geoffrey, et al.
Pubblicazione: (2024)
di: Tyndall, Geoffrey, et al.
Pubblicazione: (2024)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
di: Fan, Xiaoran, et al.
Pubblicazione: (2025)
di: Fan, Xiaoran, et al.
Pubblicazione: (2025)
Exploring Speech Pattern Disorders in Autism using Machine Learning
di: Hu, Chuanbo, et al.
Pubblicazione: (2024)
di: Hu, Chuanbo, et al.
Pubblicazione: (2024)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
di: Teleki, Maria, et al.
Pubblicazione: (2025)
di: Teleki, Maria, et al.
Pubblicazione: (2025)
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
di: Pan, Jing, et al.
Pubblicazione: (2023)
di: Pan, Jing, et al.
Pubblicazione: (2023)
Assessing the Impact of Anisotropy in Neural Representations of Speech: A Case Study on Keyword Spotting
di: Wisniewski, Guillaume, et al.
Pubblicazione: (2025)
di: Wisniewski, Guillaume, et al.
Pubblicazione: (2025)
A Chinese Heart Failure Status Speech Database with Universal and Personalised Classification
di: Pan, Yue, et al.
Pubblicazione: (2025)
di: Pan, Yue, et al.
Pubblicazione: (2025)
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation
di: Li, Jilong, et al.
Pubblicazione: (2024)
di: Li, Jilong, et al.
Pubblicazione: (2024)
MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond
di: Huzaifah, Muhammad, et al.
Pubblicazione: (2024)
di: Huzaifah, Muhammad, et al.
Pubblicazione: (2024)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
Linear-Complexity Self-Supervised Learning for Speech Processing
di: Zhang, Shucong, et al.
Pubblicazione: (2024)
di: Zhang, Shucong, et al.
Pubblicazione: (2024)
Neural networks for Text-to-Speech evaluation
di: Trofimenko, Ilya, et al.
Pubblicazione: (2026)
di: Trofimenko, Ilya, et al.
Pubblicazione: (2026)
Dynamic Stress Detection: A Study of Temporal Progression Modelling of Stress in Speech
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
di: Lall, Vishakha, et al.
Pubblicazione: (2025)
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Streaming Speech-to-Text Translation with a SpeechLLM
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
Phonology-Guided Speech-to-Speech Translation for African Languages
di: Ochieng, Peter, et al.
Pubblicazione: (2024)
di: Ochieng, Peter, et al.
Pubblicazione: (2024)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
SyllableLM: Learning Coarse Semantic Units for Speech Language Models
di: Baade, Alan, et al.
Pubblicazione: (2024)
di: Baade, Alan, et al.
Pubblicazione: (2024)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
Speech Retrieval-Augmented Generation without Automatic Speech Recognition
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
TICL+: A Case Study On Speech In-Context Learning for Children's Speech Recognition
di: Zheng, Haolong, et al.
Pubblicazione: (2025)
di: Zheng, Haolong, et al.
Pubblicazione: (2025)
Learning Temporal Resolution in Spectrogram for Audio Classification
di: Liu, Haohe, et al.
Pubblicazione: (2022)
di: Liu, Haohe, et al.
Pubblicazione: (2022)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
di: Kuroki, So, et al.
Pubblicazione: (2025)
di: Kuroki, So, et al.
Pubblicazione: (2025)
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
di: Diack, Abdoulaye, et al.
Pubblicazione: (2026)
di: Diack, Abdoulaye, et al.
Pubblicazione: (2026)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
di: Zhong, Terry Yi, et al.
Pubblicazione: (2025)
di: Zhong, Terry Yi, et al.
Pubblicazione: (2025)
Pheme: Efficient and Conversational Speech Generation
di: Budzianowski, Paweł, et al.
Pubblicazione: (2024)
di: Budzianowski, Paweł, et al.
Pubblicazione: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
di: Wu, Jinyang, et al.
Pubblicazione: (2026)
AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations
di: Lian, Jiachen, et al.
Pubblicazione: (2023)
di: Lian, Jiachen, et al.
Pubblicazione: (2023)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
di: Zhong, Tao, et al.
Pubblicazione: (2025)
di: Zhong, Tao, et al.
Pubblicazione: (2025)
MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023) -
A Survey of Deep Learning for Complex Speech Spectrograms
di: Xie, Yuying, et al.
Pubblicazione: (2025) -
Continual Learning in Machine Speech Chain Using Gradient Episodic Memory
di: Tyndall, Geoffrey, et al.
Pubblicazione: (2024) -
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
di: Wang, Junyu, et al.
Pubblicazione: (2025) -
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025)