Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
Fuente:
arXiv
Salvato in:
| Autori principali: | Raimon, Athul, Masti, Shubha, Sateesh, Shyam K, Vengatagiri, Siyani, Das, Bhaskarjyoti |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
di: Morrone, Giovanni, et al.
Pubblicazione: (2023)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR
di: Ravi, Nagarathna, et al.
Pubblicazione: (2024)
di: Ravi, Nagarathna, et al.
Pubblicazione: (2024)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
FunnelNet: An End-to-End Deep Learning Framework to Monitor Digital Heart Murmur in Real-Time
di: Jobayer, Md, et al.
Pubblicazione: (2024)
di: Jobayer, Md, et al.
Pubblicazione: (2024)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
di: Li, Tianpeng, et al.
Pubblicazione: (2025)
di: Li, Tianpeng, et al.
Pubblicazione: (2025)
End-to-end Piano Performance-MIDI to Score Conversion with Transformers
di: Beyer, Tim, et al.
Pubblicazione: (2024)
di: Beyer, Tim, et al.
Pubblicazione: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
di: Chen, Guangke, et al.
Pubblicazione: (2025)
di: Chen, Guangke, et al.
Pubblicazione: (2025)
Content Adaptive Front End For Audio Classification
di: Verma, Prateek, et al.
Pubblicazione: (2023)
di: Verma, Prateek, et al.
Pubblicazione: (2023)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
End-to-End Spoken Grammatical Error Correction
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
di: Qian, Mengjie, et al.
Pubblicazione: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
di: Moslem, Yasmin
Pubblicazione: (2024)
di: Moslem, Yasmin
Pubblicazione: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
di: Chen, Yujie, et al.
Pubblicazione: (2024)
di: Chen, Yujie, et al.
Pubblicazione: (2024)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
di: Tripodi, Riccardo
Pubblicazione: (2025)
di: Tripodi, Riccardo
Pubblicazione: (2025)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
Comparative Analysis of Mel-Frequency Cepstral Coefficients and Wavelet Based Audio Signal Processing for Emotion Detection and Mental Health Assessment in Spoken Speech
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
Exploring Meta Information for Audio-based Zero-shot Bird Classification
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
di: Chen, Junyang, et al.
Pubblicazione: (2026)
di: Chen, Junyang, et al.
Pubblicazione: (2026)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
di: Deng, Keqi, et al.
Pubblicazione: (2024)
di: Deng, Keqi, et al.
Pubblicazione: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling
di: Yemini, Yochai, et al.
Pubblicazione: (2026)
di: Yemini, Yochai, et al.
Pubblicazione: (2026)
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
Audio Processing using Pattern Recognition for Music Genre Classification
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
di: Labrak, Yanis, et al.
Pubblicazione: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
di: Tjandra, Andros, et al.
Pubblicazione: (2025)
di: Tjandra, Andros, et al.
Pubblicazione: (2025)
Acoustic and Machine Learning Methods for Speech-Based Suicide Risk Assessment: A Systematic Review
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
Documenti analoghi
-
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
di: Morrone, Giovanni, et al.
Pubblicazione: (2023) -
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024) -
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR
di: Ravi, Nagarathna, et al.
Pubblicazione: (2024) -
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
di: Cui, Jianwei, et al.
Pubblicazione: (2024) -
FunnelNet: An End-to-End Deep Learning Framework to Monitor Digital Heart Murmur in Real-Time
di: Jobayer, Md, et al.
Pubblicazione: (2024)