MUSE: Flexible Voiceprint Receptive Fields and Multi-Path Fusion Enhanced Taylor Transformer for U-Net-based Speech Enhancement
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zizhen, Chen, Xiaoting, Wang, Junyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SECP: A Speech Enhancement-Based Curation Pipeline For Scalable Acquisition Of Clean Speech
di: Sabra, Adam, et al.
Pubblicazione: (2024)
di: Sabra, Adam, et al.
Pubblicazione: (2024)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Multi-Sample Dynamic Time Warping for Few-Shot Keyword Spotting
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2024)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2024)
Language-based Audio Retrieval with Co-Attention Networks
di: Sun, Haoran, et al.
Pubblicazione: (2024)
di: Sun, Haoran, et al.
Pubblicazione: (2024)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Evaluating Interval-based Tokenization for Pitch Representation in Symbolic Music Analysis
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2025)
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
di: Lin, Chyi-Jiunn, et al.
Pubblicazione: (2024)
Application of Audio Fingerprinting Techniques for Real-Time Scalable Speech Retrieval and Speech Clusterization
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering
di: Rackauckas, Zackary, et al.
Pubblicazione: (2025)
di: Rackauckas, Zackary, et al.
Pubblicazione: (2025)
Exploring Diverse Sounds: Identifying Outliers in a Music Corpus
di: Cai, Le, et al.
Pubblicazione: (2024)
di: Cai, Le, et al.
Pubblicazione: (2024)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Track Role Prediction of Single-Instrumental Sequences
di: Han, Changheon, et al.
Pubblicazione: (2024)
di: Han, Changheon, et al.
Pubblicazione: (2024)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
di: Zhang, Dengming, et al.
Pubblicazione: (2024)
di: Zhang, Dengming, et al.
Pubblicazione: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
di: Chowdhury, Shreyan, et al.
Pubblicazione: (2024)
di: Chowdhury, Shreyan, et al.
Pubblicazione: (2024)
Exploring GPT's Ability as a Judge in Music Understanding
di: Fang, Kun, et al.
Pubblicazione: (2025)
di: Fang, Kun, et al.
Pubblicazione: (2025)
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
di: Wang, Qian, et al.
Pubblicazione: (2024)
di: Wang, Qian, et al.
Pubblicazione: (2024)
Do Captioning Metrics Reflect Music Semantic Alignment?
di: Lee, Jinwoo, et al.
Pubblicazione: (2024)
di: Lee, Jinwoo, et al.
Pubblicazione: (2024)
Automatic Estimation of Singing Voice Musical Dynamics
di: Narang, Jyoti, et al.
Pubblicazione: (2024)
di: Narang, Jyoti, et al.
Pubblicazione: (2024)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
di: Kim, Haven, et al.
Pubblicazione: (2026)
di: Kim, Haven, et al.
Pubblicazione: (2026)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics
di: Zhang, Hanwen, et al.
Pubblicazione: (2025)
di: Zhang, Hanwen, et al.
Pubblicazione: (2025)
Engraving Oriented Joint Estimation of Pitch Spelling and Local and Global Keys
di: Bouquillard, Augustin, et al.
Pubblicazione: (2024)
di: Bouquillard, Augustin, et al.
Pubblicazione: (2024)
Towards Computational Analysis of Pansori Singing
di: Park, Sangheon, et al.
Pubblicazione: (2024)
di: Park, Sangheon, et al.
Pubblicazione: (2024)
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2024)
EAViT: External Attention Vision Transformer for Audio Classification
di: Iqbal, Aquib, et al.
Pubblicazione: (2024)
di: Iqbal, Aquib, et al.
Pubblicazione: (2024)
Transforming LLMs into Cross-modal and Cross-lingual Retrieval Systems
di: Gomez, Frank Palma, et al.
Pubblicazione: (2024)
di: Gomez, Frank Palma, et al.
Pubblicazione: (2024)
Nested Music Transformer: Sequentially Decoding Compound Tokens in Symbolic Music and Audio Generation
di: Yoo, HaeJun, et al.
Pubblicazione: (2024)
di: Yoo, HaeJun, et al.
Pubblicazione: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
di: Bao, Xuchan, et al.
Pubblicazione: (2024)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
di: Wei, Haojie, et al.
Pubblicazione: (2023)
di: Wei, Haojie, et al.
Pubblicazione: (2023)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
di: Wei, Weixing, et al.
Pubblicazione: (2025)
di: Wei, Weixing, et al.
Pubblicazione: (2025)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
di: Lin, Zizhen, et al.
Pubblicazione: (2025)
Multi-label Cross-lingual automatic music genre classification from lyrics with Sentence BERT
di: Tavares, Tiago Fernandes, et al.
Pubblicazione: (2025)
di: Tavares, Tiago Fernandes, et al.
Pubblicazione: (2025)
Distance Sampling-based Paraphraser Leveraging ChatGPT for Text Data Manipulation
di: Oh, Yoori, et al.
Pubblicazione: (2024)
di: Oh, Yoori, et al.
Pubblicazione: (2024)
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
di: Kolehmainen, Jari, et al.
Pubblicazione: (2024)
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
di: Lin, Zizhen, et al.
Pubblicazione: (2024)
di: Lin, Zizhen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SECP: A Speech Enhancement-Based Curation Pipeline For Scalable Acquisition Of Clean Speech
di: Sabra, Adam, et al.
Pubblicazione: (2024) -
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2025) -
Multi-Sample Dynamic Time Warping for Few-Shot Keyword Spotting
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2024) -
Language-based Audio Retrieval with Co-Attention Networks
di: Sun, Haoran, et al.
Pubblicazione: (2024) -
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
di: Pan, Xiaofeng, et al.
Pubblicazione: (2025)