Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Jianyuan, Li, Guangzheng, Xu, Yangfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
di: Okocha, Chibuzor, et al.
Pubblicazione: (2025)
di: Okocha, Chibuzor, et al.
Pubblicazione: (2025)
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation
di: Wang, Ziqian, et al.
Pubblicazione: (2024)
di: Wang, Ziqian, et al.
Pubblicazione: (2024)
Multichannel blind speech source separation with a disjoint constraint source model
di: Wang, Jianyu, et al.
Pubblicazione: (2024)
di: Wang, Jianyu, et al.
Pubblicazione: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
Determined blind source separation via modeling adjacent frequency band correlations in speech signals
di: Wang, Jianyu, et al.
Pubblicazione: (2025)
di: Wang, Jianyu, et al.
Pubblicazione: (2025)
Independent low-rank matrix analysis based on the Sinkhorn divergence source model for blind source separation
di: Wang, Jianyu, et al.
Pubblicazione: (2024)
di: Wang, Jianyu, et al.
Pubblicazione: (2024)
Training a Perceptual Model for Evaluating Auditory Similarity in Music Adversarial Attack
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
Representational learning for an anomalous sound detection system with source separation model
di: Shin, Seunghyeon, et al.
Pubblicazione: (2024)
di: Shin, Seunghyeon, et al.
Pubblicazione: (2024)
Towards audio language modeling -- an overview
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
A robust audio deepfake detection system via multi-view feature
di: Yang, Yujie, et al.
Pubblicazione: (2024)
di: Yang, Yujie, et al.
Pubblicazione: (2024)
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
Diffusion-Based Adversarial Purification for Speaker Verification
di: Bai, Yibo, et al.
Pubblicazione: (2023)
di: Bai, Yibo, et al.
Pubblicazione: (2023)
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
Synthetic training set generation using text-to-audio models for environmental sound classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Are audio DeepFake detection models polyglots?
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
di: Kammoun, Sofiene, et al.
Pubblicazione: (2025)
di: Kammoun, Sofiene, et al.
Pubblicazione: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
A Joint Noise Disentanglement and Adversarial Training Framework for Robust Speaker Verification
di: Xing, Xujiang, et al.
Pubblicazione: (2024)
di: Xing, Xujiang, et al.
Pubblicazione: (2024)
Tweaking autoregressive methods for inpainting of gaps in audio signals
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
Real-time implementation of vibrato transfer as an audio effect
di: Hyrkas, Jeremy
Pubblicazione: (2025)
di: Hyrkas, Jeremy
Pubblicazione: (2025)
SepMamba: State-space models for speaker separation using Mamba
di: Avenstrup, Thor Højhus, et al.
Pubblicazione: (2024)
di: Avenstrup, Thor Højhus, et al.
Pubblicazione: (2024)
Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Speaker anonymization using neural audio codec language models
di: Panariello, Michele, et al.
Pubblicazione: (2023)
di: Panariello, Michele, et al.
Pubblicazione: (2023)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
Regularized autoregressive modeling and its application to audio signal reconstruction
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
di: Tan, Liwen, et al.
Pubblicazione: (2024)
di: Tan, Liwen, et al.
Pubblicazione: (2024)
A SOUND APPROACH: Using Large Language Models to generate audio descriptions for egocentric text-audio retrieval
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
di: Han, Runduo, et al.
Pubblicazione: (2024)
di: Han, Runduo, et al.
Pubblicazione: (2024)
AxLSTMs: learning self-supervised audio representations with xLSTMs
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Deep learning based spatial aliasing reduction in beamforming for audio capture
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
di: Das, Sneha, et al.
Pubblicazione: (2020)
di: Das, Sneha, et al.
Pubblicazione: (2020)
Documenti analoghi
-
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026) -
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
di: Zhu, Xinfa, et al.
Pubblicazione: (2025) -
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025) -
Can large audio language models understand child stuttering speech? speech summarization, and source separation
di: Okocha, Chibuzor, et al.
Pubblicazione: (2025) -
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation
di: Wang, Ziqian, et al.
Pubblicazione: (2024)