FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Yi, Liu, Xubo, Liu, Haohe, Plumbley, Mark D., Wang, Wenwu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Exploring the User Experience of AI-Assisted Sound Searching Systems for Creative Workflows
di: Liu, Haohe, et al.
Pubblicazione: (2025)
di: Liu, Haohe, et al.
Pubblicazione: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
di: Zhao, Junqi, et al.
Pubblicazione: (2024)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
Learning Temporal Resolution in Spectrogram for Audio Classification
di: Liu, Haohe, et al.
Pubblicazione: (2022)
di: Liu, Haohe, et al.
Pubblicazione: (2022)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
Separate Anything You Describe
di: Liu, Xubo, et al.
Pubblicazione: (2023)
di: Liu, Xubo, et al.
Pubblicazione: (2023)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
Region-Specific Audio Tagging for Spatial Sound
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
First-Shot Unsupervised Anomalous Sound Detection With Unknown Anomalies Estimated by Metadata-Assisted Audio Generation
di: Zhang, Hejing, et al.
Pubblicazione: (2023)
di: Zhang, Hejing, et al.
Pubblicazione: (2023)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
di: Liu, Haohe, et al.
Pubblicazione: (2023)
di: Liu, Haohe, et al.
Pubblicazione: (2023)
Fish Tracking, Counting, and Behaviour Analysis in Digital Aquaculture: A Comprehensive Survey
di: Cui, Meng, et al.
Pubblicazione: (2024)
di: Cui, Meng, et al.
Pubblicazione: (2024)
Source Separation by Flow Matching
di: Scheibler, Robin, et al.
Pubblicazione: (2025)
di: Scheibler, Robin, et al.
Pubblicazione: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
di: Cui, Meng, et al.
Pubblicazione: (2023)
di: Cui, Meng, et al.
Pubblicazione: (2023)
PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection
di: Hu, Jinbo, et al.
Pubblicazione: (2024)
di: Hu, Jinbo, et al.
Pubblicazione: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
CycleFlow: Leveraging Cycle Consistency in Flow Matching for Speaker Style Adaptation
di: Liang, Ziqi, et al.
Pubblicazione: (2025)
di: Liang, Ziqi, et al.
Pubblicazione: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
di: Bibbó, Gabriel, et al.
Pubblicazione: (2024)
di: Bibbó, Gabriel, et al.
Pubblicazione: (2024)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
di: Sato, Ryo, et al.
Pubblicazione: (2025)
di: Sato, Ryo, et al.
Pubblicazione: (2025)
BioDCASE 2026 Challenge Baseline for Cross-Domain Mosquito Species Classification
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
di: Hu, Jinbo, et al.
Pubblicazione: (2023)
di: Hu, Jinbo, et al.
Pubblicazione: (2023)
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
Language-Queried Target Sound Extraction Without Parallel Training Data
di: Ma, Hao, et al.
Pubblicazione: (2024)
di: Ma, Hao, et al.
Pubblicazione: (2024)
RFWave: Multi-band Rectified Flow for Audio Waveform Reconstruction
di: Liu, Peng, et al.
Pubblicazione: (2024)
di: Liu, Peng, et al.
Pubblicazione: (2024)
Disentangling Hierarchical Features for Anomalous Sound Detection Under Domain Shift
di: Guan, Jian, et al.
Pubblicazione: (2025)
di: Guan, Jian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
di: Yuan, Yi, et al.
Pubblicazione: (2023) -
Exploring the User Experience of AI-Assisted Sound Searching Systems for Creative Workflows
di: Liu, Haohe, et al.
Pubblicazione: (2025) -
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025) -
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
di: Zhao, Junqi, et al.
Pubblicazione: (2024) -
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)