Self-Guided Target Sound Extraction and Classification Through Universal Sound Separation Model and Multiple Clues
Fuente:
arXiv
Guardado en:
| Autores principales: | Kwon, Younghoo, Lee, Dongheon, Kim, Dohwan, Choi, Jung-Woo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sound Separation and Classification with Object and Semantic Guidance
por: Kwon, Younghoo, et al.
Publicado: (2025)
por: Kwon, Younghoo, et al.
Publicado: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024)
por: Lee, Dongheon, et al.
Publicado: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025)
por: Lee, Dongheon, et al.
Publicado: (2025)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024)
por: Choi, Dayun, et al.
Publicado: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)
por: Choi, Dayun, et al.
Publicado: (2025)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
por: Lee, Dongheon, et al.
Publicado: (2023)
por: Lee, Dongheon, et al.
Publicado: (2023)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
USE: A Unified Model for Universal Sound Separation and Extraction
por: Wang, Hongyu, et al.
Publicado: (2025)
por: Wang, Hongyu, et al.
Publicado: (2025)
CST-former: Multidimensional Attention-based Transformer for Sound Event Localization and Detection in Real Scenes
por: Shul, Yusun, et al.
Publicado: (2025)
por: Shul, Yusun, et al.
Publicado: (2025)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
por: Kim, June-Woo, et al.
Publicado: (2024)
por: Kim, June-Woo, et al.
Publicado: (2024)
Leveraging Sound Source Trajectories for Universal Sound Separation
por: Wu, Donghang, et al.
Publicado: (2024)
por: Wu, Donghang, et al.
Publicado: (2024)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
por: Ho, Chun-wei, et al.
Publicado: (2026)
por: Ho, Chun-wei, et al.
Publicado: (2026)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness
por: Koo, Heejoon, et al.
Publicado: (2025)
por: Koo, Heejoon, et al.
Publicado: (2025)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
por: Lee, Jin Woo, et al.
Publicado: (2023)
por: Lee, Jin Woo, et al.
Publicado: (2023)
Cross-attention Inspired Selective State Space Models for Target Sound Extraction
por: Wu, Donghang, et al.
Publicado: (2024)
por: Wu, Donghang, et al.
Publicado: (2024)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction
por: Ma, Hao, et al.
Publicado: (2024)
por: Ma, Hao, et al.
Publicado: (2024)
RepAugment: Input-Agnostic Representation-Level Augmentation for Respiratory Sound Classification
por: Kim, June-Woo, et al.
Publicado: (2024)
por: Kim, June-Woo, et al.
Publicado: (2024)
SoundSculpt: Direction and Semantics Driven Ambisonic Target Sound Extraction
por: Chen, Tuochao, et al.
Publicado: (2025)
por: Chen, Tuochao, et al.
Publicado: (2025)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
por: Saijo, Kohei, et al.
Publicado: (2024)
por: Saijo, Kohei, et al.
Publicado: (2024)
Language-Queried Target Sound Extraction Without Parallel Training Data
por: Ma, Hao, et al.
Publicado: (2024)
por: Ma, Hao, et al.
Publicado: (2024)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
LuSeeL: Language-queried Binaural Universal Sound Event Extraction and Localization
por: Pan, Zexu, et al.
Publicado: (2026)
por: Pan, Zexu, et al.
Publicado: (2026)
Single-Channel Target Speech Extraction Utilizing Distance and Room Clues
por: Shi, Runwu, et al.
Publicado: (2025)
por: Shi, Runwu, et al.
Publicado: (2025)
TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information
por: Wang, Yiwen, et al.
Publicado: (2024)
por: Wang, Yiwen, et al.
Publicado: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Improving Respiratory Sound Classification with Architecture-Agnostic Knowledge Distillation from Ensembles
por: Toikkanen, Miika, et al.
Publicado: (2025)
por: Toikkanen, Miika, et al.
Publicado: (2025)
Text-Queried Target Sound Event Localization
por: Zhao, Jinzheng, et al.
Publicado: (2024)
por: Zhao, Jinzheng, et al.
Publicado: (2024)
Physics-Guided Variational Model for Unsupervised Sound Source Tracking
por: Fiorio, Luan Vinícius, et al.
Publicado: (2026)
por: Fiorio, Luan Vinícius, et al.
Publicado: (2026)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
por: Sato, Ryo, et al.
Publicado: (2025)
por: Sato, Ryo, et al.
Publicado: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
NDF+: Joint Neural Directional Filtering and Diffuse Sound Extraction
por: Huang, Weilong, et al.
Publicado: (2026)
por: Huang, Weilong, et al.
Publicado: (2026)
Differentiable Modal Synthesis for Physical Modeling of Planar String Sound and Motion Simulation
por: Lee, Jin Woo, et al.
Publicado: (2024)
por: Lee, Jin Woo, et al.
Publicado: (2024)
CATSE: A Context-Aware Framework for Causal Target Sound Extraction
por: Baligar, Shrishail, et al.
Publicado: (2024)
por: Baligar, Shrishail, et al.
Publicado: (2024)
Online Similarity-and-Independence-Aware Beamformer for Low-latency Target Sound Extraction
por: Hiroe, Atsuo
Publicado: (2023)
por: Hiroe, Atsuo
Publicado: (2023)
FUN-SSL: Full-band Layer Followed by U-Net with Narrow-band Layers for Multiple Moving Sound Source Localization
por: Choi, Yuseon, et al.
Publicado: (2025)
por: Choi, Yuseon, et al.
Publicado: (2025)
Shared Representation Learning for Reference-Guided Targeted Sound Detection
por: Gupta, Shubham, et al.
Publicado: (2026)
por: Gupta, Shubham, et al.
Publicado: (2026)
Ejemplares similares
-
Sound Separation and Classification with Object and Semantic Guidance
por: Kwon, Younghoo, et al.
Publicado: (2025) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024) -
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025) -
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024) -
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)