DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Dongheon, Choi, Jung-Woo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024)
por: Choi, Dayun, et al.
Publicado: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025)
por: Lee, Dongheon, et al.
Publicado: (2025)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
por: Lee, Dongheon, et al.
Publicado: (2023)
por: Lee, Dongheon, et al.
Publicado: (2023)
Self-Guided Target Sound Extraction and Classification Through Universal Sound Separation Model and Multiple Clues
por: Kwon, Younghoo, et al.
Publicado: (2025)
por: Kwon, Younghoo, et al.
Publicado: (2025)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
por: Yeon, Inmo, et al.
Publicado: (2024)
por: Yeon, Inmo, et al.
Publicado: (2024)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
por: Chen, Yuanjian, et al.
Publicado: (2026)
por: Chen, Yuanjian, et al.
Publicado: (2026)
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025)
por: Lee, Taehan, et al.
Publicado: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
por: Li, Guinan, et al.
Publicado: (2024)
por: Li, Guinan, et al.
Publicado: (2024)
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
por: Guan, Yadong, et al.
Publicado: (2024)
por: Guan, Yadong, et al.
Publicado: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)
por: Choi, Dayun, et al.
Publicado: (2025)
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
Leveraging Sound Source Trajectories for Universal Sound Separation
por: Wu, Donghang, et al.
Publicado: (2024)
por: Wu, Donghang, et al.
Publicado: (2024)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
por: Choi, Ryuhaerang, et al.
Publicado: (2024)
por: Choi, Ryuhaerang, et al.
Publicado: (2024)
Determined Multichannel Blind Source Separation with Clustered Source Model
por: Wang, Jianyu, et al.
Publicado: (2024)
por: Wang, Jianyu, et al.
Publicado: (2024)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
por: Kim, June-Woo, et al.
Publicado: (2024)
por: Kim, June-Woo, et al.
Publicado: (2024)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
por: Xiao, Zhenyuan, et al.
Publicado: (2024)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
por: Lee, Jin Woo, et al.
Publicado: (2023)
por: Lee, Jin Woo, et al.
Publicado: (2023)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
A Novel Deep Learning Framework for Efficient Multichannel Acoustic Feedback Control
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds
por: Hasumi, Takuya, et al.
Publicado: (2025)
por: Hasumi, Takuya, et al.
Publicado: (2025)
A Neural Score Follower for Computer Accompaniment of Polyphonic Musical Instruments
por: Pillay, Ashwin
Publicado: (2025)
por: Pillay, Ashwin
Publicado: (2025)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
por: Wei, Haojie, et al.
Publicado: (2023)
por: Wei, Haojie, et al.
Publicado: (2023)
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
por: Zeng, Wei, et al.
Publicado: (2024)
por: Zeng, Wei, et al.
Publicado: (2024)
Sound Separation and Classification with Object and Semantic Guidance
por: Kwon, Younghoo, et al.
Publicado: (2025)
por: Kwon, Younghoo, et al.
Publicado: (2025)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023)
por: Bae, Sangmin, et al.
Publicado: (2023)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
por: Li, Haowen, et al.
Publicado: (2026)
por: Li, Haowen, et al.
Publicado: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Event Classification by Physics-informed Inpainting for Distributed Multichannel Acoustic Sensor with Partially Degraded Channels
por: Tonami, Noriyuki, et al.
Publicado: (2026)
por: Tonami, Noriyuki, et al.
Publicado: (2026)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
Region-Specific Audio Tagging for Spatial Sound
por: Zhao, Jinzheng, et al.
Publicado: (2025)
por: Zhao, Jinzheng, et al.
Publicado: (2025)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
TF-Mamba: A Time-Frequency Network for Sound Source Localization
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Ejemplares similares
-
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024) -
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025) -
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021) -
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
por: Lee, Dongheon, et al.
Publicado: (2023) -
Self-Guided Target Sound Extraction and Classification Through Universal Sound Separation Model and Multiple Clues
por: Kwon, Younghoo, et al.
Publicado: (2025)