Leveraging Language Model Capabilities for Sound Event Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Hualei, Mao, Jianguo, Guo, Zhifang, Wan, Jiarui, Liu, Hong, Wang, Xiangdong |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlexSED: Towards Open-Vocabulary Sound Event Detection
par: Hai, Jiarui, et autres
Publié: (2025)
par: Hai, Jiarui, et autres
Publié: (2025)
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
par: Hai, Jiarui, et autres
Publié: (2025)
par: Hai, Jiarui, et autres
Publié: (2025)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
par: Cai, Pengfei, et autres
Publié: (2025)
par: Cai, Pengfei, et autres
Publié: (2025)
SELD-Mamba: Selective State-Space Model for Sound Event Localization and Detection with Source Distance Estimation
par: Mu, Da, et autres
Publié: (2024)
par: Mu, Da, et autres
Publié: (2024)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
par: Bibbó, Gabriel, et autres
Publié: (2024)
par: Bibbó, Gabriel, et autres
Publié: (2024)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
ASD-Diffusion: Anomalous Sound Detection with Diffusion Models
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes
par: Roman, Adrian S., et autres
Publié: (2024)
par: Roman, Adrian S., et autres
Publié: (2024)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Contrastive Learning with Spectrum Information Augmentation in Abnormal Sound Detection
par: Meng, Xinxin, et autres
Publié: (2025)
par: Meng, Xinxin, et autres
Publié: (2025)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
MFF-EINV2: Multi-scale Feature Fusion across Spectral-Spatial-Temporal Domains for Sound Event Localization and Detection
par: Mu, Da, et autres
Publié: (2024)
par: Mu, Da, et autres
Publié: (2024)
Abstract Sound Fusion with Unconditional Inversion Models
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
TLDiffGAN: A Latent Diffusion-GAN Framework with Temporal Information Fusion for Anomalous Sound Detection
par: Ma, Chengyuan, et autres
Publié: (2026)
par: Ma, Chengyuan, et autres
Publié: (2026)
Sound Classification of Four Insect Classes
par: Wang, Yinxuan, et autres
Publié: (2024)
par: Wang, Yinxuan, et autres
Publié: (2024)
Improving Anomalous Sound Detection via Low-Rank Adaptation Fine-Tuning of Pre-Trained Audio Models
par: Zheng, Xinhu, et autres
Publié: (2024)
par: Zheng, Xinhu, et autres
Publié: (2024)
MIMII-Gen: Generative Modeling Approach for Simulated Evaluation of Anomalous Sound Detection System
par: Purohit, Harsh, et autres
Publié: (2024)
par: Purohit, Harsh, et autres
Publié: (2024)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
par: Negroni, Viola, et autres
Publié: (2024)
par: Negroni, Viola, et autres
Publié: (2024)
Deep Generic Representations for Domain-Generalized Anomalous Sound Detection
par: Saengthong, Phurich, et autres
Publié: (2024)
par: Saengthong, Phurich, et autres
Publié: (2024)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
par: Zhao, Junqi, et autres
Publié: (2024)
par: Zhao, Junqi, et autres
Publié: (2024)
OpenSep: Leveraging Large Language Models with Textual Inversion for Open World Audio Separation
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
par: Guo, Yiwei, et autres
Publié: (2025)
par: Guo, Yiwei, et autres
Publié: (2025)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
par: Li, Bohan, et autres
Publié: (2026)
par: Li, Bohan, et autres
Publié: (2026)
Leveraging Label Potential for Enhanced Multimodal Emotion Recognition
par: Shao, Xuechun, et autres
Publié: (2025)
par: Shao, Xuechun, et autres
Publié: (2025)
EvMic: Event-based Non-contact sound recovery from effective spatial-temporal modeling
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
Hybrid Disagreement-Diversity Active Learning for Bioacoustic Sound Event Detection
par: Zhang, Shiqi, et autres
Publié: (2025)
par: Zhang, Shiqi, et autres
Publié: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
par: Chen, Yuanjian, et autres
Publié: (2025)
par: Chen, Yuanjian, et autres
Publié: (2025)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
CycleGuardian: A Framework for Automatic RespiratorySound classification Based on Improved Deep clustering and Contrastive Learning
par: Chu, Yun, et autres
Publié: (2025)
par: Chu, Yun, et autres
Publié: (2025)
No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction
par: Zhou, Haoshuai, et autres
Publié: (2025)
par: Zhou, Haoshuai, et autres
Publié: (2025)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
MIMII-Agent: Leveraging LLMs with Function Calling for Relative Evaluation of Anomalous Sound Detection
par: Purohit, Harsh, et autres
Publié: (2025)
par: Purohit, Harsh, et autres
Publié: (2025)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification
par: Kim, June-Woo, et autres
Publié: (2024)
par: Kim, June-Woo, et autres
Publié: (2024)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
par: Dang, Ting, et autres
Publié: (2025)
par: Dang, Ting, et autres
Publié: (2025)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
par: Guragain, Anmol, et autres
Publié: (2024)
par: Guragain, Anmol, et autres
Publié: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
Documents similaires
-
FlexSED: Towards Open-Vocabulary Sound Event Detection
par: Hai, Jiarui, et autres
Publié: (2025) -
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
par: Hai, Jiarui, et autres
Publié: (2025) -
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
par: Cai, Pengfei, et autres
Publié: (2025) -
SELD-Mamba: Selective State-Space Model for Sound Event Localization and Detection with Source Distance Estimation
par: Mu, Da, et autres
Publié: (2024) -
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
par: Bibbó, Gabriel, et autres
Publié: (2024)