Guardado en:
| Autores principales: | Hu, Jinbo, Cao, Yin, Wu, Ming, Kang, Fang, Yang, Feiran, Wang, Wenwu, Plumbley, Mark D., Yang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2411.06399 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2023)
por: Hu, Jinbo, et al.
Publicado: (2023)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024)
por: Bibbó, Gabriel, et al.
Publicado: (2024)
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Exploring the User Experience of AI-Assisted Sound Searching Systems for Creative Workflows
por: Liu, Haohe, et al.
Publicado: (2025)
por: Liu, Haohe, et al.
Publicado: (2025)
EnvSDD: Benchmarking Environmental Sound Deepfake Detection
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
por: Atito, Sara, et al.
Publicado: (2022)
por: Atito, Sara, et al.
Publicado: (2022)
Region-Specific Audio Tagging for Spatial Sound
por: Zhao, Jinzheng, et al.
Publicado: (2025)
por: Zhao, Jinzheng, et al.
Publicado: (2025)
SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing
por: Hu, Jinbo, et al.
Publicado: (2025)
por: Hu, Jinbo, et al.
Publicado: (2025)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
FMSG-JLESS Submission for DCASE 2024 Task4 on Sound Event Detection with Heterogeneous Training Dataset and Potentially Missing Labels
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
BioDCASE 2026 Challenge Baseline for Cross-Domain Mosquito Species Classification
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
WildDESED: An LLM-Powered Dataset for Wild Domestic Environment Sound Event Detection System
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
Environmental Sound Classification on An Embedded Hardware Platform
por: Bibbo, Gabriel, et al.
Publicado: (2023)
por: Bibbo, Gabriel, et al.
Publicado: (2023)
CNN-based Robust Sound Source Localization with SRP-PHAT for the Extreme Edge
por: Yin, Jun, et al.
Publicado: (2025)
por: Yin, Jun, et al.
Publicado: (2025)
Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Binaural Sound Event Localization and Detection Neural Network based on HRTF Localization Cues for Humanoid Robots
por: Lee, Gyeong-Tae
Publicado: (2025)
por: Lee, Gyeong-Tae
Publicado: (2025)
Effective Pre-Training of Audio Transformers for Sound Event Detection
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
por: Zhong, Guirui, et al.
Publicado: (2025)
por: Zhong, Guirui, et al.
Publicado: (2025)
FSD50K-Solo: Automated Curation of Single-Source Sound Events
por: Yang, Ningyuan, et al.
Publicado: (2026)
por: Yang, Ningyuan, et al.
Publicado: (2026)
Exploring Differences between Human Perception and Model Inference in Audio Event Recognition
por: Tan, Yizhou, et al.
Publicado: (2024)
por: Tan, Yizhou, et al.
Publicado: (2024)
Pre-training Autoencoder for Acoustic Event Classification via Blinky
por: Liu, Xiaoyang, et al.
Publicado: (2025)
por: Liu, Xiaoyang, et al.
Publicado: (2025)
Zero- and Few-shot Sound Event Localization and Detection
por: Shimada, Kazuki, et al.
Publicado: (2023)
por: Shimada, Kazuki, et al.
Publicado: (2023)
Ensemble Confidence Calibration for Sound Event Detection in Open-environment
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
w2v-SELD: A Sound Event Localization and Detection Framework for Self-Supervised Spatial Audio Pre-Training
por: Santos, Orlem Lima dos, et al.
Publicado: (2023)
por: Santos, Orlem Lima dos, et al.
Publicado: (2023)
Location-Oriented Sound Event Localization and Detection with Spatial Mapping and Regression Localization
por: Zhang, Xueping, et al.
Publicado: (2025)
por: Zhang, Xueping, et al.
Publicado: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
MAGENTA: Magnitude and Geometry-ENhanced Training Approach for Robust Long-Tailed Sound Event Localization and Detection
por: Yeow, Jun-Wei, et al.
Publicado: (2025)
por: Yeow, Jun-Wei, et al.
Publicado: (2025)
Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet
por: Gao, Wenmiao, et al.
Publicado: (2025)
por: Gao, Wenmiao, et al.
Publicado: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
por: Mei, Xinhao, et al.
Publicado: (2023)
por: Mei, Xinhao, et al.
Publicado: (2023)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Ejemplares similares
-
Selective-Memory Meta-Learning with Environment Representations for Sound Event Localization and Detection
por: Hu, Jinbo, et al.
Publicado: (2023) -
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
por: Yuan, Yi, et al.
Publicado: (2023) -
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
por: Bibbó, Gabriel, et al.
Publicado: (2024) -
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
por: Yuan, Yi, et al.
Publicado: (2024) -
Exploring the User Experience of AI-Assisted Sound Searching Systems for Creative Workflows
por: Liu, Haohe, et al.
Publicado: (2025)