Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Do Hyun, Song, Yoonah, Kim, Hong Kook |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sound event detection based on auxiliary decoder and maximum probability aggregation for DCASE Challenge 2024 Task 4
di: Son, Sang Won, et al.
Pubblicazione: (2024)
di: Son, Sang Won, et al.
Pubblicazione: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
di: Wu, Yusong, et al.
Pubblicazione: (2022)
di: Wu, Yusong, et al.
Pubblicazione: (2022)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Sound Scene Synthesis at the DCASE 2024 Challenge
di: Lagrange, Mathieu, et al.
Pubblicazione: (2025)
di: Lagrange, Mathieu, et al.
Pubblicazione: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
DCASE 2024 Task 4: Sound Event Detection with Heterogeneous Data and Missing Labels
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
di: Yasuda, Masahiro, et al.
Pubblicazione: (2025)
di: Yasuda, Masahiro, et al.
Pubblicazione: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Description and analysis of novelties introduced in DCASE Task 4 2022 on the baseline system
di: Ronchini, Francesca, et al.
Pubblicazione: (2022)
di: Ronchini, Francesca, et al.
Pubblicazione: (2022)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2025)
di: Schmid, Florian, et al.
Pubblicazione: (2025)
BioDCASE 2026 Challenge Baseline for Cross-Domain Mosquito Species Classification
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
Description and Discussion on DCASE 2025 Challenge Task 2: First-shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2025)
di: Nishida, Tomoya, et al.
Pubblicazione: (2025)
FMSG-JLESS Submission for DCASE 2024 Task4 on Sound Event Detection with Heterogeneous Training Dataset and Potentially Missing Labels
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning
di: Changin, Choi, et al.
Pubblicazione: (2024)
di: Changin, Choi, et al.
Pubblicazione: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
Description and Discussion on DCASE 2024 Challenge Task 2: First-Shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Task-Aware Unified Source Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
di: Shi, Runwu, et al.
Pubblicazione: (2025)
di: Shi, Runwu, et al.
Pubblicazione: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
A decade of DCASE: Achievements, practices, evaluations and future challenges
di: Mesaros, Annamaria, et al.
Pubblicazione: (2024)
di: Mesaros, Annamaria, et al.
Pubblicazione: (2024)
Unlocking Large Audio-Language Models for Interactive Language Learning
di: Liu, Hongfu, et al.
Pubblicazione: (2026)
di: Liu, Hongfu, et al.
Pubblicazione: (2026)
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2026)
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2026)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
di: Chen, Yuanjian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sound event detection based on auxiliary decoder and maximum probability aggregation for DCASE Challenge 2024 Task 4
di: Son, Sang Won, et al.
Pubblicazione: (2024) -
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024) -
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
di: Wu, Yusong, et al.
Pubblicazione: (2022) -
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
di: Kim, Hyun Jun, et al.
Pubblicazione: (2025) -
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)