Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Do Hyun, Song, Yoonah, Kim, Hong Kook |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sound event detection based on auxiliary decoder and maximum probability aggregation for DCASE Challenge 2024 Task 4
por: Son, Sang Won, et al.
Publicado: (2024)
por: Son, Sang Won, et al.
Publicado: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
por: Xiao, Feiyang, et al.
Publicado: (2024)
por: Xiao, Feiyang, et al.
Publicado: (2024)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
por: Wu, Yusong, et al.
Publicado: (2022)
por: Wu, Yusong, et al.
Publicado: (2022)
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
por: Kim, Hyun Jun, et al.
Publicado: (2025)
por: Kim, Hyun Jun, et al.
Publicado: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Sound Scene Synthesis at the DCASE 2024 Challenge
por: Lagrange, Mathieu, et al.
Publicado: (2025)
por: Lagrange, Mathieu, et al.
Publicado: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
DCASE 2024 Task 4: Sound Event Detection with Heterogeneous Data and Missing Labels
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
por: Yasuda, Masahiro, et al.
Publicado: (2025)
por: Yasuda, Masahiro, et al.
Publicado: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
Description and analysis of novelties introduced in DCASE Task 4 2022 on the baseline system
por: Ronchini, Francesca, et al.
Publicado: (2022)
por: Ronchini, Francesca, et al.
Publicado: (2022)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
por: Schmid, Florian, et al.
Publicado: (2025)
por: Schmid, Florian, et al.
Publicado: (2025)
BioDCASE 2026 Challenge Baseline for Cross-Domain Mosquito Species Classification
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
por: Nishida, Tomoya, et al.
Publicado: (2026)
por: Nishida, Tomoya, et al.
Publicado: (2026)
Description and Discussion on DCASE 2025 Challenge Task 2: First-shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
por: Nishida, Tomoya, et al.
Publicado: (2025)
por: Nishida, Tomoya, et al.
Publicado: (2025)
FMSG-JLESS Submission for DCASE 2024 Task4 on Sound Event Detection with Heterogeneous Training Dataset and Potentially Missing Labels
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning
por: Changin, Choi, et al.
Publicado: (2024)
por: Changin, Choi, et al.
Publicado: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
por: Liu, Jizhong, et al.
Publicado: (2024)
por: Liu, Jizhong, et al.
Publicado: (2024)
Description and Discussion on DCASE 2024 Challenge Task 2: First-Shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
por: Nishida, Tomoya, et al.
Publicado: (2024)
por: Nishida, Tomoya, et al.
Publicado: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Task-Aware Unified Source Separation
por: Saijo, Kohei, et al.
Publicado: (2024)
por: Saijo, Kohei, et al.
Publicado: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
FlowSep: Language-Queried Sound Separation with Rectified Flow Matching
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
por: Shi, Runwu, et al.
Publicado: (2025)
por: Shi, Runwu, et al.
Publicado: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
A decade of DCASE: Achievements, practices, evaluations and future challenges
por: Mesaros, Annamaria, et al.
Publicado: (2024)
por: Mesaros, Annamaria, et al.
Publicado: (2024)
Unlocking Large Audio-Language Models for Interactive Language Learning
por: Liu, Hongfu, et al.
Publicado: (2026)
por: Liu, Hongfu, et al.
Publicado: (2026)
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
por: Tsutsumi, Ayuto, et al.
Publicado: (2026)
por: Tsutsumi, Ayuto, et al.
Publicado: (2026)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
por: Chen, Yuanjian, et al.
Publicado: (2025)
por: Chen, Yuanjian, et al.
Publicado: (2025)
Ejemplares similares
-
Sound event detection based on auxiliary decoder and maximum probability aggregation for DCASE Challenge 2024 Task 4
por: Son, Sang Won, et al.
Publicado: (2024) -
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
por: Xiao, Feiyang, et al.
Publicado: (2024) -
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
por: Wu, Yusong, et al.
Publicado: (2022) -
AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval
por: Kim, Hyun Jun, et al.
Publicado: (2025) -
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
por: Schmid, Florian, et al.
Publicado: (2024)