SoundCollage: Automated Discovery of New Classes in Audio Datasets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Ryuhaerang, Chatterjee, Soumyajit, Spathis, Dimitris, Lee, Sung-Ju, Kawsar, Fahim, Malekzadeh, Mohammad |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024)
par: Lee, Dongheon, et autres
Publié: (2024)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
par: Wijngaard, Gijs, et autres
Publié: (2024)
par: Wijngaard, Gijs, et autres
Publié: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds
par: Hasumi, Takuya, et autres
Publié: (2025)
par: Hasumi, Takuya, et autres
Publié: (2025)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
par: Xu, Qisheng, et autres
Publié: (2024)
par: Xu, Qisheng, et autres
Publié: (2024)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
par: Kishi, Minoru, et autres
Publié: (2025)
par: Kishi, Minoru, et autres
Publié: (2025)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
par: Bibbó, Gabriel, et autres
Publié: (2024)
par: Bibbó, Gabriel, et autres
Publié: (2024)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
Class-Incremental Learning for Multi-Label Audio Classification
par: Mulimani, Manjunath, et autres
Publié: (2024)
par: Mulimani, Manjunath, et autres
Publié: (2024)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
par: Tailleur, Modan, et autres
Publié: (2024)
par: Tailleur, Modan, et autres
Publié: (2024)
ASPED: An Audio Dataset for Detecting Pedestrians
par: Seshadri, Pavan, et autres
Publié: (2023)
par: Seshadri, Pavan, et autres
Publié: (2023)
Effective Pre-Training of Audio Transformers for Sound Event Detection
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
par: Xie, Zeyu, et autres
Publié: (2023)
par: Xie, Zeyu, et autres
Publié: (2023)
Online Single-Channel Audio-Based Sound Speed Estimation for Robust Multi-Channel Audio Control
par: Fuglsig, Andreas Jonas, et autres
Publié: (2026)
par: Fuglsig, Andreas Jonas, et autres
Publié: (2026)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
par: Hou, Yuanbo, et autres
Publié: (2026)
par: Hou, Yuanbo, et autres
Publié: (2026)
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
par: Wang, Pingjie, et autres
Publié: (2024)
par: Wang, Pingjie, et autres
Publié: (2024)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection
par: Han, Bing, et autres
Publié: (2025)
par: Han, Bing, et autres
Publié: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
Can Audio Reveal Music Performance Difficulty? Insights from the Piano Syllabus Dataset
par: Ramoneda, Pedro, et autres
Publié: (2024)
par: Ramoneda, Pedro, et autres
Publié: (2024)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Analytic Class Incremental Learning for Sound Source Localization with Privacy Protection
par: Qian, Xinyuan, et autres
Publié: (2024)
par: Qian, Xinyuan, et autres
Publié: (2024)
UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
par: Li, Baihan, et autres
Publié: (2024)
par: Li, Baihan, et autres
Publié: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
par: Roman, Adrian S., et autres
Publié: (2025)
par: Roman, Adrian S., et autres
Publié: (2025)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
par: Delgado, Pablo M., et autres
Publié: (2025)
par: Delgado, Pablo M., et autres
Publié: (2025)
Audio-Language Datasets of Scenes and Events: A Survey
par: Wijngaard, Gijs, et autres
Publié: (2024)
par: Wijngaard, Gijs, et autres
Publié: (2024)
MLAAD: The Multi-Language Audio Anti-Spoofing Dataset
par: Müller, Nicolas M., et autres
Publié: (2024)
par: Müller, Nicolas M., et autres
Publié: (2024)
Construction and Analysis of Impression Caption Dataset for Environmental Sounds
par: Okamoto, Yuki, et autres
Publié: (2024)
par: Okamoto, Yuki, et autres
Publié: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
par: Dehaghania, Parinaz Binandeh, et autres
Publié: (2026)
par: Dehaghania, Parinaz Binandeh, et autres
Publié: (2026)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound
par: Grötschla, Florian, et autres
Publié: (2026)
par: Grötschla, Florian, et autres
Publié: (2026)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
AFT: An Exemplar-Free Class Incremental Learning Method for Environmental Sound Classification
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
Sound Check: Auditing Audio Datasets
par: Agnew, William, et autres
Publié: (2024)
par: Agnew, William, et autres
Publié: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
par: Zhao, Yan, et autres
Publié: (2022)
par: Zhao, Yan, et autres
Publié: (2022)
Documents similaires
-
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024) -
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
par: Wijngaard, Gijs, et autres
Publié: (2024) -
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024) -
DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds
par: Hasumi, Takuya, et autres
Publié: (2025) -
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)