AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Qisheng, Sun, Yulin, Su, Yi, Zhu, Qian, Tan, Xiaoyi, Wen, Hongyu, Gao, Zijian, Xu, Kele, Dou, Yong, Feng, Dawei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
par: Deng, Xuyao, et autres
Publié: (2025)
par: Deng, Xuyao, et autres
Publié: (2025)
Class-Incremental Learning for Multi-Label Audio Classification
par: Mulimani, Manjunath, et autres
Publié: (2024)
par: Mulimani, Manjunath, et autres
Publié: (2024)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
par: Poole, Katarina C., et autres
Publié: (2025)
par: Poole, Katarina C., et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
Binamix -- A Python Library for Generating Binaural Audio Datasets
par: Barry, Dan, et autres
Publié: (2025)
par: Barry, Dan, et autres
Publié: (2025)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
Contrastive Learning-based Chaining-Cluster for Multilingual Voice-Face Association
par: Chen, Wuyang, et autres
Publié: (2024)
par: Chen, Wuyang, et autres
Publié: (2024)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Audiosockets: A Python socket package for Real-Time Audio Processing
par: Shu, Nicolas, et autres
Publié: (2024)
par: Shu, Nicolas, et autres
Publié: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
Audio-Language Datasets of Scenes and Events: A Survey
par: Wijngaard, Gijs, et autres
Publié: (2024)
par: Wijngaard, Gijs, et autres
Publié: (2024)
AudioScene: Integrating Object-Event Audio into 3D Scenes
par: Yuan, Shuaihang, et autres
Publié: (2025)
par: Yuan, Shuaihang, et autres
Publié: (2025)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
par: Yeh, Yen-Tung, et autres
Publié: (2024)
par: Yeh, Yen-Tung, et autres
Publié: (2024)
Fully Few-shot Class-incremental Audio Classification Using Expandable Dual-embedding Extractor
par: Si, Yongjie, et autres
Publié: (2024)
par: Si, Yongjie, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
par: Choi, Ryuhaerang, et autres
Publié: (2024)
par: Choi, Ryuhaerang, et autres
Publié: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
par: Hou, Yuanbo, et autres
Publié: (2026)
par: Hou, Yuanbo, et autres
Publié: (2026)
Unified Audio Event Detection
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
Towards Robust Few-shot Class Incremental Learning in Audio Classification using Contrastive Representation
par: Singh, Riyansha, et autres
Publié: (2024)
par: Singh, Riyansha, et autres
Publié: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Towards Weakly Supervised Text-to-Audio Grounding
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
par: Xu, Xuenan, et autres
Publié: (2023)
par: Xu, Xuenan, et autres
Publié: (2023)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
par: Cai, Yiqiang, et autres
Publié: (2024)
par: Cai, Yiqiang, et autres
Publié: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
WAKE: Watermarking Audio with Key Enrichment
par: Xu, Yaoxun, et autres
Publié: (2025)
par: Xu, Yaoxun, et autres
Publié: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
par: Wang, Yucheng, et autres
Publié: (2026)
par: Wang, Yucheng, et autres
Publié: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
Documents similaires
-
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025) -
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
par: Deng, Xuyao, et autres
Publié: (2025) -
Class-Incremental Learning for Multi-Label Audio Classification
par: Mulimani, Manjunath, et autres
Publié: (2024) -
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
par: Poole, Katarina C., et autres
Publié: (2025) -
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)