Salvato in:
| Autori principali: | Xu, Qisheng, Sun, Yulin, Su, Yi, Zhu, Qian, Tan, Xiaoyi, Wen, Hongyu, Gao, Zijian, Xu, Kele, Dou, Yong, Feng, Dawei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2412.11907 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
di: Deng, Xuyao, et al.
Pubblicazione: (2025)
di: Deng, Xuyao, et al.
Pubblicazione: (2025)
Class-Incremental Learning for Multi-Label Audio Classification
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
Contrastive Learning-based Chaining-Cluster for Multilingual Voice-Face Association
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
Region-Specific Audio Tagging for Spatial Sound
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
Binamix -- A Python Library for Generating Binaural Audio Datasets
di: Barry, Dan, et al.
Pubblicazione: (2025)
di: Barry, Dan, et al.
Pubblicazione: (2025)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
Audiosockets: A Python socket package for Real-Time Audio Processing
di: Shu, Nicolas, et al.
Pubblicazione: (2024)
di: Shu, Nicolas, et al.
Pubblicazione: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
Audio-Language Datasets of Scenes and Events: A Survey
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
Fully Few-shot Class-incremental Audio Classification Using Expandable Dual-embedding Extractor
di: Si, Yongjie, et al.
Pubblicazione: (2024)
di: Si, Yongjie, et al.
Pubblicazione: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
Towards Robust Few-shot Class Incremental Learning in Audio Classification using Contrastive Representation
di: Singh, Riyansha, et al.
Pubblicazione: (2024)
di: Singh, Riyansha, et al.
Pubblicazione: (2024)
SoundCollage: Automated Discovery of New Classes in Audio Datasets
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
di: Choi, Ryuhaerang, et al.
Pubblicazione: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Efficient Video to Audio Mapper with Visual Scene Detection
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
WAKE: Watermarking Audio with Key Enrichment
di: Xu, Yaoxun, et al.
Pubblicazione: (2025)
di: Xu, Yaoxun, et al.
Pubblicazione: (2025)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
di: Cai, Yiqiang, et al.
Pubblicazione: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025) -
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
di: Deng, Xuyao, et al.
Pubblicazione: (2025) -
Class-Incremental Learning for Multi-Label Audio Classification
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024) -
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
di: Poole, Katarina C., et al.
Pubblicazione: (2025) -
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)