Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Xuanru, Shao, Yiwen, Tseng, Wei-Cheng, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
por: Poncelet, Jakob, et al.
Publicado: (2021)
por: Poncelet, Jakob, et al.
Publicado: (2021)
ProLAP: Probabilistic Language-Audio Pre-Training
por: Manabe, Toranosuke, et al.
Publicado: (2025)
por: Manabe, Toranosuke, et al.
Publicado: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
por: Bharadwaj, Shikhar, et al.
Publicado: (2025)
por: Bharadwaj, Shikhar, et al.
Publicado: (2025)
w2v-SELD: A Sound Event Localization and Detection Framework for Self-Supervised Spatial Audio Pre-Training
por: Santos, Orlem Lima dos, et al.
Publicado: (2023)
por: Santos, Orlem Lima dos, et al.
Publicado: (2023)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
por: Li, Chenxing, et al.
Publicado: (2024)
por: Li, Chenxing, et al.
Publicado: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Efficient Scaling for LLM-based ASR
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
por: Xu, Xuenan, et al.
Publicado: (2023)
por: Xu, Xuenan, et al.
Publicado: (2023)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
por: Zhao, Hang, et al.
Publicado: (2024)
por: Zhao, Hang, et al.
Publicado: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection
por: Han, Bing, et al.
Publicado: (2025)
por: Han, Bing, et al.
Publicado: (2025)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models
por: Whetten, Ryan, et al.
Publicado: (2026)
por: Whetten, Ryan, et al.
Publicado: (2026)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
por: Lu, Ke-Han, et al.
Publicado: (2025)
por: Lu, Ke-Han, et al.
Publicado: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Probing the Robustness Properties of Neural Speech Codecs
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
por: Wilkinghoff, Kevin, et al.
Publicado: (2026)
por: Wilkinghoff, Kevin, et al.
Publicado: (2026)
Unlocking Large Audio-Language Models for Interactive Language Learning
por: Liu, Hongfu, et al.
Publicado: (2026)
por: Liu, Hongfu, et al.
Publicado: (2026)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024)
por: Liu, Shengqiang, et al.
Publicado: (2024)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
por: Shao, Yiwen, et al.
Publicado: (2025)
por: Shao, Yiwen, et al.
Publicado: (2025)
Studying the Effect of Audio Filters in Pre-Trained Models for Environmental Sound Classification
por: Dawn, Aditya, et al.
Publicado: (2024)
por: Dawn, Aditya, et al.
Publicado: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
por: Jia, Yuhang, et al.
Publicado: (2024)
por: Jia, Yuhang, et al.
Publicado: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Ejemplares similares
-
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025) -
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023) -
Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
por: Tseng, Wei-Cheng, et al.
Publicado: (2025) -
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
por: Poncelet, Jakob, et al.
Publicado: (2021) -
ProLAP: Probabilistic Language-Audio Pre-Training
por: Manabe, Toranosuke, et al.
Publicado: (2025)