SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Alex, Tony, Ahmed, Sara, Mustafa, Armin, Awais, Muhammad, Jackson, Philip JB |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
par: Zeng, Wei, et autres
Publié: (2024)
par: Zeng, Wei, et autres
Publié: (2024)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
par: Chen, Yuanjian, et autres
Publié: (2026)
par: Chen, Yuanjian, et autres
Publié: (2026)
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
par: Guo, Xiaoxuan, et autres
Publié: (2025)
par: Guo, Xiaoxuan, et autres
Publié: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024)
par: Lee, Dongheon, et autres
Publié: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
par: Roman, Adrian S., et autres
Publié: (2025)
par: Roman, Adrian S., et autres
Publié: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Generating Moving 3D Soundscapes with Latent Diffusion Models
par: Templin, Christian, et autres
Publié: (2025)
par: Templin, Christian, et autres
Publié: (2025)
Transferable Adversarial Attacks on Audio Deepfake Detection
par: Farooq, Muhammad Umar, et autres
Publié: (2025)
par: Farooq, Muhammad Umar, et autres
Publié: (2025)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
par: Zhao, Junqi, et autres
Publié: (2024)
par: Zhao, Junqi, et autres
Publié: (2024)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
par: Cai, Pengfei, et autres
Publié: (2024)
par: Cai, Pengfei, et autres
Publié: (2024)
Improving Speech Inversion Through Self-Supervised Embeddings and Enhanced Tract Variables
par: Attia, Ahmed Adel, et autres
Publié: (2023)
par: Attia, Ahmed Adel, et autres
Publié: (2023)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
par: Wei, Haojie, et autres
Publié: (2023)
par: Wei, Haojie, et autres
Publié: (2023)
Soundscape Captioning using Sound Affective Quality Network and Large Language Model
par: Hou, Yuanbo, et autres
Publié: (2024)
par: Hou, Yuanbo, et autres
Publié: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
par: Li, Tingle, et autres
Publié: (2024)
par: Li, Tingle, et autres
Publié: (2024)
Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT
par: Dai, Dongyang, et autres
Publié: (2025)
par: Dai, Dongyang, et autres
Publié: (2025)
Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection
par: Han, Bing, et autres
Publié: (2025)
par: Han, Bing, et autres
Publié: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
par: Luong, Justin, et autres
Publié: (2025)
par: Luong, Justin, et autres
Publié: (2025)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
par: Kang, Minjae, et autres
Publié: (2025)
par: Kang, Minjae, et autres
Publié: (2025)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
par: Aboeitta, Ahmed, et autres
Publié: (2025)
par: Aboeitta, Ahmed, et autres
Publié: (2025)
A Neural Score Follower for Computer Accompaniment of Polyphonic Musical Instruments
par: Pillay, Ashwin
Publié: (2025)
par: Pillay, Ashwin
Publié: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Semi-Supervised Self-Learning Enhanced Music Emotion Recognition
par: Sun, Yifu, et autres
Publié: (2024)
par: Sun, Yifu, et autres
Publié: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
par: Wilkins, Julia, et autres
Publié: (2024)
par: Wilkins, Julia, et autres
Publié: (2024)
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
par: Guan, Yadong, et autres
Publié: (2024)
par: Guan, Yadong, et autres
Publié: (2024)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
par: Li, Haowen, et autres
Publié: (2026)
par: Li, Haowen, et autres
Publié: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
par: Sinha, Anshuman, et autres
Publié: (2024)
par: Sinha, Anshuman, et autres
Publié: (2024)
ARAUS: A Large-Scale Dataset and Baseline Models of Affective Responses to Augmented Urban Soundscapes
par: Ooi, Kenneth, et autres
Publié: (2022)
par: Ooi, Kenneth, et autres
Publié: (2022)
Feature Selection via Graph Topology Inference for Soundscape Emotion Recognition
par: Rey, Samuel, et autres
Publié: (2025)
par: Rey, Samuel, et autres
Publié: (2025)
Autonomous Soundscape Augmentation with Multimodal Fusion of Visual and Participant-linked Inputs
par: Ooi, Kenneth, et autres
Publié: (2023)
par: Ooi, Kenneth, et autres
Publié: (2023)
Robust Bioacoustic Detection via Richly Labelled Synthetic Soundscape Augmentation
par: Soltero, Kaspar, et autres
Publié: (2025)
par: Soltero, Kaspar, et autres
Publié: (2025)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
AudioScene: Integrating Object-Event Audio into 3D Scenes
par: Yuan, Shuaihang, et autres
Publié: (2025)
par: Yuan, Shuaihang, et autres
Publié: (2025)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
par: Gerami, Armin, et autres
Publié: (2025)
par: Gerami, Armin, et autres
Publié: (2025)
MATS: An Audio Language Model under Text-only Supervision
par: Wang, Wen, et autres
Publié: (2025)
par: Wang, Wen, et autres
Publié: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
Dynamic Multi-Species Bird Soundscape Generation with Acoustic Patterning and 3D Spatialization
par: Zhang, Ellie L., et autres
Publié: (2025)
par: Zhang, Ellie L., et autres
Publié: (2025)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
par: Hyeon, Jonghwan, et autres
Publié: (2024)
par: Hyeon, Jonghwan, et autres
Publié: (2024)
Documents similaires
-
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025) -
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
par: Zeng, Wei, et autres
Publié: (2024) -
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
par: Chen, Yuanjian, et autres
Publié: (2026) -
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
par: Guo, Xiaoxuan, et autres
Publié: (2025) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024)