WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuksel, Goksenin, Guetschel, Pierre, Tangermann, Michael, van Gerven, Marcel, van der Heijden, Kiki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GRAM: Spatial general-purpose audio representation models for real-world applications
por: Yuksel, Goksenin, et al.
Publicado: (2025)
por: Yuksel, Goksenin, et al.
Publicado: (2025)
GRAM: Spatial general-purpose audio representations for real-world environments
por: Yuksel, Goksenin, et al.
Publicado: (2026)
por: Yuksel, Goksenin, et al.
Publicado: (2026)
Leveraging Spatial Cues from Cochlear Implant Microphones to Efficiently Enhance Speech Separation in Real-World Listening Scenes
por: Olalere, Feyisayo, et al.
Publicado: (2025)
por: Olalere, Feyisayo, et al.
Publicado: (2025)
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
por: Ledder, Wessel, et al.
Publicado: (2024)
por: Ledder, Wessel, et al.
Publicado: (2024)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
por: Kuang, Sheng, et al.
Publicado: (2022)
por: Kuang, Sheng, et al.
Publicado: (2022)
Scaling up masked audio encoder learning for general audio classification
por: Dinkel, Heinrich, et al.
Publicado: (2024)
por: Dinkel, Heinrich, et al.
Publicado: (2024)
A robust audio deepfake detection system via multi-view feature
por: Yang, Yujie, et al.
Publicado: (2024)
por: Yang, Yujie, et al.
Publicado: (2024)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
por: Kounadis-Bastian, Dionyssos, et al.
Publicado: (2024)
por: Kounadis-Bastian, Dionyssos, et al.
Publicado: (2024)
AxLSTMs: learning self-supervised audio representations with xLSTMs
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
Deep learning based spatial aliasing reduction in beamforming for audio capture
por: Guzik, Mateusz, et al.
Publicado: (2025)
por: Guzik, Mateusz, et al.
Publicado: (2025)
Decodable but not structured: linear probing enables Underwater Acoustic Target Recognition with pretrained audio embeddings
por: Hummel, Hilde I., et al.
Publicado: (2026)
por: Hummel, Hilde I., et al.
Publicado: (2026)
Efficient learning-based sound propagation for virtual and real-world audio processing applications
por: Ratnarajah, Anton Jeran
Publicado: (2024)
por: Ratnarajah, Anton Jeran
Publicado: (2024)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
Towards audio language modeling -- an overview
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Are audio DeepFake detection models polyglots?
por: Marek, Bartłomiej, et al.
Publicado: (2024)
por: Marek, Bartłomiej, et al.
Publicado: (2024)
Probing mental health information in speech foundation models
por: de Gennes, Marc, et al.
Publicado: (2024)
por: de Gennes, Marc, et al.
Publicado: (2024)
WavMark: Watermarking for Audio Generation
por: Chen, Guangyu, et al.
Publicado: (2023)
por: Chen, Guangyu, et al.
Publicado: (2023)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
por: Deng, Keqi, et al.
Publicado: (2024)
por: Deng, Keqi, et al.
Publicado: (2024)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
por: Nakazawa, Kazushi
Publicado: (2026)
por: Nakazawa, Kazushi
Publicado: (2026)
Tweaking autoregressive methods for inpainting of gaps in audio signals
por: Mokrý, Ondřej, et al.
Publicado: (2024)
por: Mokrý, Ondřej, et al.
Publicado: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
por: Zhang, Ruonan, et al.
Publicado: (2025)
por: Zhang, Ruonan, et al.
Publicado: (2025)
Real-time implementation of vibrato transfer as an audio effect
por: Hyrkas, Jeremy
Publicado: (2025)
por: Hyrkas, Jeremy
Publicado: (2025)
Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs
por: Pietroń, Marcin, et al.
Publicado: (2026)
por: Pietroń, Marcin, et al.
Publicado: (2026)
Speaker anonymization using neural audio codec language models
por: Panariello, Michele, et al.
Publicado: (2023)
por: Panariello, Michele, et al.
Publicado: (2023)
FxSearcher: gradient-free text-driven audio transformation
por: Ki, Hojoon, et al.
Publicado: (2025)
por: Ki, Hojoon, et al.
Publicado: (2025)
Regularized autoregressive modeling and its application to audio signal reconstruction
por: Mokrý, Ondřej, et al.
Publicado: (2024)
por: Mokrý, Ondřej, et al.
Publicado: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
por: Tan, Liwen, et al.
Publicado: (2024)
por: Tan, Liwen, et al.
Publicado: (2024)
ManWav: The First Manchu ASR Model
por: Seo, Jean, et al.
Publicado: (2024)
por: Seo, Jean, et al.
Publicado: (2024)
Adapting WavLM for Speech Emotion Recognition
por: Diatlova, Daria, et al.
Publicado: (2024)
por: Diatlova, Daria, et al.
Publicado: (2024)
XWSB: A Blend System Utilizing XLS-R and WavLM with SLS Classifier detection system for SVDD 2024 Challenge
por: Zhang, Qishan, et al.
Publicado: (2024)
por: Zhang, Qishan, et al.
Publicado: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
por: Chi, Tutti, et al.
Publicado: (2025)
por: Chi, Tutti, et al.
Publicado: (2025)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
por: Das, Sneha, et al.
Publicado: (2020)
por: Das, Sneha, et al.
Publicado: (2020)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
por: Takano, Taisei, et al.
Publicado: (2025)
por: Takano, Taisei, et al.
Publicado: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
Toward noise-robust whisper keyword spotting on headphones with in-earcup microphone and curriculum learning
por: Yang, Qiaoyu
Publicado: (2025)
por: Yang, Qiaoyu
Publicado: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
por: Kanamori, Yusuke, et al.
Publicado: (2025)
por: Kanamori, Yusuke, et al.
Publicado: (2025)
ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis
por: Liu, Yunyi, et al.
Publicado: (2024)
por: Liu, Yunyi, et al.
Publicado: (2024)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
por: Riley, Xavier, et al.
Publicado: (2024)
por: Riley, Xavier, et al.
Publicado: (2024)
Exploring trends in audio mixes and masters: Insights from a dataset analysis
por: Mourgela, Angeliki, et al.
Publicado: (2024)
por: Mourgela, Angeliki, et al.
Publicado: (2024)
Ejemplares similares
-
GRAM: Spatial general-purpose audio representation models for real-world applications
por: Yuksel, Goksenin, et al.
Publicado: (2025) -
GRAM: Spatial general-purpose audio representations for real-world environments
por: Yuksel, Goksenin, et al.
Publicado: (2026) -
Leveraging Spatial Cues from Cochlear Implant Microphones to Efficiently Enhance Speech Separation in Real-World Listening Scenes
por: Olalere, Feyisayo, et al.
Publicado: (2025) -
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
por: Ledder, Wessel, et al.
Publicado: (2024) -
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
por: Kuang, Sheng, et al.
Publicado: (2022)