Enregistré dans:
| Auteurs principaux: | Yuksel, Goksenin, van Gerven, Marcel, van der Heijden, Kiki |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.03307 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GRAM: Spatial general-purpose audio representation models for real-world applications
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
Leveraging Spatial Cues from Cochlear Implant Microphones to Efficiently Enhance Speech Separation in Real-World Listening Scenes
par: Olalere, Feyisayo, et autres
Publié: (2025)
par: Olalere, Feyisayo, et autres
Publié: (2025)
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
par: Ledder, Wessel, et autres
Publié: (2024)
par: Ledder, Wessel, et autres
Publié: (2024)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
par: Kuang, Sheng, et autres
Publié: (2022)
par: Kuang, Sheng, et autres
Publié: (2022)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Speech Separation for Hearing-Impaired Children in the Classroom
par: Olalere, Feyisayo, et autres
Publié: (2025)
par: Olalere, Feyisayo, et autres
Publié: (2025)
Enabling automatic transcription of child-centered audio recordings from real-world environments
par: Kocharov, Daniil, et autres
Publié: (2025)
par: Kocharov, Daniil, et autres
Publié: (2025)
IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments
par: Padhya, Dinanath, et autres
Publié: (2026)
par: Padhya, Dinanath, et autres
Publié: (2026)
Emoanti: audio anti-deepfake with refined emotion-guided representations
par: Li, Xiaokang, et autres
Publié: (2025)
par: Li, Xiaokang, et autres
Publié: (2025)
Efficient learning-based sound propagation for virtual and real-world audio processing applications
par: Ratnarajah, Anton Jeran
Publié: (2024)
par: Ratnarajah, Anton Jeran
Publié: (2024)
Scaling up masked audio encoder learning for general audio classification
par: Dinkel, Heinrich, et autres
Publié: (2024)
par: Dinkel, Heinrich, et autres
Publié: (2024)
Spatial-CLAP: Learning Spatially-Aware audio--text Embeddings for Multi-Source Conditions
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
Decodable but not structured: linear probing enables Underwater Acoustic Target Recognition with pretrained audio embeddings
par: Hummel, Hilde I., et autres
Publié: (2026)
par: Hummel, Hilde I., et autres
Publié: (2026)
Multi-layer attentive probing improves transfer of audio representations for bioacoustics
par: Miron, Marius, et autres
Publié: (2026)
par: Miron, Marius, et autres
Publié: (2026)
Transformation of audio embeddings into interpretable, concept-based representations
par: Zhang, Alice, et autres
Publié: (2025)
par: Zhang, Alice, et autres
Publié: (2025)
AxLSTMs: learning self-supervised audio representations with xLSTMs
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Visual-based spatial audio generation system for multi-speaker environments
par: Liu, Xiaojing, et autres
Publié: (2025)
par: Liu, Xiaojing, et autres
Publié: (2025)
Investigating self-supervised representations for audio-visual deepfake detection
par: Boldisor, Dragos-Alexandru, et autres
Publié: (2025)
par: Boldisor, Dragos-Alexandru, et autres
Publié: (2025)
Keep what you need : extracting efficient subnetworks from large audio representation models
par: Genova, David, et autres
Publié: (2025)
par: Genova, David, et autres
Publié: (2025)
Late fusion ensembles for speech recognition on diverse input audio representations
par: Jezidžić, Marin, et autres
Publié: (2024)
par: Jezidžić, Marin, et autres
Publié: (2024)
Towards generalizing deep-audio fake detection networks
par: Gasenzer, Konstantin, et autres
Publié: (2023)
par: Gasenzer, Konstantin, et autres
Publié: (2023)
SS-DPPN: A self-supervised dual-path foundation model for the generalizable cardiac audio representation
par: Muna, Ummy Maria, et autres
Publié: (2025)
par: Muna, Ummy Maria, et autres
Publié: (2025)
EnCodecMAE: Leveraging neural codecs for universal audio representation learning
par: Pepino, Leonardo, et autres
Publié: (2023)
par: Pepino, Leonardo, et autres
Publié: (2023)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
par: Yadav, Sarthak, et autres
Publié: (2025)
par: Yadav, Sarthak, et autres
Publié: (2025)
Better audio representations are more brain-like: linking model-brain alignment with performance in downstream auditory tasks
par: Pepino, Leonardo, et autres
Publié: (2025)
par: Pepino, Leonardo, et autres
Publié: (2025)
Exploring bat song syllable representations in self-supervised audio encoders
par: Kloots, Marianne de Heer, et autres
Publié: (2024)
par: Kloots, Marianne de Heer, et autres
Publié: (2024)
Making deep neural networks work for medical audio: representation, compression and domain adaptation
par: Onu, Charles C
Publié: (2025)
par: Onu, Charles C
Publié: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
par: Yadav, Sarthak, et autres
Publié: (2025)
par: Yadav, Sarthak, et autres
Publié: (2025)
ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks
par: Jing, Xin, et autres
Publié: (2024)
par: Jing, Xin, et autres
Publié: (2024)
Sonalyzer-Moz: A Framework for Analyzing the Structure of Mozart's Sonata Form
par: Zhao, Jing, et autres
Publié: (2026)
par: Zhao, Jing, et autres
Publié: (2026)
Bird detection in audio: a survey and a challenge
par: Stowell, Dan, et autres
Publié: (2016)
par: Stowell, Dan, et autres
Publié: (2016)
Stage-adaptive audio diffusion modeling
par: Zhang, Xuanhao, et autres
Publié: (2026)
par: Zhang, Xuanhao, et autres
Publié: (2026)
TQCodec: Towards neural audio codec for high-fidelity music streaming
par: He, Lixing, et autres
Publié: (2026)
par: He, Lixing, et autres
Publié: (2026)
Towards audio language modeling -- an overview
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
On Correlating Factors for Domain Adaptation Performance
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
Interpretability Analysis of Domain Adapted Dense Retrievers
par: Yuksel, Goksenin, et autres
Publié: (2025)
par: Yuksel, Goksenin, et autres
Publié: (2025)
Training chord recognition models on artificially generated audio
par: Majchrzak, Martyna, et autres
Publié: (2025)
par: Majchrzak, Martyna, et autres
Publié: (2025)
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024)
par: Marek, Bartłomiej, et autres
Publié: (2024)
Documents similaires
-
GRAM: Spatial general-purpose audio representation models for real-world applications
par: Yuksel, Goksenin, et autres
Publié: (2025) -
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
par: Yuksel, Goksenin, et autres
Publié: (2025) -
Leveraging Spatial Cues from Cochlear Implant Microphones to Efficiently Enhance Speech Separation in Real-World Listening Scenes
par: Olalere, Feyisayo, et autres
Publié: (2025) -
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
par: Ledder, Wessel, et autres
Publié: (2024) -
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
par: Kuang, Sheng, et autres
Publié: (2022)