Can Masked Autoencoders Also Listen to Birds?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rauch, Lukas, Heinrich, René, Moummad, Ilyass, Joly, Alexis, Sick, Bernhard, Scholz, Christoph |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised Learning for Few-Shot Bird Sound Classification
par: Moummad, Ilyass, et autres
Publié: (2023)
par: Moummad, Ilyass, et autres
Publié: (2023)
Regularized Contrastive Pre-training for Few-shot Bioacoustic Sound Detection
par: Moummad, Ilyass, et autres
Publié: (2023)
par: Moummad, Ilyass, et autres
Publié: (2023)
Acoustic identification of individual animals with hierarchical contrastive learning
par: Nolasco, Ines, et autres
Publié: (2024)
par: Nolasco, Ines, et autres
Publié: (2024)
Domain-Invariant Representation Learning of Bird Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)
par: Moummad, Ilyass, et autres
Publié: (2024)
Mixture of Mixups for Multi-label Classification of Rare Anuran Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)
par: Moummad, Ilyass, et autres
Publié: (2024)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
par: Rauch, Lukas, et autres
Publié: (2024)
par: Rauch, Lukas, et autres
Publié: (2024)
Towards Deep Active Learning in Avian Bioacoustics
par: Rauch, Lukas, et autres
Publié: (2024)
par: Rauch, Lukas, et autres
Publié: (2024)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
par: Rauch, Lukas, et autres
Publié: (2025)
par: Rauch, Lukas, et autres
Publié: (2025)
wav2pos: Sound Source Localization using Masked Autoencoders
par: Berg, Axel, et autres
Publié: (2024)
par: Berg, Axel, et autres
Publié: (2024)
Exploring Meta Information for Audio-based Zero-shot Bird Classification
par: Gebhard, Alexander, et autres
Publié: (2023)
par: Gebhard, Alexander, et autres
Publié: (2023)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation
par: Kienegger, Jakob, et autres
Publié: (2024)
par: Kienegger, Jakob, et autres
Publié: (2024)
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Motif Mining and Unsupervised Representation Learning for BirdCLEF 2022
par: Miyaguchi, Anthony, et autres
Publié: (2022)
par: Miyaguchi, Anthony, et autres
Publié: (2022)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
par: Bralios, Dimitrios, et autres
Publié: (2025)
par: Bralios, Dimitrios, et autres
Publié: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022)
par: Melechovsky, Jan, et autres
Publié: (2022)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
par: Pasini, Marco, et autres
Publié: (2024)
par: Pasini, Marco, et autres
Publié: (2024)
A Data-Centric Framework for Machine Listening Projects: Addressing Large-Scale Data Acquisition and Labeling through Active Learning
par: Naranjo-Alcazar, Javier, et autres
Publié: (2024)
par: Naranjo-Alcazar, Javier, et autres
Publié: (2024)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
On the calibration of powerset speaker diarization models
par: Plaquet, Alexis, et autres
Publié: (2024)
par: Plaquet, Alexis, et autres
Publié: (2024)
LMD: A Learnable Mask Network to Detect Adversarial Examples for Speaker Verification
par: Chen, Xing, et autres
Publié: (2022)
par: Chen, Xing, et autres
Publié: (2022)
DEMONet: Underwater Acoustic Target Recognition based on Multi-Expert Network and Cross-Temporal Variational Autoencoder
par: Xie, Yuan, et autres
Publié: (2024)
par: Xie, Yuan, et autres
Publié: (2024)
A Convolutional Framework for Mapping Imagined Auditory MEG into Listened Brain Responses
par: Maghsoudi, Maryam, et autres
Publié: (2025)
par: Maghsoudi, Maryam, et autres
Publié: (2025)
Can Emotion Fool Anti-spoofing?
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on Pop and Classical Music
par: Yao, Mingyang, et autres
Publié: (2025)
par: Yao, Mingyang, et autres
Publié: (2025)
Pruning-aware Loss Functions for STOI-Optimized Pruned Recurrent Autoencoders for the Compression of the Stimulation Patterns of Cochlear Implants at Zero Delay
par: Hinrichs, Reemt, et autres
Publié: (2025)
par: Hinrichs, Reemt, et autres
Publié: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks
par: Miccini, Riccardo, et autres
Publié: (2026)
par: Miccini, Riccardo, et autres
Publié: (2026)
Boosting keyword spotting through on-device learnable user speech characteristics
par: Cioflan, Cristian, et autres
Publié: (2024)
par: Cioflan, Cristian, et autres
Publié: (2024)
Disentangling Dual-Encoder Masked Autoencoder for Respiratory Sound Classification
par: Wei, Peidong, et autres
Publié: (2025)
par: Wei, Peidong, et autres
Publié: (2025)
Foundation Models for Bioacoustics -- a Comparative Review
par: Schwinger, Raphael, et autres
Publié: (2025)
par: Schwinger, Raphael, et autres
Publié: (2025)
Quantifying the Corpus Bias Problem in Automatic Music Transcription Systems
par: Marták, Lukáš Samuel, et autres
Publié: (2024)
par: Marták, Lukáš Samuel, et autres
Publié: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing
par: Fu, Yonggan, et autres
Publié: (2022)
par: Fu, Yonggan, et autres
Publié: (2022)
On-Device Domain Learning for Keyword Spotting on Low-Power Extreme Edge Embedded Systems
par: Cioflan, Cristian, et autres
Publié: (2024)
par: Cioflan, Cristian, et autres
Publié: (2024)
Thinking While Listening: Simple Test Time Scaling For Audio Classification
par: Verma, Prateek, et autres
Publié: (2025)
par: Verma, Prateek, et autres
Publié: (2025)
Source Separation of Multi-source Raw Music using a Residual Quantized Variational Autoencoder
par: Berti, Leonardo
Publié: (2024)
par: Berti, Leonardo
Publié: (2024)
Scaling Speech Tokenizers with Diffusion Autoencoders
par: Wang, Yuancheng, et autres
Publié: (2026)
par: Wang, Yuancheng, et autres
Publié: (2026)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
par: Wang, Yuancheng, et autres
Publié: (2024)
par: Wang, Yuancheng, et autres
Publié: (2024)
Listen, Think, and Understand
par: Gong, Yuan, et autres
Publié: (2023)
par: Gong, Yuan, et autres
Publié: (2023)
Documents similaires
-
Self-Supervised Learning for Few-Shot Bird Sound Classification
par: Moummad, Ilyass, et autres
Publié: (2023) -
Regularized Contrastive Pre-training for Few-shot Bioacoustic Sound Detection
par: Moummad, Ilyass, et autres
Publié: (2023) -
Acoustic identification of individual animals with hierarchical contrastive learning
par: Nolasco, Ines, et autres
Publié: (2024) -
Domain-Invariant Representation Learning of Bird Sounds
par: Moummad, Ilyass, et autres
Publié: (2024) -
Mixture of Mixups for Multi-label Classification of Rare Anuran Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)