Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Quelennec, Aurian, Chouteau, Pierre, Peeters, Geoffroy, Essid, Slim |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025)
por: Quelennec, Aurian, et al.
Publicado: (2025)
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
TinyMU: A Compact Audio-Language Model for Music Understanding
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
por: Gagnere, Antonin, et al.
Publicado: (2025)
por: Gagnere, Antonin, et al.
Publicado: (2025)
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
por: Gagnere, Antonin, et al.
Publicado: (2024)
por: Gagnere, Antonin, et al.
Publicado: (2024)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
por: Riou, Alain, et al.
Publicado: (2024)
por: Riou, Alain, et al.
Publicado: (2024)
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
por: Berger, Clémentine, et al.
Publicado: (2025)
por: Berger, Clémentine, et al.
Publicado: (2025)
Translation-Equivariant Self-Supervised Learning for Pitch Estimation with Optimal Transport
por: Torres, Bernardo, et al.
Publicado: (2025)
por: Torres, Bernardo, et al.
Publicado: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
por: Olvera, Michel, et al.
Publicado: (2024)
por: Olvera, Michel, et al.
Publicado: (2024)
AudioMosaic: Contrastive Masked Audio Representation Learning
por: Huang, Hanxun, et al.
Publicado: (2026)
por: Huang, Hanxun, et al.
Publicado: (2026)
Universal Sound Separation with Self-Supervised Audio Masked Autoencoder
por: Zhao, Junqi, et al.
Publicado: (2024)
por: Zhao, Junqi, et al.
Publicado: (2024)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification
por: Makineni, Aditya, et al.
Publicado: (2025)
por: Makineni, Aditya, et al.
Publicado: (2025)
IS${}^3$ : Generic Impulsive--Stationary Sound Separation in Acoustic Scenes using Deep Filtering
por: Berger, Clémentine, et al.
Publicado: (2025)
por: Berger, Clémentine, et al.
Publicado: (2025)
S-PRESSO: Ultra Low Bitrate Sound Effect Compression With Diffusion Autoencoders And Offline Quantization
por: Lahrichi, Zineb, et al.
Publicado: (2026)
por: Lahrichi, Zineb, et al.
Publicado: (2026)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures
por: Riou, Alain, et al.
Publicado: (2024)
por: Riou, Alain, et al.
Publicado: (2024)
Deepfake Audio Detection Using Self-supervised Fusion Representations
por: Zaman, Khalid, et al.
Publicado: (2026)
por: Zaman, Khalid, et al.
Publicado: (2026)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
SALT: Standardized Audio event Label Taxonomy
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
por: Zaiem, Salah, et al.
Publicado: (2024)
por: Zaiem, Salah, et al.
Publicado: (2024)
Twenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges
por: Peeters, Geoffroy, et al.
Publicado: (2025)
por: Peeters, Geoffroy, et al.
Publicado: (2025)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
por: Chen, Yen-Shan, et al.
Publicado: (2026)
por: Chen, Yen-Shan, et al.
Publicado: (2026)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
por: Zaiem, Salah, et al.
Publicado: (2023)
por: Zaiem, Salah, et al.
Publicado: (2023)
GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking
por: Wang, Yunqiang, et al.
Publicado: (2026)
por: Wang, Yunqiang, et al.
Publicado: (2026)
Myna: Masking-Based Contrastive Learning of Musical Representations
por: Yonay, Ori, et al.
Publicado: (2025)
por: Yonay, Ori, et al.
Publicado: (2025)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026)
por: Zeng, Donghuo, et al.
Publicado: (2026)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
EDMFormer: Genre-Specific Self-Supervised Learning for Music Structure Segmentation
por: Sajeer, Sahal, et al.
Publicado: (2026)
por: Sajeer, Sahal, et al.
Publicado: (2026)
Structured-Noise Masked Modeling for Video, Audio and Beyond
por: Bhowmik, Aritra, et al.
Publicado: (2025)
por: Bhowmik, Aritra, et al.
Publicado: (2025)
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
por: Riou, Alain, et al.
Publicado: (2025)
por: Riou, Alain, et al.
Publicado: (2025)
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
por: Wang, Yang, et al.
Publicado: (2023)
por: Wang, Yang, et al.
Publicado: (2023)
Domain-Agnostic Causal-Aware Audio Transformer for Infant Cry Classification
por: Owino, Geofrey, et al.
Publicado: (2025)
por: Owino, Geofrey, et al.
Publicado: (2025)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
por: Ioannides, Georgios, et al.
Publicado: (2026)
por: Ioannides, Georgios, et al.
Publicado: (2026)
Self Voice Conversion as an Attack against Neural Audio Watermarking
por: Özer, Yigitcan, et al.
Publicado: (2026)
por: Özer, Yigitcan, et al.
Publicado: (2026)
Latent Acoustic Mapping for Direction of Arrival Estimation: A Self-Supervised Approach
por: Roman, Adrian S., et al.
Publicado: (2025)
por: Roman, Adrian S., et al.
Publicado: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
por: Novack, Zachary, et al.
Publicado: (2026)
por: Novack, Zachary, et al.
Publicado: (2026)
Ejemplares similares
-
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025) -
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026) -
TinyMU: A Compact Audio-Language Model for Music Understanding
por: Li, Xiquan, et al.
Publicado: (2026) -
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
por: Gagnere, Antonin, et al.
Publicado: (2025) -
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
por: Gagnere, Antonin, et al.
Publicado: (2024)