Annealed Multiple Choice Learning: Overcoming limitations of Winner-takes-all with annealing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Perera, David, Letzelter, Victor, Mariotte, Théo, Cortés, Adrien, Chen, Mickael, Essid, Slim, Richard, Gaël |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
par: Perera, David, et autres
Publié: (2024)
par: Perera, David, et autres
Publié: (2024)
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
par: Gagnere, Antonin, et autres
Publié: (2025)
par: Gagnere, Antonin, et autres
Publié: (2025)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
par: Zaiem, Salah, et autres
Publié: (2024)
par: Zaiem, Salah, et autres
Publié: (2024)
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
par: Gagnere, Antonin, et autres
Publié: (2024)
par: Gagnere, Antonin, et autres
Publié: (2024)
SALT: Standardized Audio event Label Taxonomy
par: Stamatiadis, Paraskevas, et autres
Publié: (2024)
par: Stamatiadis, Paraskevas, et autres
Publié: (2024)
Winner-takes-all learners are geometry-aware conditional density estimators
par: Letzelter, Victor, et autres
Publié: (2024)
par: Letzelter, Victor, et autres
Publié: (2024)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
par: Olvera, Michel, et autres
Publié: (2024)
par: Olvera, Michel, et autres
Publié: (2024)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
par: Serre, Thomas, et autres
Publié: (2024)
par: Serre, Thomas, et autres
Publié: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
par: Mariotte, Théo, et autres
Publié: (2024)
par: Mariotte, Théo, et autres
Publié: (2024)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
par: Serre, Thomas, et autres
Publié: (2026)
par: Serre, Thomas, et autres
Publié: (2026)
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
par: Berger, Clémentine, et autres
Publié: (2025)
par: Berger, Clémentine, et autres
Publié: (2025)
Online speaker diarization of meetings guided by speech separation
par: Gruttadauria, Elio, et autres
Publié: (2024)
par: Gruttadauria, Elio, et autres
Publié: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
par: Mariotte, Theo, et autres
Publié: (2024)
par: Mariotte, Theo, et autres
Publié: (2024)
Explainable by-design Audio Segmentation through Non-Negative Matrix Factorization and Probing
par: Lebourdais, Martin, et autres
Publié: (2024)
par: Lebourdais, Martin, et autres
Publié: (2024)
IS${}^3$ : Generic Impulsive--Stationary Sound Separation in Acoustic Scenes using Deep Filtering
par: Berger, Clémentine, et autres
Publié: (2025)
par: Berger, Clémentine, et autres
Publié: (2025)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
par: Baoueb, Teysir, et autres
Publié: (2024)
par: Baoueb, Teysir, et autres
Publié: (2024)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
Point Processes and spatial statistics in time-frequency analysis
par: Pascal, Barbara, et autres
Publié: (2024)
par: Pascal, Barbara, et autres
Publié: (2024)
An Explainable Proxy Model for Multiabel Audio Segmentation
par: Mariotte, Théo, et autres
Publié: (2024)
par: Mariotte, Théo, et autres
Publié: (2024)
Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems
par: Raymondaud, Quentin, et autres
Publié: (2024)
par: Raymondaud, Quentin, et autres
Publié: (2024)
Sparse Autoencoders Make Audio Foundation Models more Explainable
par: Mariotte, Théo, et autres
Publié: (2025)
par: Mariotte, Théo, et autres
Publié: (2025)
VAE-based Phoneme Alignment Using Gradient Annealing and SSL Acoustic Features
par: Koriyama, Tomoki
Publié: (2024)
par: Koriyama, Tomoki
Publié: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
par: Kameoka, Hirokazu, et autres
Publié: (2020)
par: Kameoka, Hirokazu, et autres
Publié: (2020)
Singer Identity Representation Learning using Self-Supervised Techniques
par: Torres, Bernardo, et autres
Publié: (2024)
par: Torres, Bernardo, et autres
Publié: (2024)
Structure-informed Positional Encoding for Music Generation
par: Agarwal, Manvi, et autres
Publié: (2024)
par: Agarwal, Manvi, et autres
Publié: (2024)
Déréverbération non-supervisée de la parole par modèle hybride
par: Bahrman, Louis, et autres
Publié: (2025)
par: Bahrman, Louis, et autres
Publié: (2025)
6KSFx Synth Dataset
par: Garcia, Nelly, et autres
Publié: (2025)
par: Garcia, Nelly, et autres
Publié: (2025)
Research on the Acoustic Emission Source Localization Methodology in Composite Materials based on Artificial Intelligence
par: Won, Jongick, et autres
Publié: (2024)
par: Won, Jongick, et autres
Publié: (2024)
SLAP: Learning Speaker and Health-Related Representations from Natural Language Supervision
par: Ando, Angelika, et autres
Publié: (2025)
par: Ando, Angelika, et autres
Publié: (2025)
Towards Supervised Performance on Speaker Verification with Self-Supervised Learning by Leveraging Large-Scale ASR Models
par: Miara, Victor, et autres
Publié: (2024)
par: Miara, Victor, et autres
Publié: (2024)
Désentrelacement Fréquentiel Doux pour les Codecs Audio Neuronaux
par: Giniès, Benoît, et autres
Publié: (2025)
par: Giniès, Benoît, et autres
Publié: (2025)
Asymmetric and trial-dependent modeling: the contribution of LIA to SdSV Challenge Task 2
par: Bousquet, Pierre-Michel, et autres
Publié: (2024)
par: Bousquet, Pierre-Michel, et autres
Publié: (2024)
Spatial Reverberation and Dereverberation using an Acoustic Multiple-Input Multiple-Output System
par: Morgenstern, Hai, et autres
Publié: (2024)
par: Morgenstern, Hai, et autres
Publié: (2024)
Speech dereverberation constrained on room impulse response characteristics
par: Bahrman, Louis, et autres
Publié: (2024)
par: Bahrman, Louis, et autres
Publié: (2024)
On Speaker Attribution with SURT
par: Raj, Desh, et autres
Publié: (2024)
par: Raj, Desh, et autres
Publié: (2024)
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection
par: Stourbe, Theophile, et autres
Publié: (2024)
par: Stourbe, Theophile, et autres
Publié: (2024)
MSP-Podcast SER Challenge 2024: L'antenne du Ventoux Multimodal Self-Supervised Learning for Speech Emotion Recognition
par: Duret, Jarod, et autres
Publié: (2024)
par: Duret, Jarod, et autres
Publié: (2024)
Multilingual Turn-taking Prediction Using Voice Activity Projection
par: Inoue, Koji, et autres
Publié: (2024)
par: Inoue, Koji, et autres
Publié: (2024)
Visual Cues Support Robust Turn-taking Prediction in Noise
par: Russell, Sam O'Connor, et autres
Publié: (2025)
par: Russell, Sam O'Connor, et autres
Publié: (2025)
Documents similaires
-
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
par: Perera, David, et autres
Publié: (2024) -
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
par: Gagnere, Antonin, et autres
Publié: (2025) -
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
par: Zaiem, Salah, et autres
Publié: (2024) -
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
par: Gagnere, Antonin, et autres
Publié: (2024) -
SALT: Standardized Audio event Label Taxonomy
par: Stamatiadis, Paraskevas, et autres
Publié: (2024)