Simultaneous or Sequential Training? How Speech Representations Cooperate in a Multi-Task Self-Supervised Learning System
Fuente:
arXiv
Salvato in:
| Autori principali: | Khorrami, Khazar, Blandón, María Andrea Cruz, Virtanen, Tuomas, Räsänen, Okko |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning
di: Xie, Huang, et al.
Pubblicazione: (2024)
di: Xie, Huang, et al.
Pubblicazione: (2024)
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
di: Xie, Huang, et al.
Pubblicazione: (2024)
di: Xie, Huang, et al.
Pubblicazione: (2024)
A model of early word acquisition based on realistic-scale audiovisual naming events
di: Khorrami, Khazar, et al.
Pubblicazione: (2024)
di: Khorrami, Khazar, et al.
Pubblicazione: (2024)
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
Age-Dependent Analysis and Stochastic Generation of Child-Directed Speech
di: Räsänen, Okko, et al.
Pubblicazione: (2024)
di: Räsänen, Okko, et al.
Pubblicazione: (2024)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
di: Neri, Michael, et al.
Pubblicazione: (2025)
di: Neri, Michael, et al.
Pubblicazione: (2025)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
di: Neri, Michael, et al.
Pubblicazione: (2025)
di: Neri, Michael, et al.
Pubblicazione: (2025)
Multi-Utterance Speech Separation and Association Trained on Short Segments
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
di: Dai, Wang, et al.
Pubblicazione: (2024)
di: Dai, Wang, et al.
Pubblicazione: (2024)
Multi-Channel Replay Speech Detection using Acoustic Maps
di: Neri, Michael, et al.
Pubblicazione: (2026)
di: Neri, Michael, et al.
Pubblicazione: (2026)
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2026)
di: Dai, Wang, et al.
Pubblicazione: (2026)
Acoustic Simulation Framework for Multi-channel Replay Speech Detection
di: Neri, Michael, et al.
Pubblicazione: (2025)
di: Neri, Michael, et al.
Pubblicazione: (2025)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2025)
di: Dai, Wang, et al.
Pubblicazione: (2025)
Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
di: Blandón, María Andrea Cruz, et al.
Pubblicazione: (2025)
di: Blandón, María Andrea Cruz, et al.
Pubblicazione: (2025)
Automatic Live Music Song Identification Using Multi-level Deep Sequence Similarity Learning
di: Hakala, Aapo, et al.
Pubblicazione: (2025)
di: Hakala, Aapo, et al.
Pubblicazione: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance
di: Luong, Diep, et al.
Pubblicazione: (2025)
di: Luong, Diep, et al.
Pubblicazione: (2025)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
Computational modeling of early language learning from acoustic speech and audiovisual input without linguistic priors
di: Räsänen, Okko
Pubblicazione: (2026)
di: Räsänen, Okko
Pubblicazione: (2026)
BabySLM: language-acquisition-friendly benchmark of self-supervised spoken language models
di: Lavechin, Marvin, et al.
Pubblicazione: (2023)
di: Lavechin, Marvin, et al.
Pubblicazione: (2023)
Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier
di: Dumpis, Martynas, et al.
Pubblicazione: (2026)
di: Dumpis, Martynas, et al.
Pubblicazione: (2026)
Computer Audition: From Task-Specific Machine Learning to Foundation Models
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2024)
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2024)
Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations
di: Guo, Xin, et al.
Pubblicazione: (2026)
di: Guo, Xin, et al.
Pubblicazione: (2026)
Neural Ambisonics encoding for compact irregular microphone arrays
di: Heikkinen, Mikko, et al.
Pubblicazione: (2024)
di: Heikkinen, Mikko, et al.
Pubblicazione: (2024)
Noise-to-mask Ratio Loss for Deep Neural Network based Audio Watermarking
di: Moritz, Martin, et al.
Pubblicazione: (2024)
di: Moritz, Martin, et al.
Pubblicazione: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Beyond Omnidirectional: Neural Ambisonics Encoding for Arbitrary Microphone Directivity Patterns using Cross-Attention
di: Heikkinen, Mikko, et al.
Pubblicazione: (2026)
di: Heikkinen, Mikko, et al.
Pubblicazione: (2026)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Cyclostationarity Analysis as a Complement to Self-Supervised Representations for Speech Deepfake Detection
di: Hanilçi, Cemal, et al.
Pubblicazione: (2026)
di: Hanilçi, Cemal, et al.
Pubblicazione: (2026)
Exploring Disentangled Neural Speech Codecs from Self-Supervised Representations
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
di: Aihara, Ryo, et al.
Pubblicazione: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
di: Li, Hengyu, et al.
Pubblicazione: (2024)
di: Li, Hengyu, et al.
Pubblicazione: (2024)
Moving Speaker Separation via Parallel Spectral-Spatial Processing
di: Wang, Yuzhu, et al.
Pubblicazione: (2026)
di: Wang, Yuzhu, et al.
Pubblicazione: (2026)
Hybrid Disagreement-Diversity Active Learning for Bioacoustic Sound Event Detection
di: Zhang, Shiqi, et al.
Pubblicazione: (2025)
di: Zhang, Shiqi, et al.
Pubblicazione: (2025)
Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
On the Use of Self-Supervised Representation Learning for Speaker Diarization and Separation
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
MT-SLVR: Multi-Task Self-Supervised Learning for Transformation In(Variant) Representations
di: Heggan, Calum, et al.
Pubblicazione: (2023)
di: Heggan, Calum, et al.
Pubblicazione: (2023)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning
di: Xie, Huang, et al.
Pubblicazione: (2024) -
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
di: Xie, Huang, et al.
Pubblicazione: (2024) -
A model of early word acquisition based on realistic-scale audiovisual naming events
di: Khorrami, Khazar, et al.
Pubblicazione: (2024) -
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021) -
Age-Dependent Analysis and Stochastic Generation of Child-Directed Speech
di: Räsänen, Okko, et al.
Pubblicazione: (2024)