mHuBERT-147: A Compact Multilingual HuBERT Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Boito, Marcely Zanon, Iyer, Vivek, Lagos, Nikolaos, Besacier, Laurent, Calapodescu, Ioan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022)
par: Yoon, Ji Won, et autres
Publié: (2022)
MelHuBERT: A simplified HuBERT on Mel spectrograms
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
par: Komatsu, Ryota, et autres
Publié: (2024)
par: Komatsu, Ryota, et autres
Publié: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
par: Cho, Cheol Jun, et autres
Publié: (2023)
par: Cho, Cheol Jun, et autres
Publié: (2023)
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
par: Chi, Hyung Gun, et autres
Publié: (2025)
par: Chi, Hyung Gun, et autres
Publié: (2025)
Phonetic and Lexical Discovery of a Canine Language using HuBERT
par: Li, Xingyuan, et autres
Publié: (2024)
par: Li, Xingyuan, et autres
Publié: (2024)
VisG AV-HuBERT: Viseme-Guided AV-HuBERT
par: Papadopoulos, Aristeidis, et autres
Publié: (2026)
par: Papadopoulos, Aristeidis, et autres
Publié: (2026)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
par: Lee, Beomseok, et autres
Publié: (2024)
par: Lee, Beomseok, et autres
Publié: (2024)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
par: Wu, Wenxuan, et autres
Publié: (2024)
par: Wu, Wenxuan, et autres
Publié: (2024)
Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0
par: Huo, Robin, et autres
Publié: (2025)
par: Huo, Robin, et autres
Publié: (2025)
RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Speech Foundation Models and Crowdsourcing for Efficient, High-Quality Data Collection
par: Lee, Beomseok, et autres
Publié: (2024)
par: Lee, Beomseok, et autres
Publié: (2024)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
AfriHuBERT: A self-supervised speech representation model for African languages
par: Alabi, Jesujoba O., et autres
Publié: (2024)
par: Alabi, Jesujoba O., et autres
Publié: (2024)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
par: Ahn, Hyebin, et autres
Publié: (2025)
par: Ahn, Hyebin, et autres
Publié: (2025)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings
par: Charlot, Théo, et autres
Publié: (2025)
par: Charlot, Théo, et autres
Publié: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
par: Ma, Duo, et autres
Publié: (2024)
par: Ma, Duo, et autres
Publié: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
par: Shahzad, Sahibzada Adil, et autres
Publié: (2023)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2023)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
par: Ok, Hyunjong, et autres
Publié: (2024)
par: Ok, Hyunjong, et autres
Publié: (2024)
Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Enhancing and Exploring Mild Cognitive Impairment Detection with W2V-BERT-2.0
par: Wang, Yueguan, et autres
Publié: (2025)
par: Wang, Yueguan, et autres
Publié: (2025)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
LeBenchmark 2.0: a Standardized, Replicable and Enhanced Framework for Self-supervised Representations of French Speech
par: Parcollet, Titouan, et autres
Publié: (2023)
par: Parcollet, Titouan, et autres
Publié: (2023)
MMT-BERT: Chord-aware Symbolic Music Generation Based on Multitrack Music Transformer and MusicBERT
par: Zhu, Jinlong, et autres
Publié: (2024)
par: Zhu, Jinlong, et autres
Publié: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
par: Siriwardhana, Shamane, et autres
Publié: (2020)
par: Siriwardhana, Shamane, et autres
Publié: (2020)
Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection
par: Pan, Yilin, et autres
Publié: (2024)
par: Pan, Yilin, et autres
Publié: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
par: Li, Ze, et autres
Publié: (2025)
par: Li, Ze, et autres
Publié: (2025)
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
par: Beyene, Luel Hagos, et autres
Publié: (2025)
par: Beyene, Luel Hagos, et autres
Publié: (2025)
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
par: Denisov, Pavel, et autres
Publié: (2024)
par: Denisov, Pavel, et autres
Publié: (2024)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Vesper: A Compact and Effective Pretrained Model for Speech Emotion Recognition
par: Chen, Weidong, et autres
Publié: (2023)
par: Chen, Weidong, et autres
Publié: (2023)
Compact Speech Translation Models via Discrete Speech Units Pretraining
par: Lam, Tsz Kin, et autres
Publié: (2024)
par: Lam, Tsz Kin, et autres
Publié: (2024)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
par: Huang, Jiawen, et autres
Publié: (2024)
par: Huang, Jiawen, et autres
Publié: (2024)
XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model
par: Casanova, Edresson, et autres
Publié: (2024)
par: Casanova, Edresson, et autres
Publié: (2024)
Documents similaires
-
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022) -
MelHuBERT: A simplified HuBERT on Mel spectrograms
par: Lin, Tzu-Quan, et autres
Publié: (2022) -
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
par: Komatsu, Ryota, et autres
Publié: (2024) -
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
par: Cho, Cheol Jun, et autres
Publié: (2023) -
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
par: Chi, Hyung Gun, et autres
Publié: (2025)