USM-SCD: Multilingual Speaker Change Detection Based on Large Pretrained Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Guanlong, Wang, Yongqiang, Pelecanos, Jason, Zhang, Yu, Liao, Hank, Huang, Yiling, Lu, Han, Wang, Quan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
por: Wang, Quan, et al.
Publicado: (2024)
por: Wang, Quan, et al.
Publicado: (2024)
Highly Efficient Real-Time Streaming and Fully On-Device Speaker Diarization with Multi-Stage Clustering
por: Wang, Quan, et al.
Publicado: (2022)
por: Wang, Quan, et al.
Publicado: (2022)
USM RNN-T model weights binarization
por: Rybakov, Oleg, et al.
Publicado: (2024)
por: Rybakov, Oleg, et al.
Publicado: (2024)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
por: Ding, Shaojin, et al.
Publicado: (2023)
por: Ding, Shaojin, et al.
Publicado: (2023)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
SCDNet: Self-supervised Learning Feature-based Speaker Change Detection
por: Li, Yue, et al.
Publicado: (2024)
por: Li, Yue, et al.
Publicado: (2024)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
por: Zhang, Li, et al.
Publicado: (2024)
por: Zhang, Li, et al.
Publicado: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
por: Wang, Weiqing, et al.
Publicado: (2024)
por: Wang, Weiqing, et al.
Publicado: (2024)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
Prototype and Instance Contrastive Learning for Unsupervised Domain Adaptation in Speaker Verification
por: Huang, Wen, et al.
Publicado: (2024)
por: Huang, Wen, et al.
Publicado: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
por: Wang, Weiqing, et al.
Publicado: (2025)
por: Wang, Weiqing, et al.
Publicado: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
por: Medennikov, Ivan, et al.
Publicado: (2025)
por: Medennikov, Ivan, et al.
Publicado: (2025)
Utilizing Speaker Profiles for Impersonation Audio Detection
por: Gu, Hao, et al.
Publicado: (2024)
por: Gu, Hao, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
por: Quan, Changsheng, et al.
Publicado: (2024)
por: Quan, Changsheng, et al.
Publicado: (2024)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
por: Hu, Shujie, et al.
Publicado: (2024)
por: Hu, Shujie, et al.
Publicado: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet
por: Gao, Wenmiao, et al.
Publicado: (2025)
por: Gao, Wenmiao, et al.
Publicado: (2025)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
por: You, Zhenghai, et al.
Publicado: (2025)
por: You, Zhenghai, et al.
Publicado: (2025)
Can Audio Large Language Models Verify Speaker Identity?
por: Ren, Yiming, et al.
Publicado: (2025)
por: Ren, Yiming, et al.
Publicado: (2025)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
por: Clarke, Jason, et al.
Publicado: (2025)
por: Clarke, Jason, et al.
Publicado: (2025)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
por: Wang, Dongmei, et al.
Publicado: (2023)
por: Wang, Dongmei, et al.
Publicado: (2023)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Speaker Contrastive Learning for Source Speaker Tracing
por: Wang, Qing, et al.
Publicado: (2024)
por: Wang, Qing, et al.
Publicado: (2024)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
oboVox Far Field Speaker Recognition: A Novel Data Augmentation Approach with Pretrained Models
por: Dip, Muhammad Sudipto Siam, et al.
Publicado: (2024)
por: Dip, Muhammad Sudipto Siam, et al.
Publicado: (2024)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
por: HU, Shujie, et al.
Publicado: (2025)
por: HU, Shujie, et al.
Publicado: (2025)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
por: Farhadipour, Aref, et al.
Publicado: (2026)
por: Farhadipour, Aref, et al.
Publicado: (2026)
NeuralMultiling: A Novel Neural Architecture Search for Smartphone based Multilingual Speaker Verification
por: PN, Aravinda Reddy, et al.
Publicado: (2024)
por: PN, Aravinda Reddy, et al.
Publicado: (2024)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
por: Zeng, Bang, et al.
Publicado: (2025)
por: Zeng, Bang, et al.
Publicado: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
Probing the Feasibility of Multilingual Speaker Anonymization
por: Meyer, Sarina, et al.
Publicado: (2024)
por: Meyer, Sarina, et al.
Publicado: (2024)
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
por: Zhang, Zhe, et al.
Publicado: (2025)
por: Zhang, Zhe, et al.
Publicado: (2025)
The Reasonable Effectiveness of Speaker Embeddings for Violence Detection
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
Ejemplares similares
-
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
por: Wang, Quan, et al.
Publicado: (2024) -
Highly Efficient Real-Time Streaming and Fully On-Device Speaker Diarization with Multi-Stage Clustering
por: Wang, Quan, et al.
Publicado: (2022) -
USM RNN-T model weights binarization
por: Rybakov, Oleg, et al.
Publicado: (2024) -
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
por: Ding, Shaojin, et al.
Publicado: (2023) -
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
por: Horiguchi, Shota, et al.
Publicado: (2025)