Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Anfeng, Feng, Tiantian, Narayanan, Shrikanth |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Audio-visual child-adult speaker classification in dyadic interactions
par: Xu, Anfeng, et autres
Publié: (2023)
par: Xu, Anfeng, et autres
Publié: (2023)
Developing a Top-tier Framework in Naturalistic Conditions Challenge for Categorized Emotion Prediction: From Speech Foundation Models and Learning Objective to Data Augmentation and Engineering Choices
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Large Language Models based ASR Error Correction for Child Conversations
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
TI-ASU: Toward Robust Automatic Speech Understanding through Text-to-speech Imputation Against Missing Speech Modality
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
On the Role of Spatial Features in Foundation-Model-Based Speaker Diarization
par: Deegen, Marc, et autres
Publié: (2026)
par: Deegen, Marc, et autres
Publié: (2026)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
par: Shi, Zhonghao, et autres
Publié: (2024)
par: Shi, Zhonghao, et autres
Publié: (2024)
Phone Duration Modeling for Speaker Age Estimation in Children
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2021)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
Who Said What WSW 2.0? Enhanced Automated Analysis of Preschool Classroom Speech
par: Sun, Anchen, et autres
Publié: (2025)
par: Sun, Anchen, et autres
Publié: (2025)
Emotion-Aligned Contrastive Learning Between Images and Music
par: Stewart, Shanti, et autres
Publié: (2023)
par: Stewart, Shanti, et autres
Publié: (2023)
Speech Codec Probing from Semantic and Phonetic Perspectives
par: Shi, Xuan, et autres
Publié: (2026)
par: Shi, Xuan, et autres
Publié: (2026)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024)
par: Pálka, Petr, et autres
Publié: (2024)
Trade-offs Between Capacity and Robustness in Neural Audio Codecs for Adversarially Robust Speech Recognition
par: Prescott, Jordan, et autres
Publié: (2026)
par: Prescott, Jordan, et autres
Publié: (2026)
Mamba-based Segmentation Model for Speaker Diarization
par: Plaquet, Alexis, et autres
Publié: (2024)
par: Plaquet, Alexis, et autres
Publié: (2024)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings
par: Kalda, Joonas, et autres
Publié: (2024)
par: Kalda, Joonas, et autres
Publié: (2024)
USED: Universal Speaker Extraction and Diarization
par: Ao, Junyi, et autres
Publié: (2023)
par: Ao, Junyi, et autres
Publié: (2023)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction
par: Lee, Jihwan, et autres
Publié: (2025)
par: Lee, Jihwan, et autres
Publié: (2025)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
On the Use of Self-Supervised Representation Learning for Speaker Diarization and Separation
par: Baroudi, Séverin, et autres
Publié: (2025)
par: Baroudi, Séverin, et autres
Publié: (2025)
Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation
par: Cheng, Ming, et autres
Publié: (2024)
par: Cheng, Ming, et autres
Publié: (2024)
Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
par: Nguyen, Hong, et autres
Publié: (2024)
par: Nguyen, Hong, et autres
Publié: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Leveraging Self-Supervised Learning for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2024)
par: Han, Jiangyu, et autres
Publié: (2024)
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
par: Kim, Miseul, et autres
Publié: (2025)
par: Kim, Miseul, et autres
Publié: (2025)
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Documents similaires
-
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024) -
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
par: Xu, Anfeng, et autres
Publié: (2024) -
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
par: Xu, Anfeng, et autres
Publié: (2026) -
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025) -
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
par: Feng, Tiantian, et autres
Publié: (2024)