LLM-based speaker diarization correction: A generalizable approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Efstathiadis, Georgios, Yadav, Vijay, Abbas, Anzar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An approach to optimize inference of the DIART speaker diarization pipeline
par: Aperdannier, Roman, et autres
Publié: (2024)
par: Aperdannier, Roman, et autres
Publié: (2024)
Geodesic interpolation of frame-wise speaker embeddings for the diarization of meeting scenarios
par: Cord-Landwehr, Tobias, et autres
Publié: (2024)
par: Cord-Landwehr, Tobias, et autres
Publié: (2024)
On the calibration of powerset speaker diarization models
par: Plaquet, Alexis, et autres
Publié: (2024)
par: Plaquet, Alexis, et autres
Publié: (2024)
Spatio-spectral diarization of meetings by combining TDOA-based segmentation and speaker embedding-based clustering
par: Cord-Landwehr, Tobias, et autres
Publié: (2025)
par: Cord-Landwehr, Tobias, et autres
Publié: (2025)
SCDiar: a streaming diarization system based on speaker change detection and speech recognition
par: Zheng, Naijun, et autres
Publié: (2025)
par: Zheng, Naijun, et autres
Publié: (2025)
EEND-M2F: Masked-attention mask transformers for speaker diarization
par: Härkönen, Marc, et autres
Publié: (2024)
par: Härkönen, Marc, et autres
Publié: (2024)
Online speaker diarization of meetings guided by speech separation
par: Gruttadauria, Elio, et autres
Publié: (2024)
par: Gruttadauria, Elio, et autres
Publié: (2024)
A Benchmark for Multi-speaker Anonymization
par: Miao, Xiaoxiao, et autres
Publié: (2024)
par: Miao, Xiaoxiao, et autres
Publié: (2024)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
Target speaker anonymization in multi-speaker recordings
par: Tomashenko, Natalia, et autres
Publié: (2025)
par: Tomashenko, Natalia, et autres
Publié: (2025)
1000 African Voices: Advancing inclusive multi-speaker multi-accent speech synthesis
par: Ogun, Sewade, et autres
Publié: (2024)
par: Ogun, Sewade, et autres
Publié: (2024)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
par: Wang, Xiaopeng, et autres
Publié: (2024)
par: Wang, Xiaopeng, et autres
Publié: (2024)
Analyzing the relationships between pretraining language, phonetic, tonal, and speaker information in self-supervised speech models
par: Gubian, Michele, et autres
Publié: (2025)
par: Gubian, Michele, et autres
Publié: (2025)
You don't understand me!: Comparing ASR results for L1 and L2 speakers of Swedish
par: Cumbal, Ronald, et autres
Publié: (2024)
par: Cumbal, Ronald, et autres
Publié: (2024)
RAG-Boost: Retrieval-Augmented Generation Enhanced LLM-based Speech Recognition
par: Wang, Pengcheng, et autres
Publié: (2025)
par: Wang, Pengcheng, et autres
Publié: (2025)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
Loose coupling of spectral and spatial models for multi-channel diarization and enhancement of meetings in dynamic environments
par: Meise, Adrian, et autres
Publié: (2026)
par: Meise, Adrian, et autres
Publié: (2026)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
par: San, Nay, et autres
Publié: (2024)
par: San, Nay, et autres
Publié: (2024)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
par: Sharif, Muhammad, et autres
Publié: (2024)
par: Sharif, Muhammad, et autres
Publié: (2024)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
par: Damianos, Dimitrios, et autres
Publié: (2025)
par: Damianos, Dimitrios, et autres
Publié: (2025)
MedVoiceBias: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
par: Dong, Lukuang, et autres
Publié: (2026)
par: Dong, Lukuang, et autres
Publié: (2026)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
par: Zhou, Fangru, et autres
Publié: (2025)
par: Zhou, Fangru, et autres
Publié: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction
par: Fang, Yangui, et autres
Publié: (2025)
par: Fang, Yangui, et autres
Publié: (2025)
Triple X: A LLM-Based Multilingual Speech Recognition System for the INTERSPEECH2025 MLC-SLM Challenge
par: Gao, Miaomiao, et autres
Publié: (2025)
par: Gao, Miaomiao, et autres
Publié: (2025)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
par: Fujita, Yusuke, et autres
Publié: (2025)
par: Fujita, Yusuke, et autres
Publié: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue
par: Wu, Junkai, et autres
Publié: (2024)
par: Wu, Junkai, et autres
Publié: (2024)
SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors
par: Yegorova, Yekaterina, et autres
Publié: (2026)
par: Yegorova, Yekaterina, et autres
Publié: (2026)
Understanding Zero-shot Rare Word Recognition Improvements Through LLM Integration
par: Wang, Haoxuan
Publié: (2025)
par: Wang, Haoxuan
Publié: (2025)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
JPPO: Joint Power and Prompt Optimization for Accelerated Large Language Model Services
par: You, Feiran, et autres
Publié: (2024)
par: You, Feiran, et autres
Publié: (2024)
The Greek podcast corpus: Competitive speech models for low-resourced languages with weakly supervised data
par: Paraskevopoulos, Georgios, et autres
Publié: (2024)
par: Paraskevopoulos, Georgios, et autres
Publié: (2024)
VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
par: Damianos, Dimitrios, et autres
Publié: (2025)
par: Damianos, Dimitrios, et autres
Publié: (2025)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
par: Ma, Yingyi, et autres
Publié: (2024)
par: Ma, Yingyi, et autres
Publié: (2024)
Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems
par: Allbert, Rumi, et autres
Publié: (2025)
par: Allbert, Rumi, et autres
Publié: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Documents similaires
-
An approach to optimize inference of the DIART speaker diarization pipeline
par: Aperdannier, Roman, et autres
Publié: (2024) -
Geodesic interpolation of frame-wise speaker embeddings for the diarization of meeting scenarios
par: Cord-Landwehr, Tobias, et autres
Publié: (2024) -
On the calibration of powerset speaker diarization models
par: Plaquet, Alexis, et autres
Publié: (2024) -
Spatio-spectral diarization of meetings by combining TDOA-based segmentation and speaker embedding-based clustering
par: Cord-Landwehr, Tobias, et autres
Publié: (2025) -
SCDiar: a streaming diarization system based on speaker change detection and speech recognition
par: Zheng, Naijun, et autres
Publié: (2025)