A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Jia-Hong, Kim, Seulgi, Liu, Yi Chieh, Shen, Yixian, Zhu, Hongyi, Tiwari, Prayag, Rudinac, Stevan, Kanoulas, Evangelos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
A Novel Evaluation Framework for Image2Text Generation
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
Gradient Weight-normalized Low-rank Projection for Efficient LLM Training
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
TwinShift: Benchmarking Audio Deepfake Detection across Synthesizer and Speaker Shifts
di: Hong, Jiyoung, et al.
Pubblicazione: (2025)
di: Hong, Jiyoung, et al.
Pubblicazione: (2025)
Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
Speaker Anonymisation for Speech-based Suicide Risk Detection
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations
di: Yan, Yuyang, et al.
Pubblicazione: (2026)
di: Yan, Yuyang, et al.
Pubblicazione: (2026)
Assessing the Impact of Speaker Identity in Speech Spoofing Detection
di: Dao, Anh-Tuan, et al.
Pubblicazione: (2026)
di: Dao, Anh-Tuan, et al.
Pubblicazione: (2026)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
di: Lin, Yuke, et al.
Pubblicazione: (2025)
di: Lin, Yuke, et al.
Pubblicazione: (2025)
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control
di: Blatt, Alexander, et al.
Pubblicazione: (2024)
di: Blatt, Alexander, et al.
Pubblicazione: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
di: Sang, Mufan, et al.
Pubblicazione: (2024)
di: Sang, Mufan, et al.
Pubblicazione: (2024)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
di: Kong, Jungil, et al.
Pubblicazione: (2023)
di: Kong, Jungil, et al.
Pubblicazione: (2023)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
Adversarial Reweighting for Speaker Verification Fairness
di: Jin, Minho, et al.
Pubblicazione: (2022)
di: Jin, Minho, et al.
Pubblicazione: (2022)
Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization
di: Chowdhury, MD. Sagor, et al.
Pubblicazione: (2026)
di: Chowdhury, MD. Sagor, et al.
Pubblicazione: (2026)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
Phonetic Richness for Improved Automatic Speaker Verification
di: Klein, Nicholas, et al.
Pubblicazione: (2024)
di: Klein, Nicholas, et al.
Pubblicazione: (2024)
Impact of Speech Mode in Automatic Pathological Speech Detection
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
INSTRUMENTAL: Automatic Synthesizer Parameter Recovery from Audio via Evolutionary Optimization
di: Bogdan, Philipp
Pubblicazione: (2026)
di: Bogdan, Philipp
Pubblicazione: (2026)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Investigation of Speaker Representation for Target-Speaker Speech Processing
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
Koopman Regularized Deep Speech Disentanglement for Speaker Verification
di: Chazaridis, Nikos, et al.
Pubblicazione: (2026)
di: Chazaridis, Nikos, et al.
Pubblicazione: (2026)
Robust AI-Synthesized Speech Detection Using Feature Decomposition Learning and Synthesizer Feature Augmentation
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024) -
A Novel Evaluation Framework for Image2Text Generation
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024) -
Gradient Weight-normalized Low-rank Projection for Efficient LLM Training
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024) -
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024) -
TwinShift: Benchmarking Audio Deepfake Detection across Synthesizer and Speaker Shifts
di: Hong, Jiyoung, et al.
Pubblicazione: (2025)