End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
Fuente:
arXiv
Guardado en:
| Autores principales: | Morrone, Giovanni, Cornell, Samuele, Serafini, Luca, Zovato, Enrico, Brutti, Alessio, Squartini, Stefano |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025)
por: Guo, Zhao, et al.
Publicado: (2025)
Cross-Talk Speech Reduction, by Separation, for Separation
por: Wang, Zhong-Qiu, et al.
Publicado: (2026)
por: Wang, Zhong-Qiu, et al.
Publicado: (2026)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
por: Valente, Martina, et al.
Publicado: (2024)
por: Valente, Martina, et al.
Publicado: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
por: Palzer, David, et al.
Publicado: (2025)
por: Palzer, David, et al.
Publicado: (2025)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
por: Plaquet, Alexis, et al.
Publicado: (2025)
por: Plaquet, Alexis, et al.
Publicado: (2025)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
por: Kang, Wonjune, et al.
Publicado: (2022)
por: Kang, Wonjune, et al.
Publicado: (2022)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)
por: Du, Zongyang, et al.
Publicado: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
por: Yamashita, Natsuo, et al.
Publicado: (2024)
por: Yamashita, Natsuo, et al.
Publicado: (2024)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
por: Landini, Federico, et al.
Publicado: (2023)
por: Landini, Federico, et al.
Publicado: (2023)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
por: Kocour, Martin, et al.
Publicado: (2025)
por: Kocour, Martin, et al.
Publicado: (2025)
MAPSS: Manifold-based Assessment of Perceptual Source Separation
por: Ivry, Amir, et al.
Publicado: (2025)
por: Ivry, Amir, et al.
Publicado: (2025)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
por: Morrone, Giovanni, et al.
Publicado: (2024)
por: Morrone, Giovanni, et al.
Publicado: (2024)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
por: Xu, Anfeng, et al.
Publicado: (2026)
por: Xu, Anfeng, et al.
Publicado: (2026)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
From Modular to End-to-End Speaker Diarization
por: Landini, Federico
Publicado: (2024)
por: Landini, Federico
Publicado: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
por: Zhang, Lin, et al.
Publicado: (2024)
por: Zhang, Lin, et al.
Publicado: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
por: Hirano, Yuta, et al.
Publicado: (2025)
por: Hirano, Yuta, et al.
Publicado: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction
por: Liang, Di, et al.
Publicado: (2024)
por: Liang, Di, et al.
Publicado: (2024)
Spatial-Temporal Activity-Informed Diarization and Separation
por: Hsu, Yicheng, et al.
Publicado: (2024)
por: Hsu, Yicheng, et al.
Publicado: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
por: Singh, Prachi, et al.
Publicado: (2024)
por: Singh, Prachi, et al.
Publicado: (2024)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
por: von Neumann, Thilo, et al.
Publicado: (2023)
por: von Neumann, Thilo, et al.
Publicado: (2023)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
Language Modelling for Speaker Diarization in Telephonic Interviews
por: India, Miquel, et al.
Publicado: (2025)
por: India, Miquel, et al.
Publicado: (2025)
Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
por: Comanducci, Luca, et al.
Publicado: (2024)
por: Comanducci, Luca, et al.
Publicado: (2024)
Recent Trends in Distant Conversational Speech Recognition: A Review of CHiME-7 and 8 DASR Challenges
por: Cornell, Samuele, et al.
Publicado: (2025)
por: Cornell, Samuele, et al.
Publicado: (2025)
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
por: Qi, Tianhua, et al.
Publicado: (2024)
por: Qi, Tianhua, et al.
Publicado: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
por: Li, Jingyi, et al.
Publicado: (2026)
por: Li, Jingyi, et al.
Publicado: (2026)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
por: Yu, Yifeng, et al.
Publicado: (2024)
por: Yu, Yifeng, et al.
Publicado: (2024)
StreamVC: Real-Time Low-Latency Voice Conversion
por: Yang, Yang, et al.
Publicado: (2024)
por: Yang, Yang, et al.
Publicado: (2024)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
por: Munakata, Hokuto, et al.
Publicado: (2024)
por: Munakata, Hokuto, et al.
Publicado: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
Ejemplares similares
-
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025) -
Cross-Talk Speech Reduction, by Separation, for Separation
por: Wang, Zhong-Qiu, et al.
Publicado: (2026) -
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
por: Valente, Martina, et al.
Publicado: (2024) -
End-to-End Diarization utilizing Attractor Deep Clustering
por: Palzer, David, et al.
Publicado: (2025) -
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
por: Plaquet, Alexis, et al.
Publicado: (2025)