StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghosh, Suhita, Jouaiti, Melanie, Perschewski, Jan-Ole, Stober, Sebastian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework
di: Zhang, Eric, et al.
Pubblicazione: (2025)
di: Zhang, Eric, et al.
Pubblicazione: (2025)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Data-Efficient ASR Personalization for Non-Normative Speech Using an Uncertainty-Based Phoneme Difficulty Score for Guided Sampling
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
ShrutiSense: Microtonal Modeling and Correction in Indian Classical Music
di: Ghosh, Rajarshi, et al.
Pubblicazione: (2025)
di: Ghosh, Rajarshi, et al.
Pubblicazione: (2025)
Melody-Guided Music Generation
di: Wei, Shaopeng, et al.
Pubblicazione: (2024)
di: Wei, Shaopeng, et al.
Pubblicazione: (2024)
Heart Sound Segmentation Using Deep Learning Techniques
di: Madine, Manas
Pubblicazione: (2024)
di: Madine, Manas
Pubblicazione: (2024)
Are you sure? Analysing Uncertainty Quantification Approaches for Real-world Speech Emotion Recognition
di: Schrüfer, Oliver, et al.
Pubblicazione: (2024)
di: Schrüfer, Oliver, et al.
Pubblicazione: (2024)
Physics-Guided Deepfake Detection for Voice Authentication Systems
di: Mohammadi, Alireza, et al.
Pubblicazione: (2025)
di: Mohammadi, Alireza, et al.
Pubblicazione: (2025)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Audio-Guided Fusion Techniques for Multimodal Emotion Analysis
di: Shi, Pujin, et al.
Pubblicazione: (2024)
di: Shi, Pujin, et al.
Pubblicazione: (2024)
Real-world Music Plagiarism Detection With Music Segment Transcription System
di: Go, Seonghyeon
Pubblicazione: (2025)
di: Go, Seonghyeon
Pubblicazione: (2025)
Spectral Mapping of Singing Voices: U-Net-Assisted Vocal Segmentation
di: Sorrenti, Adam
Pubblicazione: (2024)
di: Sorrenti, Adam
Pubblicazione: (2024)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
Diffusion Timbre Transfer Via Mutual Information Guided Inpainting
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
di: Lee, Ching Ho, et al.
Pubblicazione: (2026)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
Example-Based Framework for Perceptually Guided Audio Texture Generation
di: Kamath, Purnima, et al.
Pubblicazione: (2023)
di: Kamath, Purnima, et al.
Pubblicazione: (2023)
Segment Transformer: AI-Generated Music Detection via Music Structural Analysis
di: Kim, Yumin, et al.
Pubblicazione: (2025)
di: Kim, Yumin, et al.
Pubblicazione: (2025)
Explainable by-design Audio Segmentation through Non-Negative Matrix Factorization and Probing
di: Lebourdais, Martin, et al.
Pubblicazione: (2024)
di: Lebourdais, Martin, et al.
Pubblicazione: (2024)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
MusicFlow: Cascaded Flow Matching for Text Guided Music Generation
di: Prajwal, K R, et al.
Pubblicazione: (2024)
di: Prajwal, K R, et al.
Pubblicazione: (2024)
NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention
di: De Silva, Dashanka, et al.
Pubblicazione: (2024)
di: De Silva, Dashanka, et al.
Pubblicazione: (2024)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
di: Yang, Jianing, et al.
Pubblicazione: (2025)
di: Yang, Jianing, et al.
Pubblicazione: (2025)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification
di: Wu, Bin, et al.
Pubblicazione: (2024)
di: Wu, Bin, et al.
Pubblicazione: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
di: Mujtaba, Dena, et al.
Pubblicazione: (2025)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
di: Jiang, Han, et al.
Pubblicazione: (2024)
di: Jiang, Han, et al.
Pubblicazione: (2024)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
di: Ghosh, Suhita, et al.
Pubblicazione: (2024) -
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
di: Ghosh, Suhita, et al.
Pubblicazione: (2024) -
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024) -
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)