Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pešán, Jan, Kesiraju, Santosh, Burget, Lukáš, Černocký, Jan ''Honza'' |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Automatic Speech Recognition with Decoder-Centric Regularisation in Encoder-Decoder Models
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition
par: Polok, Alexander, et autres
Publié: (2025)
par: Polok, Alexander, et autres
Publié: (2025)
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs
par: Sedláček, Šimon, et autres
Publié: (2025)
par: Sedláček, Šimon, et autres
Publié: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Pretraining End-to-End Keyword Search with Automatically Discovered Acoustic Units
par: Yusuf, Bolaji, et autres
Publié: (2024)
par: Yusuf, Bolaji, et autres
Publié: (2024)
Robustness of Speech Separation Models for Similar-pitch Speakers
par: Lay, Bunlong, et autres
Publié: (2024)
par: Lay, Bunlong, et autres
Publié: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
par: Klement, Dominik, et autres
Publié: (2025)
par: Klement, Dominik, et autres
Publié: (2025)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
par: Kawamura, Masaya, et autres
Publié: (2025)
par: Kawamura, Masaya, et autres
Publié: (2025)
Quartered Chirp Spectral Envelope for Whispered vs Normal Speech Classification
par: Joysingh, S. Johanan, et autres
Publié: (2024)
par: Joysingh, S. Johanan, et autres
Publié: (2024)
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
par: Mohammad, Mir Sayeed, et autres
Publié: (2024)
par: Mohammad, Mir Sayeed, et autres
Publié: (2024)
CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition
par: Ziogas, Ioannis, et autres
Publié: (2024)
par: Ziogas, Ioannis, et autres
Publié: (2024)
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration
par: Serbest, Sanberk, et autres
Publié: (2025)
par: Serbest, Sanberk, et autres
Publié: (2025)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
BUT System for the MLC-SLM Challenge
par: Polok, Alexander, et autres
Publié: (2025)
par: Polok, Alexander, et autres
Publié: (2025)
Speech Watermarking with Discrete Intermediate Representations
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
par: Baoueb, Teysir, et autres
Publié: (2025)
par: Baoueb, Teysir, et autres
Publié: (2025)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
par: Gupta, Kishan, et autres
Publié: (2022)
par: Gupta, Kishan, et autres
Publié: (2022)
SpecDiff-GAN: A Spectrally-Shaped Noise Diffusion GAN for Speech and Music Synthesis
par: Baoueb, Teysir, et autres
Publié: (2024)
par: Baoueb, Teysir, et autres
Publié: (2024)
Lightweight DNN for Full-Band Speech Denoising on Mobile Devices: Exploiting Long and Short Temporal Patterns
par: Drossos, Konstantinos, et autres
Publié: (2025)
par: Drossos, Konstantinos, et autres
Publié: (2025)
State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data
par: Barahona, Sara, et autres
Publié: (2024)
par: Barahona, Sara, et autres
Publié: (2024)
Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
AI-Assisted Music Production: A User Study on Text-to-Music Models
par: Ronchini, Francesca, et autres
Publié: (2025)
par: Ronchini, Francesca, et autres
Publié: (2025)
Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models
par: Baoueb, Teysir, et autres
Publié: (2025)
par: Baoueb, Teysir, et autres
Publié: (2025)
Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration
par: Sun, Esther, et autres
Publié: (2026)
par: Sun, Esther, et autres
Publié: (2026)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Semantic Communications for Speech Recognition
par: Weng, Zhenzi, et autres
Publié: (2021)
par: Weng, Zhenzi, et autres
Publié: (2021)
VoxKnesset: A Large-Scale Longitudinal Hebrew Speech Dataset for Aging Speaker Modeling
par: Marmor, Yanir, et autres
Publié: (2026)
par: Marmor, Yanir, et autres
Publié: (2026)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
Language Bias in Self-Supervised Learning For Automatic Speech Recognition
par: Storey, Edward, et autres
Publié: (2025)
par: Storey, Edward, et autres
Publié: (2025)
Overview of the L3DAS23 Challenge on Audio-Visual Extended Reality
par: Marinoni, Christian, et autres
Publié: (2024)
par: Marinoni, Christian, et autres
Publié: (2024)
Comparison of Tiny Machine Learning Techniques for Embedded Acoustic Emission Analysis
par: Muthumala, Uditha, et autres
Publié: (2024)
par: Muthumala, Uditha, et autres
Publié: (2024)
Is Audio Spoof Detection Robust to Laundering Attacks?
par: Ali, Hashim, et autres
Publié: (2024)
par: Ali, Hashim, et autres
Publié: (2024)
Ultra Low Complexity Deep Learning Based Noise Suppression
par: Shetu, Shrishti Saha, et autres
Publié: (2023)
par: Shetu, Shrishti Saha, et autres
Publié: (2023)
Documents similaires
-
Improving Automatic Speech Recognition with Decoder-Centric Regularisation in Encoder-Decoder Models
par: Polok, Alexander, et autres
Publié: (2024) -
DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition
par: Polok, Alexander, et autres
Publié: (2025) -
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
par: Polok, Alexander, et autres
Publié: (2026) -
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025) -
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)