Enregistré dans:
| Auteurs principaux: | Rutowski, Tomasz, Harati, Amir, Lu, Yang, Shriberg, Elizabeth |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.00608 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech-Based Depression Prediction Using Encoder-Weight-Only Transfer Learning and a Large Corpus
par: Harati, Amir, et autres
Publié: (2024)
par: Harati, Amir, et autres
Publié: (2024)
Robust Speech and Natural Language Processing Models for Depression Screening
par: Lu, Y., et autres
Publié: (2024)
par: Lu, Y., et autres
Publié: (2024)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
par: Rutowski, Tomek, et autres
Publié: (2024)
par: Rutowski, Tomek, et autres
Publié: (2024)
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
par: Wang, Kyra, et autres
Publié: (2024)
par: Wang, Kyra, et autres
Publié: (2024)
Investigation of Speaker Representation for Target-Speaker Speech Processing
par: Ashihara, Takanori, et autres
Publié: (2024)
par: Ashihara, Takanori, et autres
Publié: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Interpreting Speaker Characteristics in the Dimensions of Self-Supervised Speech Features
par: van Rensburg, Kyle Janse, et autres
Publié: (2026)
par: van Rensburg, Kyle Janse, et autres
Publié: (2026)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
Depression and Anxiety Prediction Using Deep Language Models and Transfer Learning
par: Rutowski, Tomasz, et autres
Publié: (2024)
par: Rutowski, Tomasz, et autres
Publié: (2024)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
par: Kong, Jungil, et autres
Publié: (2023)
par: Kong, Jungil, et autres
Publié: (2023)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue
par: Wu, Junkai, et autres
Publié: (2024)
par: Wu, Junkai, et autres
Publié: (2024)
Speaker-Aware Simulation Improves Conversational Speech Recognition
par: Gedeon, Máté, et autres
Publié: (2026)
par: Gedeon, Máté, et autres
Publié: (2026)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
par: Lin, Yi-Cheng, et autres
Publié: (2024)
par: Lin, Yi-Cheng, et autres
Publié: (2024)
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
par: Huo, Mingyue, et autres
Publié: (2026)
par: Huo, Mingyue, et autres
Publié: (2026)
Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2024)
par: Tomashenko, Natalia, et autres
Publié: (2024)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
par: Weise, Tobias, et autres
Publié: (2024)
par: Weise, Tobias, et autres
Publié: (2024)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
par: Farhadipour, Aref, et autres
Publié: (2023)
par: Farhadipour, Aref, et autres
Publié: (2023)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
SpeechTaxi: On Multilingual Semantic Speech Classification
par: Keller, Lennart, et autres
Publié: (2024)
par: Keller, Lennart, et autres
Publié: (2024)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
par: Mi, Jinyi, et autres
Publié: (2024)
par: Mi, Jinyi, et autres
Publié: (2024)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
par: Wang, Peidong, et autres
Publié: (2025)
par: Wang, Peidong, et autres
Publié: (2025)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control
par: Blatt, Alexander, et autres
Publié: (2024)
par: Blatt, Alexander, et autres
Publié: (2024)
In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties
par: Roll, Nathan, et autres
Publié: (2025)
par: Roll, Nathan, et autres
Publié: (2025)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Automatic Speech Recognition System-Independent Word Error Rate Estimation
par: Park, Chanho, et autres
Publié: (2024)
par: Park, Chanho, et autres
Publié: (2024)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
par: Jin, Zengrui, et autres
Publié: (2024)
par: Jin, Zengrui, et autres
Publié: (2024)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
par: Chen, Sizhou, et autres
Publié: (2023)
par: Chen, Sizhou, et autres
Publié: (2023)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
Pheme: Efficient and Conversational Speech Generation
par: Budzianowski, Paweł, et autres
Publié: (2024)
par: Budzianowski, Paweł, et autres
Publié: (2024)
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
par: Elisha, Shahar, et autres
Publié: (2024)
par: Elisha, Shahar, et autres
Publié: (2024)
Analyzing and Improving Speaker Similarity Assessment for Speech Synthesis
par: Carbonneau, Marc-André, et autres
Publié: (2025)
par: Carbonneau, Marc-André, et autres
Publié: (2025)
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
par: Kim, Hyeongju, et autres
Publié: (2025)
par: Kim, Hyeongju, et autres
Publié: (2025)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
par: Lehečka, Jan, et autres
Publié: (2024)
par: Lehečka, Jan, et autres
Publié: (2024)
Documents similaires
-
Speech-Based Depression Prediction Using Encoder-Weight-Only Transfer Learning and a Large Corpus
par: Harati, Amir, et autres
Publié: (2024) -
Robust Speech and Natural Language Processing Models for Depression Screening
par: Lu, Y., et autres
Publié: (2024) -
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
par: Rutowski, Tomek, et autres
Publié: (2024) -
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
par: Wang, Kyra, et autres
Publié: (2024) -
Investigation of Speaker Representation for Target-Speaker Speech Processing
par: Ashihara, Takanori, et autres
Publié: (2024)