WHISTRESS: Enriching Transcriptions with Sentence Stress Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yosha, Iddo, Shteyman, Dorin, Adi, Yossi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025)
par: Yosha, Iddo, et autres
Publié: (2025)
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024)
par: Maimon, Gallil, et autres
Publié: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
par: Har-Tuv, Nadav, et autres
Publié: (2025)
par: Har-Tuv, Nadav, et autres
Publié: (2025)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
par: Zeldes, Ella, et autres
Publié: (2024)
par: Zeldes, Ella, et autres
Publié: (2024)
TranSentence: Speech-to-speech Translation via Language-agnostic Sentence-level Speech Encoding without Language-parallel Data
par: Kim, Seung-Bin, et autres
Publié: (2024)
par: Kim, Seung-Bin, et autres
Publié: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Audio Enhancement from Multiple Crowdsourced Recordings: A Simple and Effective Baseline
par: Aziz, Shiran, et autres
Publié: (2024)
par: Aziz, Shiran, et autres
Publié: (2024)
Fotheidil: an Automatic Transcription System for the Irish Language
par: Lonergan, Liam, et autres
Publié: (2024)
par: Lonergan, Liam, et autres
Publié: (2024)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Joint Transcription of Acoustic Guitar Strumming Directions and Chords
par: Murgul, Sebastian, et autres
Publié: (2025)
par: Murgul, Sebastian, et autres
Publié: (2025)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
par: Elmakies, Avishai, et autres
Publié: (2025)
par: Elmakies, Avishai, et autres
Publié: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
par: Hu, Rui, et autres
Publié: (2025)
par: Hu, Rui, et autres
Publié: (2025)
Exploring Procedural Data Generation for Automatic Acoustic Guitar Fingerpicking Transcription
par: Murgul, Sebastian, et autres
Publié: (2025)
par: Murgul, Sebastian, et autres
Publié: (2025)
Mind the Gap: Entity-Preserved Context-Aware ASR Structured Transcriptions
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
par: Huang, Jiawen, et autres
Publié: (2024)
par: Huang, Jiawen, et autres
Publié: (2024)
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
par: Lin, Jhen-Ke, et autres
Publié: (2025)
par: Lin, Jhen-Ke, et autres
Publié: (2025)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
par: Adedeji, Ayo, et autres
Publié: (2024)
par: Adedeji, Ayo, et autres
Publié: (2024)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
par: Zhuo, Le, et autres
Publié: (2023)
par: Zhuo, Le, et autres
Publié: (2023)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
par: Valente, Martina, et autres
Publié: (2024)
par: Valente, Martina, et autres
Publié: (2024)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
par: Liang, Siyu, et autres
Publié: (2025)
par: Liang, Siyu, et autres
Publié: (2025)
From Weak Labels to Strong Results: Utilizing 5,000 Hours of Noisy Classroom Transcripts with Minimal Accurate Data
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
par: Rouard, Simon, et autres
Publié: (2025)
par: Rouard, Simon, et autres
Publié: (2025)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
par: Akarsh, Sai, et autres
Publié: (2024)
par: Akarsh, Sai, et autres
Publié: (2024)
CAFA: a Controllable Automatic Foley Artist
par: Benita, Roi, et autres
Publié: (2025)
par: Benita, Roi, et autres
Publié: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024)
par: Rouard, Simon, et autres
Publié: (2024)
NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription
par: Vinnikov, Alon, et autres
Publié: (2024)
par: Vinnikov, Alon, et autres
Publié: (2024)
Fretting-Transformer: Encoder-Decoder Model for MIDI to Tablature Transcription
par: Hamberger, Anna, et autres
Publié: (2025)
par: Hamberger, Anna, et autres
Publié: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
par: Ljubešić, Nikola, et autres
Publié: (2025)
par: Ljubešić, Nikola, et autres
Publié: (2025)
Latent Watermarking of Audio Generative Models
par: Roman, Robin San, et autres
Publié: (2024)
par: Roman, Robin San, et autres
Publié: (2024)
Alzheimer Disease Classification through ASR-based Transcriptions: Exploring the Impact of Punctuation and Pauses
par: Gómez-Zaragozá, Lucía, et autres
Publié: (2023)
par: Gómez-Zaragozá, Lucía, et autres
Publié: (2023)
Dynamic Stress Detection: A Study of Temporal Progression Modelling of Stress in Speech
par: Lall, Vishakha, et autres
Publié: (2025)
par: Lall, Vishakha, et autres
Publié: (2025)
Toward Automated Clinical Transcriptions
par: Klusty, Mitchell A., et autres
Publié: (2024)
par: Klusty, Mitchell A., et autres
Publié: (2024)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Documents similaires
-
StressTest: Can YOUR Speech LM Handle the Stress?
par: Yosha, Iddo, et autres
Publié: (2025) -
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024) -
Salmon: A Suite for Acoustic Language Model Evaluation
par: Maimon, Gallil, et autres
Publié: (2024) -
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024) -
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)