Saved in:
| Main Authors: | Moon, Todd K, Gunther, Jacob H. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2403.13253 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Linguistic Changes in Spontaneous Speech for Detecting Parkinsons Disease Using Large Language Models
by: Crawford, Jonathan
Published: (2024)
by: Crawford, Jonathan
Published: (2024)
End-to-End Speech Translation for Low-Resource Languages Using Weakly Labeled Data
by: Pothula, Aishwarya, et al.
Published: (2025)
by: Pothula, Aishwarya, et al.
Published: (2025)
Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition
by: Geng, Mengzhe, et al.
Published: (2025)
by: Geng, Mengzhe, et al.
Published: (2025)
PSST! Prosodic Speech Segmentation with Transformers
by: Roll, Nathan, et al.
Published: (2023)
by: Roll, Nathan, et al.
Published: (2023)
A Few-Shot Approach to Dysarthric Speech Intelligibility Level Classification Using Transformers
by: Chowdary, Paleti Nikhil, et al.
Published: (2023)
by: Chowdary, Paleti Nikhil, et al.
Published: (2023)
Scaling Spoken Language Models with Syllabic Speech Tokenization
by: Lee, Nicholas, et al.
Published: (2025)
by: Lee, Nicholas, et al.
Published: (2025)
Optimizing Speech-Input Length for Speaker-Independent Depression Classification
by: Rutowski, Tomasz, et al.
Published: (2024)
by: Rutowski, Tomasz, et al.
Published: (2024)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
by: Poli, Maxime, et al.
Published: (2024)
by: Poli, Maxime, et al.
Published: (2024)
Automatic Classification of News Subjects in Broadcast News: Application to a Gender Bias Representation Analysis
by: Pelloin, Valentin, et al.
Published: (2024)
by: Pelloin, Valentin, et al.
Published: (2024)
An End-to-End Speech Summarization Using Large Language Model
by: Shang, Hengchao, et al.
Published: (2024)
by: Shang, Hengchao, et al.
Published: (2024)
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
by: Wu, Shangda, et al.
Published: (2024)
by: Wu, Shangda, et al.
Published: (2024)
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
by: Huang, Shao-Syuan, et al.
Published: (2024)
by: Huang, Shao-Syuan, et al.
Published: (2024)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
by: Zhang, Wenyu, et al.
Published: (2025)
by: Zhang, Wenyu, et al.
Published: (2025)
ITALIC: An Italian Intent Classification Dataset
by: Koudounas, Alkis, et al.
Published: (2023)
by: Koudounas, Alkis, et al.
Published: (2023)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
by: Cui, Ziyun, et al.
Published: (2024)
by: Cui, Ziyun, et al.
Published: (2024)
Analysing the Language of Neural Audio Codecs
by: Park, Joonyong, et al.
Published: (2025)
by: Park, Joonyong, et al.
Published: (2025)
Towards Hierarchical Spoken Language Dysfluency Modeling
by: Lian, Jiachen, et al.
Published: (2024)
by: Lian, Jiachen, et al.
Published: (2024)
SpeechTaxi: On Multilingual Semantic Speech Classification
by: Keller, Lennart, et al.
Published: (2024)
by: Keller, Lennart, et al.
Published: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
by: Elisha, Shahar, et al.
Published: (2024)
by: Elisha, Shahar, et al.
Published: (2024)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
by: Kashiwagi, Yosuke, et al.
Published: (2024)
by: Kashiwagi, Yosuke, et al.
Published: (2024)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
by: Rutowski, Tomek, et al.
Published: (2024)
by: Rutowski, Tomek, et al.
Published: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
by: Hsu, Ming-Hao, et al.
Published: (2023)
by: Hsu, Ming-Hao, et al.
Published: (2023)
Optimizing Contextual Speech Recognition Using Vector Quantization for Efficient Retrieval
by: Flemotomos, Nikolaos, et al.
Published: (2024)
by: Flemotomos, Nikolaos, et al.
Published: (2024)
Pronunciation Assessment with Multi-modal Large Language Models
by: Fu, Kaiqi, et al.
Published: (2024)
by: Fu, Kaiqi, et al.
Published: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
by: Lin, Guan-Ting, et al.
Published: (2023)
by: Lin, Guan-Ting, et al.
Published: (2023)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
by: Chiang, Cheng-Han, et al.
Published: (2025)
by: Chiang, Cheng-Han, et al.
Published: (2025)
SSVD: Structured SVD for Parameter-Efficient Fine-Tuning and Benchmarking under Domain Shift in ASR
by: Wang, Pu, et al.
Published: (2025)
by: Wang, Pu, et al.
Published: (2025)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
by: Yeo, Eunjung, et al.
Published: (2026)
by: Yeo, Eunjung, et al.
Published: (2026)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
by: Huang, Kuan-Po, et al.
Published: (2023)
by: Huang, Kuan-Po, et al.
Published: (2023)
A Parameter-efficient Language Extension Framework for Multilingual ASR
by: Liu, Wei, et al.
Published: (2024)
by: Liu, Wei, et al.
Published: (2024)
Robust Speech and Natural Language Processing Models for Depression Screening
by: Lu, Y., et al.
Published: (2024)
by: Lu, Y., et al.
Published: (2024)
Multi-stage Large Language Model Correction for Speech Recognition
by: Pu, Jie, et al.
Published: (2023)
by: Pu, Jie, et al.
Published: (2023)
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
by: Shen, Gaofei, et al.
Published: (2026)
by: Shen, Gaofei, et al.
Published: (2026)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
by: Koluguri, Nithin Rao, et al.
Published: (2025)
by: Koluguri, Nithin Rao, et al.
Published: (2025)
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
by: Visser, Nicol, et al.
Published: (2025)
by: Visser, Nicol, et al.
Published: (2025)
Music Flamingo: Scaling Music Understanding in Audio Language Models
by: Ghosh, Sreyan, et al.
Published: (2025)
by: Ghosh, Sreyan, et al.
Published: (2025)
Fine-tuning Whisper on Low-Resource Languages for Real-World Applications
by: Timmel, Vincenzo, et al.
Published: (2024)
by: Timmel, Vincenzo, et al.
Published: (2024)
Seamless Language Expansion: Enhancing Multilingual Mastery in Self-Supervised Models
by: Xu, Jing, et al.
Published: (2024)
by: Xu, Jing, et al.
Published: (2024)
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
by: Kang, Wonjune, et al.
Published: (2024)
by: Kang, Wonjune, et al.
Published: (2024)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
by: Sildam, Tiia, et al.
Published: (2024)
by: Sildam, Tiia, et al.
Published: (2024)
Similar Items
-
Linguistic Changes in Spontaneous Speech for Detecting Parkinsons Disease Using Large Language Models
by: Crawford, Jonathan
Published: (2024) -
End-to-End Speech Translation for Low-Resource Languages Using Weakly Labeled Data
by: Pothula, Aishwarya, et al.
Published: (2025) -
Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition
by: Geng, Mengzhe, et al.
Published: (2025) -
PSST! Prosodic Speech Segmentation with Transformers
by: Roll, Nathan, et al.
Published: (2023) -
A Few-Shot Approach to Dysarthric Speech Intelligibility Level Classification Using Transformers
by: Chowdary, Paleti Nikhil, et al.
Published: (2023)