Salvato in:
| Autori principali: | Wagner, Dominik, Churchill, Alexander, Sigtia, Siddharth, Marchi, Erik |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2501.19377 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Multimodal Approach to Device-Directed Speech Detection with Large Language Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Adapting Language Balance in Code-Switching Speech
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023)
di: Hassid, Michael, et al.
Pubblicazione: (2023)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
Modeling Overlapped Speech with Shuffles
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
Energy-Based Models with Applications to Speech and Language Processing
di: Ou, Zhijian
Pubblicazione: (2024)
di: Ou, Zhijian
Pubblicazione: (2024)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
di: Chang, Heng-Jui, et al.
Pubblicazione: (2024)
di: Chang, Heng-Jui, et al.
Pubblicazione: (2024)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
di: Choi, Youngwon, et al.
Pubblicazione: (2025)
di: Choi, Youngwon, et al.
Pubblicazione: (2025)
Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models
di: Li, Weiqin, et al.
Pubblicazione: (2024)
di: Li, Weiqin, et al.
Pubblicazione: (2024)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
di: Fan, Xulin, et al.
Pubblicazione: (2026)
di: Fan, Xulin, et al.
Pubblicazione: (2026)
Mai Ho'omāuna i ka 'Ai: Language Models Improve Automatic Speech Recognition in Hawaiian
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
di: Lux, Florian, et al.
Pubblicazione: (2024)
di: Lux, Florian, et al.
Pubblicazione: (2024)
Unseen Speaker and Language Adaptation for Lightweight Text-To-Speech with Adapters
di: Falai, Alessio, et al.
Pubblicazione: (2025)
di: Falai, Alessio, et al.
Pubblicazione: (2025)
Generative Pre-training for Speech with Flow Matching
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026)
di: Sun, Haitong, et al.
Pubblicazione: (2026)
Coupling Speech Encoders with Downstream Text Models
di: Chelba, Ciprian, et al.
Pubblicazione: (2024)
di: Chelba, Ciprian, et al.
Pubblicazione: (2024)
Sonos Voice Control Bias Assessment Dataset: A Methodology for Demographic Bias Assessment in Voice Assistants
di: Sekkat, Chloé, et al.
Pubblicazione: (2024)
di: Sekkat, Chloé, et al.
Pubblicazione: (2024)
How Redundant Is the Transformer Stack in Speech Representation Models?
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
Analyzing Multimodal Features of Spontaneous Voice Assistant Commands for Mild Cognitive Impairment Detection
di: Lin, Nana, et al.
Pubblicazione: (2024)
di: Lin, Nana, et al.
Pubblicazione: (2024)
SimulTron: On-Device Simultaneous Speech to Speech Translation
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
On the Semantic Latent Space of Diffusion-Based Text-to-Speech Models
di: Varshavsky-Hassid, Miri, et al.
Pubblicazione: (2024)
di: Varshavsky-Hassid, Miri, et al.
Pubblicazione: (2024)
Towards Early Prediction of Self-Supervised Speech Model Performance
di: Whetten, Ryan, et al.
Pubblicazione: (2025)
di: Whetten, Ryan, et al.
Pubblicazione: (2025)
Towards Robust FastSpeech 2 by Modelling Residual Multimodality
di: Kögel, Fabian, et al.
Pubblicazione: (2023)
di: Kögel, Fabian, et al.
Pubblicazione: (2023)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
di: Yoo, Suho, et al.
Pubblicazione: (2025)
di: Yoo, Suho, et al.
Pubblicazione: (2025)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
Pre-Trained Foundation Model representations to uncover Breathing patterns in Speech
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
di: Liu, Andy T., et al.
Pubblicazione: (2024)
di: Liu, Andy T., et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Multimodal Approach to Device-Directed Speech Detection with Large Language Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Adapting Language Balance in Code-Switching Speech
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025) -
Textually Pretrained Speech Language Models
di: Hassid, Michael, et al.
Pubblicazione: (2023) -
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023) -
Modeling Overlapped Speech with Shuffles
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)