ESPnet-SpeechLM: An Open Speech Language Model Toolkit
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Jinchuan, Shi, Jiatong, Chen, William, Arora, Siddhant, Masuyama, Yoshiki, Maekaku, Takashi, Wu, Yihan, Peng, Junyi, Bharadwaj, Shikhar, Zhao, Yiwen, Cornell, Samuele, Peng, Yifan, Yue, Xiang, Yang, Chao-Han Huck, Neubig, Graham, Watanabe, Shinji |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OpusLM: A Family of Open Unified Speech Language Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
di: Someki, Masao, et al.
Pubblicazione: (2024)
di: Someki, Masao, et al.
Pubblicazione: (2024)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Online Register for Dual-Mode Self-Supervised Speech Models: Mitigating The Lack of Future Context
di: Goto, Keita, et al.
Pubblicazione: (2026)
di: Goto, Keita, et al.
Pubblicazione: (2026)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)
di: Li, Chenda, et al.
Pubblicazione: (2024)
Adapting Speech Language Model to Singing Voice Synthesis
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
di: Wu, Yuning, et al.
Pubblicazione: (2024)
di: Wu, Yuning, et al.
Pubblicazione: (2024)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
di: Chen, William, et al.
Pubblicazione: (2025)
di: Chen, William, et al.
Pubblicazione: (2025)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
di: Futami, Hayato, et al.
Pubblicazione: (2025)
di: Futami, Hayato, et al.
Pubblicazione: (2025)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
di: Arora, Siddhant, et al.
Pubblicazione: (2025)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
di: Arora, Siddhant, et al.
Pubblicazione: (2026)
di: Arora, Siddhant, et al.
Pubblicazione: (2026)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
Recent Trends in Distant Conversational Speech Recognition: A Review of CHiME-7 and 8 DASR Challenges
di: Cornell, Samuele, et al.
Pubblicazione: (2025)
di: Cornell, Samuele, et al.
Pubblicazione: (2025)
Exploring the Capability of Mamba in Speech Applications
di: Miyazaki, Koichi, et al.
Pubblicazione: (2024)
di: Miyazaki, Koichi, et al.
Pubblicazione: (2024)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
di: Tsunoo, Emiru, et al.
Pubblicazione: (2023)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2023)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
Context-Driven Dynamic Pruning for Large Speech Foundation Models
di: Someki, Masao, et al.
Pubblicazione: (2025)
di: Someki, Masao, et al.
Pubblicazione: (2025)
Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
di: Kashiwagi, Yosuke, et al.
Pubblicazione: (2024)
Towards Robust Speech Representation Learning for Thousands of Languages
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
MAPSS: Manifold-based Assessment of Perceptual Source Separation
di: Ivry, Amir, et al.
Pubblicazione: (2025)
di: Ivry, Amir, et al.
Pubblicazione: (2025)
Cross-Talk Speech Reduction, by Separation, for Separation
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet
di: Ying, Anyu, et al.
Pubblicazione: (2025)
di: Ying, Anyu, et al.
Pubblicazione: (2025)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OpusLM: A Family of Open Unified Speech Language Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2025) -
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
di: Arora, Siddhant, et al.
Pubblicazione: (2025) -
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
di: Su, Bo-Hao, et al.
Pubblicazione: (2025) -
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
di: Someki, Masao, et al.
Pubblicazione: (2024) -
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)