Language model integration based on memory control for sequence to sequence speech recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Cho, Jaejin, Watanabe, Shinji, Hori, Takaaki, Baskar, Murali Karthick, Inaguma, Hirofumi, Villalba, Jesus, Dehak, Najim |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2018
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
di: Joshi, Sonal, et al.
Pubblicazione: (2021)
Unraveling Adversarial Examples against Speaker Identification -- Techniques for Attack Detection and Victim Model Classification
di: Joshi, Sonal, et al.
Pubblicazione: (2024)
di: Joshi, Sonal, et al.
Pubblicazione: (2024)
ReFESS-QI: Reference-Free Evaluation For Speech Separation With Joint Quality And Intelligibility Scoring
di: Frummer, Ari, et al.
Pubblicazione: (2025)
di: Frummer, Ari, et al.
Pubblicazione: (2025)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
Adversarial Attacks and Defenses for Speech Recognition Systems
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
di: Żelasko, Piotr, et al.
Pubblicazione: (2021)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
SSR: Alignment-Aware Modality Connector for Speech Language Models
di: Tan, Weiting, et al.
Pubblicazione: (2024)
di: Tan, Weiting, et al.
Pubblicazione: (2024)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Graph-based multi-Feature fusion method for speech emotion recognition
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
di: Cao, Tianyu, et al.
Pubblicazione: (2026)
di: Cao, Tianyu, et al.
Pubblicazione: (2026)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
di: Lu, Yen-Ju, et al.
Pubblicazione: (2024)
di: Lu, Yen-Ju, et al.
Pubblicazione: (2024)
Phoneme-based speech recognition driven by large language models and sampling marginalization
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Improving child speech recognition with augmented child-like speech
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
MAPSS: Manifold-based Assessment of Perceptual Source Separation
di: Ivry, Amir, et al.
Pubblicazione: (2025)
di: Ivry, Amir, et al.
Pubblicazione: (2025)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
Heterogeneous bimodal attention fusion for speech emotion recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
di: Gong, Rong, et al.
Pubblicazione: (2024)
di: Gong, Rong, et al.
Pubblicazione: (2024)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Introduction to speech recognition
di: Dauphin, Gabriel
Pubblicazione: (2024)
di: Dauphin, Gabriel
Pubblicazione: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
Zipformer: A faster and better encoder for automatic speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
Self-consistent context aware conformer transducer for speech recognition
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Enhancing CTC-based speech recognition with diverse modeling units
di: Han, Shiyi, et al.
Pubblicazione: (2024)
di: Han, Shiyi, et al.
Pubblicazione: (2024)
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
CR-CTC: Consistency regularization on CTC for improved speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model
di: Shi, Jiatong, et al.
Pubblicazione: (2024) -
Study of Pre-processing Defenses against Adversarial Attacks on State-of-the-art Speaker Recognition Systems
di: Joshi, Sonal, et al.
Pubblicazione: (2021) -
Unraveling Adversarial Examples against Speaker Identification -- Techniques for Attack Detection and Victim Model Classification
di: Joshi, Sonal, et al.
Pubblicazione: (2024) -
ReFESS-QI: Reference-Free Evaluation For Speech Separation With Joint Quality And Intelligibility Scoring
di: Frummer, Ari, et al.
Pubblicazione: (2025) -
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023)