Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Hori, Takaaki, Kocour, Martin, Haider, Adnan, McDermott, Erik, Zhuang, Xiaodan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024)
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
How much to Dereverberate? Low-Latency Single-Channel Speech Enhancement in Distant Microphone Scenarios
di: Venkatesh, Satvik, et al.
Pubblicazione: (2025)
di: Venkatesh, Satvik, et al.
Pubblicazione: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
di: Seo, Geonwoo
Pubblicazione: (2025)
di: Seo, Geonwoo
Pubblicazione: (2025)
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
Connected Speech-Based Cognitive Assessment in Chinese and English
di: Luz, Saturnino, et al.
Pubblicazione: (2024)
di: Luz, Saturnino, et al.
Pubblicazione: (2024)
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025)
di: Agarwal, Rohan
Pubblicazione: (2025)
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
di: Jahanbin, Peyman
Pubblicazione: (2025)
di: Jahanbin, Peyman
Pubblicazione: (2025)
Hidden Echoes Survive Training in Audio To Audio Generative Instrument Models
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
Audio-based Kinship Verification Using Age Domain Conversion
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
di: Opria, Joshua
Pubblicazione: (2026)
di: Opria, Joshua
Pubblicazione: (2026)
Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
di: Aristorenas, Aris J.
Pubblicazione: (2024)
di: Aristorenas, Aris J.
Pubblicazione: (2024)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Passive Underwater Acoustic Signal Separation based on Feature Decoupling Dual-path Network
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
di: Liu, Yucheng, et al.
Pubblicazione: (2025)
Measuring the Accuracy of Automatic Speech Recognition Solutions
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
Enhancing Audio Generation Diversity with Visual Information
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
di: Sharma, Manali, et al.
Pubblicazione: (2026)
di: Sharma, Manali, et al.
Pubblicazione: (2026)
STAR: Speech-to-Audio Generation via Representation Learning
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Non-Invasive Suicide Risk Prediction Through Speech Analysis
di: Amiriparian, Shahin, et al.
Pubblicazione: (2024)
di: Amiriparian, Shahin, et al.
Pubblicazione: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
Developing Acoustic Models for Automatic Speech Recognition in Swedish
di: Salvi, Giampiero
Pubblicazione: (2024)
di: Salvi, Giampiero
Pubblicazione: (2024)
Automatic Speech Recognition of African American English: Lexical and Contextual Effects
di: Mojarad, Hamid, et al.
Pubblicazione: (2025)
di: Mojarad, Hamid, et al.
Pubblicazione: (2025)
MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr
di: Yang, Xuwen
Pubblicazione: (2025)
di: Yang, Xuwen
Pubblicazione: (2025)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Everyday Speech in the Indian Subcontinent
di: P, Utkarsh
Pubblicazione: (2024)
di: P, Utkarsh
Pubblicazione: (2024)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024) -
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026) -
How much to Dereverberate? Low-Latency Single-Channel Speech Enhancement in Distant Microphone Scenarios
di: Venkatesh, Satvik, et al.
Pubblicazione: (2025) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025) -
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
di: Seo, Geonwoo
Pubblicazione: (2025)