Text Injection for Neural Contextual Biasing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Meng, Zhong, Wu, Zelin, Prabhavalkar, Rohit, Peyser, Cal, Wang, Weiran, Chen, Nanxin, Sainath, Tara N., Ramabhadran, Bhuvana |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How to Estimate Model Transferability of Pre-Trained Speech Models?
par: Chen, Zih-Ching, et autres
Publié: (2023)
par: Chen, Zih-Ching, et autres
Publié: (2023)
Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR
par: Wu, Zelin, et autres
Publié: (2024)
par: Wu, Zelin, et autres
Publié: (2024)
sVAD: A Robust, Low-Power, and Light-Weight Voice Activity Detection with Spiking Neural Networks
par: Yang, Qu, et autres
Publié: (2024)
par: Yang, Qu, et autres
Publié: (2024)
Spiking-LEAF: A Learnable Auditory front-end for Spiking Neural Networks
par: Song, Zeyang, et autres
Publié: (2023)
par: Song, Zeyang, et autres
Publié: (2023)
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
par: Munkhdalai, Tsendsuren, et autres
Publié: (2024)
par: Munkhdalai, Tsendsuren, et autres
Publié: (2024)
Accurate Mapping of RNNs on Neuromorphic Hardware with Adaptive Spiking Neurons
par: Boeshertz, Gauthier, et autres
Publié: (2024)
par: Boeshertz, Gauthier, et autres
Publié: (2024)
A Comparison of Temporal Encoders for Neuromorphic Keyword Spotting with Few Neurons
par: Nilsson, Mattias, et autres
Publié: (2023)
par: Nilsson, Mattias, et autres
Publié: (2023)
Artificial Neural Networks Trained on Noisy Speech Exhibit the McGurk Effect
par: Grasse, Lukas, et autres
Publié: (2024)
par: Grasse, Lukas, et autres
Publié: (2024)
Grammatical Structure and Grammatical Variations in Non-Metric Iranian Classical Music
par: Kanani, Maziar, et autres
Publié: (2025)
par: Kanani, Maziar, et autres
Publié: (2025)
Generative Voice Bursts during Phone Call
par: Ranjan, Paritosh, et autres
Publié: (2025)
par: Ranjan, Paritosh, et autres
Publié: (2025)
Neurobench: DCASE 2020 Acoustic Scene Classification benchmark on XyloAudio 2
par: Ke, Weijie, et autres
Publié: (2024)
par: Ke, Weijie, et autres
Publié: (2024)
Resource-Efficient Speech Quality Prediction through Quantization Aware Training and Binary Activation Maps
par: Nilsson, Mattias, et autres
Publié: (2024)
par: Nilsson, Mattias, et autres
Publié: (2024)
Low-power SNN-based audio source localisation using a Hilbert Transform spike encoding scheme
par: Haghighatshoar, Saeid, et autres
Publié: (2024)
par: Haghighatshoar, Saeid, et autres
Publié: (2024)
DeepSpeech models show Human-like Performance and Processing of Cochlear Implant Inputs
par: Steinhardt, Cynthia R., et autres
Publié: (2024)
par: Steinhardt, Cynthia R., et autres
Publié: (2024)
A Novel Transfer Learning Approach for Mental Stability Classification from Voice Signal
par: Islam, Rafiul, et autres
Publié: (2026)
par: Islam, Rafiul, et autres
Publié: (2026)
Global-Local Convolution with Spiking Neural Networks for Energy-efficient Keyword Spotting
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
DPSNN: Spiking Neural Network for Low-Latency Streaming Speech Enhancement
par: Sun, Tao, et autres
Publié: (2024)
par: Sun, Tao, et autres
Publié: (2024)
Long-Form Text-to-Music Generation with Adaptive Prompts: A Case Study in Tabletop Role-Playing Games Soundtracks
par: Marra, Felipe, et autres
Publié: (2024)
par: Marra, Felipe, et autres
Publié: (2024)
Learning spatial hearing via innate mechanisms
par: Chu, Yang, et autres
Publié: (2020)
par: Chu, Yang, et autres
Publié: (2020)
Deep Photonic Reservoir Computer for Speech Recognition
par: Picco, Enrico, et autres
Publié: (2023)
par: Picco, Enrico, et autres
Publié: (2023)
Biomimetic Frontend for Differentiable Audio Processing
par: Famularo, Ruolan Leslie, et autres
Publié: (2024)
par: Famularo, Ruolan Leslie, et autres
Publié: (2024)
Learning Delays in Spiking Neural Networks using Dilated Convolutions with Learnable Spacings
par: Hammouamri, Ilyass, et autres
Publié: (2023)
par: Hammouamri, Ilyass, et autres
Publié: (2023)
Scaling Properties of Speech Language Models
par: Cuervo, Santiago, et autres
Publié: (2024)
par: Cuervo, Santiago, et autres
Publié: (2024)
Ternary Spike-based Neuromorphic Signal Processing System
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
Parsing Musical Structure to Enable Meaningful Variations
par: Kanani, Maziar, et autres
Publié: (2025)
par: Kanani, Maziar, et autres
Publié: (2025)
Parallel Stacked Aggregated Network for Voice Authentication in IoT-Enabled Smart Devices
par: Khan, Awais, et autres
Publié: (2024)
par: Khan, Awais, et autres
Publié: (2024)
Spiketrum: An FPGA-based Implementation of a Neuromorphic Cochlea
par: Alsakkal, MHD Anas, et autres
Publié: (2024)
par: Alsakkal, MHD Anas, et autres
Publié: (2024)
Robust online reconstruction of continuous-time signals from a lean spike train ensemble code
par: Chattopadhyay, Anik, et autres
Publié: (2024)
par: Chattopadhyay, Anik, et autres
Publié: (2024)
LVNS-RAVE: Diversified audio generation with RAVE and Latent Vector Novelty Search
par: Guo, Jinyue, et autres
Publié: (2024)
par: Guo, Jinyue, et autres
Publié: (2024)
LACTOSE: Linear Array of Conditions, TOpologies with Separated Error-backpropagation -- The Differentiable "IF" Conditional for Differentiable Digital Signal Processing
par: Clarke, Christopher Johann
Publié: (2025)
par: Clarke, Christopher Johann
Publié: (2025)
Spiking Music: Audio Compression with Event Based Auto-encoders
par: Lisboa, Martim, et autres
Publié: (2024)
par: Lisboa, Martim, et autres
Publié: (2024)
Delayed Memory Unit: Modelling Temporal Dependency Through Delay Gate
par: Sun, Pengfei, et autres
Publié: (2023)
par: Sun, Pengfei, et autres
Publié: (2023)
HyperSound: Generating Implicit Neural Representations of Audio Signals with Hypernetworks
par: Szatkowski, Filip, et autres
Publié: (2022)
par: Szatkowski, Filip, et autres
Publié: (2022)
Spoken Conversational Agents with Large Language Models
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
Deformable Audio Transformer for Audio Event Detection
par: Zhu, Wentao
Publié: (2023)
par: Zhu, Wentao
Publié: (2023)
A novel Reservoir Architecture for Periodic Time Series Prediction
par: Yuan, Zhongju, et autres
Publié: (2024)
par: Yuan, Zhongju, et autres
Publié: (2024)
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models
par: Prabhavalkar, Rohit, et autres
Publié: (2024)
par: Prabhavalkar, Rohit, et autres
Publié: (2024)
Acoustic neural networks: Identifying design principles and exploring physical feasibility
par: Kalthoff, Ivan, et autres
Publié: (2025)
par: Kalthoff, Ivan, et autres
Publié: (2025)
Emotion Detection Using Conditional Generative Adversarial Networks (cGAN): A Deep Learning Approach
par: Srivastava, Anushka
Publié: (2025)
par: Srivastava, Anushka
Publié: (2025)
LMUFormer: Low Complexity Yet Powerful Spiking Model With Legendre Memory Units
par: Liu, Zeyu, et autres
Publié: (2024)
par: Liu, Zeyu, et autres
Publié: (2024)
Documents similaires
-
How to Estimate Model Transferability of Pre-Trained Speech Models?
par: Chen, Zih-Ching, et autres
Publié: (2023) -
Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR
par: Wu, Zelin, et autres
Publié: (2024) -
sVAD: A Robust, Low-Power, and Light-Weight Voice Activity Detection with Spiking Neural Networks
par: Yang, Qu, et autres
Publié: (2024) -
Spiking-LEAF: A Learnable Auditory front-end for Spiking Neural Networks
par: Song, Zeyang, et autres
Publié: (2023) -
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
par: Munkhdalai, Tsendsuren, et autres
Publié: (2024)