Principled Coarse-Grained Acceptance for Speculative Decoding in Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Yanuka, Moran, Dixon, Paul, Finkelshtein, Eyal, Rotman, Daniel, Giryes, Raja |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding
di: Yang, Yang, et al.
Pubblicazione: (2025)
di: Yang, Yang, et al.
Pubblicazione: (2025)
Hold Me Tight: Stable Encoder-Decoder Design for Speech Enhancement
di: Haider, Daniel, et al.
Pubblicazione: (2024)
di: Haider, Daniel, et al.
Pubblicazione: (2024)
Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping
di: Maghsoudi, Maryam, et al.
Pubblicazione: (2026)
di: Maghsoudi, Maryam, et al.
Pubblicazione: (2026)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
di: Cohen, Eyal, et al.
Pubblicazione: (2025)
di: Cohen, Eyal, et al.
Pubblicazione: (2025)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
SpeechOp: Inference-Time Task Composition for Generative Speech Processing
di: Lovelace, Justin, et al.
Pubblicazione: (2025)
di: Lovelace, Justin, et al.
Pubblicazione: (2025)
High Resolution Guitar Transcription via Domain Adaptation
di: Riley, Xavier, et al.
Pubblicazione: (2024)
di: Riley, Xavier, et al.
Pubblicazione: (2024)
Re-evaluating Minimum Bayes Risk Decoding for Automatic Speech Recognition
di: Jinnai, Yuu
Pubblicazione: (2025)
di: Jinnai, Yuu
Pubblicazione: (2025)
Who Said What? An Automated Approach to Analyzing Speech in Preschool Classrooms
di: Sun, Anchen, et al.
Pubblicazione: (2024)
di: Sun, Anchen, et al.
Pubblicazione: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
Discrete-Time Diffusion-Like Models for Speech Synthesis
di: Tan, Xiaozhou, et al.
Pubblicazione: (2025)
di: Tan, Xiaozhou, et al.
Pubblicazione: (2025)
Speech Understanding on Tiny Devices with A Learning Cache
di: Benazir, Afsara, et al.
Pubblicazione: (2023)
di: Benazir, Afsara, et al.
Pubblicazione: (2023)
Predictive-Generative Drift Decomposition for Speech Enhancement and Separation
di: Richter, Julius, et al.
Pubblicazione: (2026)
di: Richter, Julius, et al.
Pubblicazione: (2026)
YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation
di: Chang, Sungkyun, et al.
Pubblicazione: (2024)
di: Chang, Sungkyun, et al.
Pubblicazione: (2024)
Decoding Stimulus Reconstruction-Based Auditory Attention Robustly in Unbalanced EEG Datasets
di: Zhang, Yuanming, et al.
Pubblicazione: (2026)
di: Zhang, Yuanming, et al.
Pubblicazione: (2026)
SPIRIT: Patching Speech Language Models against Jailbreak Attacks
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2025)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2025)
Universal Semantic Disentangled Privacy-preserving Speech Representation Learning
di: Vecino, Biel Tura, et al.
Pubblicazione: (2025)
di: Vecino, Biel Tura, et al.
Pubblicazione: (2025)
MaskCycleGAN-based Whisper to Normal Speech Conversion
di: Gupta, K. Rohith, et al.
Pubblicazione: (2024)
di: Gupta, K. Rohith, et al.
Pubblicazione: (2024)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition
di: Thimonier, Hugo, et al.
Pubblicazione: (2025)
di: Thimonier, Hugo, et al.
Pubblicazione: (2025)
Benchmarking Automatic Speech Recognition coupled LLM Modules for Medical Diagnostics
di: Kumar, Kabir
Pubblicazione: (2025)
di: Kumar, Kabir
Pubblicazione: (2025)
Does Language Matter for Early Detection of Parkinson's Disease from Speech?
di: Plantinga, Peter, et al.
Pubblicazione: (2025)
di: Plantinga, Peter, et al.
Pubblicazione: (2025)
Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
di: Wei, Linye, et al.
Pubblicazione: (2025)
di: Wei, Linye, et al.
Pubblicazione: (2025)
Diffusion Buffer: Online Diffusion-based Speech Enhancement with Sub-Second Latency
di: Lay, Bunlong, et al.
Pubblicazione: (2025)
di: Lay, Bunlong, et al.
Pubblicazione: (2025)
Vibravox: A Dataset of French Speech Captured with Body-conduction Audio Sensors
di: Hauret, Julien, et al.
Pubblicazione: (2024)
di: Hauret, Julien, et al.
Pubblicazione: (2024)
Regularized Entropy Information Adaptation with Temporal-Awareness Networks for Simultaneous Speech Translation
di: Liu, Joseph, et al.
Pubblicazione: (2026)
di: Liu, Joseph, et al.
Pubblicazione: (2026)
A Context-Based Numerical Format Prediction for a Text-To-Speech System
di: Darwesh, Yaser, et al.
Pubblicazione: (2024)
di: Darwesh, Yaser, et al.
Pubblicazione: (2024)
Impact of Speech Mode in Automatic Pathological Speech Detection
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
di: Yemini, Yochai, et al.
Pubblicazione: (2025)
di: Yemini, Yochai, et al.
Pubblicazione: (2025)
Speech Foundation Models Generalize to Time Series Tasks from Wearable Sensor Data
di: Narain, Jaya, et al.
Pubblicazione: (2025)
di: Narain, Jaya, et al.
Pubblicazione: (2025)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
di: Gerazov, Branislav, et al.
Pubblicazione: (2025)
di: Gerazov, Branislav, et al.
Pubblicazione: (2025)
From Black Box to Biomarker: Sparse Autoencoders for Interpreting Speech Models of Parkinson's Disease
di: Plantinga, Peter, et al.
Pubblicazione: (2025)
di: Plantinga, Peter, et al.
Pubblicazione: (2025)
A Data-Driven Analysis of Robust Automatic Piano Transcription
di: Edwards, Drew, et al.
Pubblicazione: (2024)
di: Edwards, Drew, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding
di: Yang, Yang, et al.
Pubblicazione: (2025) -
Hold Me Tight: Stable Encoder-Decoder Design for Speech Enhancement
di: Haider, Daniel, et al.
Pubblicazione: (2024) -
Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping
di: Maghsoudi, Maryam, et al.
Pubblicazione: (2026) -
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
di: Cohen, Eyal, et al.
Pubblicazione: (2025) -
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)