Navigating the Minefield of MT Beam Search in Cascaded Streaming Speech Translation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rabatin, Rastislav, Seide, Frank, Chang, Ernie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
par: Moritz, Niko, et autres
Publié: (2024)
par: Moritz, Niko, et autres
Publié: (2024)
RosettaSpeech: Zero-Shot Speech-to-Speech Translation without Parallel Speech
par: Zheng, Zhisheng, et autres
Publié: (2025)
par: Zheng, Zhisheng, et autres
Publié: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
par: Bai, Richard He, et autres
Publié: (2025)
par: Bai, Richard He, et autres
Publié: (2025)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
par: Duret, Jarod, et autres
Publié: (2024)
par: Duret, Jarod, et autres
Publié: (2024)
SimulTron: On-Device Simultaneous Speech to Speech Translation
par: Agranovich, Alex, et autres
Publié: (2024)
par: Agranovich, Alex, et autres
Publié: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
par: Nachmani, Eliya, et autres
Publié: (2023)
par: Nachmani, Eliya, et autres
Publié: (2023)
REINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech Translation
par: Hirschkind, Nameer, et autres
Publié: (2025)
par: Hirschkind, Nameer, et autres
Publié: (2025)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
par: Seide, Frank, et autres
Publié: (2024)
par: Seide, Frank, et autres
Publié: (2024)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
par: Shankar, Bhavani, et autres
Publié: (2024)
par: Shankar, Bhavani, et autres
Publié: (2024)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
par: Papi, Sara, et autres
Publié: (2023)
par: Papi, Sara, et autres
Publié: (2023)
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024)
par: Jia, Junteng, et autres
Publié: (2024)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
par: Puvvada, Krishna C., et autres
Publié: (2024)
par: Puvvada, Krishna C., et autres
Publié: (2024)
Data-Centric Lessons To Improve Speech-Language Pretraining
par: Udandarao, Vishaal, et autres
Publié: (2025)
par: Udandarao, Vishaal, et autres
Publié: (2025)
TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild
par: Chang, Kai-Wei, et autres
Publié: (2026)
par: Chang, Kai-Wei, et autres
Publié: (2026)
PHONOS: PHOnetic Neutralization for Online Streaming Applications
par: Quamer, Waris, et autres
Publié: (2026)
par: Quamer, Waris, et autres
Publié: (2026)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
FeruzaSpeech: A 60 Hour Uzbek Read Speech Corpus with Punctuation, Casing, and Context
par: Povey, Anna, et autres
Publié: (2024)
par: Povey, Anna, et autres
Publié: (2024)
DarkStream: real-time speech anonymization with low latency
par: Quamer, Waris, et autres
Publié: (2025)
par: Quamer, Waris, et autres
Publié: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
Turbocharge Speech Understanding with Pilot Inference
par: Wang, Rongxiang, et autres
Publié: (2023)
par: Wang, Rongxiang, et autres
Publié: (2023)
Integrating Self-supervised Speech Model with Pseudo Word-level Targets from Visually-grounded Speech Model
par: Fang, Hung-Chieh, et autres
Publié: (2024)
par: Fang, Hung-Chieh, et autres
Publié: (2024)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
par: Chen, William, et autres
Publié: (2025)
par: Chen, William, et autres
Publié: (2025)
Effective internal language model training and fusion for factorized transducer model
par: Guo, Jinxi, et autres
Publié: (2024)
par: Guo, Jinxi, et autres
Publié: (2024)
Streaming Speech-to-Text Translation with a SpeechLLM
par: Parcollet, Titouan, et autres
Publié: (2026)
par: Parcollet, Titouan, et autres
Publié: (2026)
Gender Bias in Instruction-Guided Speech Synthesis Models
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Self-Supervised Speech Representations are More Phonetic than Semantic
par: Choi, Kwanghee, et autres
Publié: (2024)
par: Choi, Kwanghee, et autres
Publié: (2024)
A Contrastive Learning Approach to Mitigate Bias in Speech Models
par: Koudounas, Alkis, et autres
Publié: (2024)
par: Koudounas, Alkis, et autres
Publié: (2024)
Enhancing Multilingual Voice Toxicity Detection with Speech-Text Alignment
par: Liu, Joseph, et autres
Publié: (2024)
par: Liu, Joseph, et autres
Publié: (2024)
Scalable Frameworks for Real-World Audio-Visual Speech Recognition
par: Kim, Sungnyun
Publié: (2025)
par: Kim, Sungnyun
Publié: (2025)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2021)
par: Eeckt, Steven Vander, et autres
Publié: (2021)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
par: Chang, Heng-Jui, et autres
Publié: (2024)
par: Chang, Heng-Jui, et autres
Publié: (2024)
Preset-Voice Matching for Privacy Regulated Speech-to-Speech Translation Systems
par: Platnick, Daniel, et autres
Publié: (2024)
par: Platnick, Daniel, et autres
Publié: (2024)
Re-evaluating Minimum Bayes Risk Decoding for Automatic Speech Recognition
par: Jinnai, Yuu
Publié: (2025)
par: Jinnai, Yuu
Publié: (2025)
What Do Self-Supervised Speech Models Know About Words?
par: Pasad, Ankita, et autres
Publié: (2023)
par: Pasad, Ankita, et autres
Publié: (2023)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
par: Bartelds, Martijn, et autres
Publié: (2025)
par: Bartelds, Martijn, et autres
Publié: (2025)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
par: Ristea, Nicolae-Catalin, et autres
Publié: (2024)
par: Ristea, Nicolae-Catalin, et autres
Publié: (2024)
Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
A Multimodal Approach to Device-Directed Speech Detection with Large Language Models
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
par: Lux, Florian, et autres
Publié: (2024)
par: Lux, Florian, et autres
Publié: (2024)
Documents similaires
-
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
par: Moritz, Niko, et autres
Publié: (2024) -
RosettaSpeech: Zero-Shot Speech-to-Speech Translation without Parallel Speech
par: Zheng, Zhisheng, et autres
Publié: (2025) -
SpeakStream: Streaming Text-to-Speech with Interleaved Data
par: Bai, Richard He, et autres
Publié: (2025) -
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
par: Duret, Jarod, et autres
Publié: (2024) -
SimulTron: On-Device Simultaneous Speech to Speech Translation
par: Agranovich, Alex, et autres
Publié: (2024)