Streaming Translation and Transcription Through Speech-to-Text Causal Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Koshkin, Roman, Haesung, Jeon, Liu, Lianbo, Shi, Hao, Zhao, Mengjie, Fujita, Yusuke, Sudo, Yui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
par: Zhao, Mengjie, et autres
Publié: (2026)
par: Zhao, Mengjie, et autres
Publié: (2026)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing
par: Shi, Hao, et autres
Publié: (2026)
par: Shi, Hao, et autres
Publié: (2026)
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
par: Yang, Jianing, et autres
Publié: (2026)
par: Yang, Jianing, et autres
Publié: (2026)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
par: Fujita, Yusuke, et autres
Publié: (2025)
par: Fujita, Yusuke, et autres
Publié: (2025)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
SASST: Leveraging Syntax-Aware Chunking and LLMs for Simultaneous Speech Translation
par: Yang, Zeyu, et autres
Publié: (2025)
par: Yang, Zeyu, et autres
Publié: (2025)
LLMs Are Zero-Shot Context-Aware Simultaneous Translators
par: Koshkin, Roman, et autres
Publié: (2024)
par: Koshkin, Roman, et autres
Publié: (2024)
TransLLaMa: LLM-based Simultaneous Translation System
par: Koshkin, Roman, et autres
Publié: (2024)
par: Koshkin, Roman, et autres
Publié: (2024)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Streaming Speech-to-Text Translation with a SpeechLLM
par: Parcollet, Titouan, et autres
Publié: (2026)
par: Parcollet, Titouan, et autres
Publié: (2026)
EmoAra: Emotion-Preserving English Speech Transcription and Cross-Lingual Translation with Arabic Text-to-Speech
par: Hassan, Besher, et autres
Publié: (2026)
par: Hassan, Besher, et autres
Publié: (2026)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems
par: Gaido, Marco, et autres
Publié: (2025)
par: Gaido, Marco, et autres
Publié: (2025)
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
SparQLe: Speech Queries to Text Translation Through LLMs
par: Djanibekov, Amirbek, et autres
Publié: (2025)
par: Djanibekov, Amirbek, et autres
Publié: (2025)
Cross-Lingual Transfer Learning for Speech Translation
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
Overcoming Latency Bottlenecks in On-Device Speech Translation: A Cascaded Approach with Alignment-Based Streaming MT
par: Ahmed, Zeeshan, et autres
Publié: (2025)
par: Ahmed, Zeeshan, et autres
Publié: (2025)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
SpeechAlign: a Framework for Speech Translation Alignment Evaluation
par: Alastruey, Belen, et autres
Publié: (2023)
par: Alastruey, Belen, et autres
Publié: (2023)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
par: Papi, Sara, et autres
Publié: (2024)
par: Papi, Sara, et autres
Publié: (2024)
Algorithms For Automatic Accentuation And Transcription Of Russian Texts In Speech Recognition Systems
par: Iakovenko, Olga, et autres
Publié: (2024)
par: Iakovenko, Olga, et autres
Publié: (2024)
Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
par: Du, Yexing, et autres
Publié: (2026)
par: Du, Yexing, et autres
Publié: (2026)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning
par: Peng, Yifan, et autres
Publié: (2025)
par: Peng, Yifan, et autres
Publié: (2025)
Mark My Words: A Robust Multilingual Model for Punctuation in Text and Speech Transcripts
par: Pulipaka, Sidharth, et autres
Publié: (2025)
par: Pulipaka, Sidharth, et autres
Publié: (2025)
Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions
par: Park, Yoonah, et autres
Publié: (2025)
par: Park, Yoonah, et autres
Publié: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
par: Du, Yexing, et autres
Publié: (2025)
par: Du, Yexing, et autres
Publié: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
par: Shikhar, Sambal, et autres
Publié: (2025)
par: Shikhar, Sambal, et autres
Publié: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
par: Bai, Richard He, et autres
Publié: (2025)
par: Bai, Richard He, et autres
Publié: (2025)
Whisper-UT: A Unified Translation Framework for Speech and Text
par: Xiao, Cihan, et autres
Publié: (2025)
par: Xiao, Cihan, et autres
Publié: (2025)
Improvement in Sign Language Translation Using Text CTC Alignment
par: Tan, Sihan, et autres
Publié: (2024)
par: Tan, Sihan, et autres
Publié: (2024)
Documents similaires
-
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
par: Zhao, Mengjie, et autres
Publié: (2026) -
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025) -
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025) -
Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing
par: Shi, Hao, et autres
Publié: (2026) -
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
par: Yang, Jianing, et autres
Publié: (2026)