Enregistré dans:
| Auteurs principaux: | Deng, Keqi, Woodland, Philip C. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.04541 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition
par: Deng, Keqi, et autres
Publié: (2023)
par: Deng, Keqi, et autres
Publié: (2023)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025)
par: Deng, Keqi, et autres
Publié: (2025)
Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025)
par: Labiausse, Tom, et autres
Publié: (2025)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
SimulMEGA: MoE Routers are Advanced Policy Makers for Simultaneous Speech Translation
par: Le, Chenyang, et autres
Publié: (2025)
par: Le, Chenyang, et autres
Publié: (2025)
Transducer Consistency Regularization for Speech to Text Applications
par: Tseng, Cindy, et autres
Publié: (2024)
par: Tseng, Cindy, et autres
Publié: (2024)
Simultaneous Speech-to-Speech Translation Without Aligned Data
par: Labiausse, Tom, et autres
Publié: (2026)
par: Labiausse, Tom, et autres
Publié: (2026)
Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator
par: Sun, Guangzhi, et autres
Publié: (2022)
par: Sun, Guangzhi, et autres
Publié: (2022)
Estimating the Uncertainty in Emotion Attributes using Deep Evidential Regression
par: Wu, Wen, et autres
Publié: (2023)
par: Wu, Wen, et autres
Publié: (2023)
Distribution-based Emotion Recognition in Conversation
par: Wu, Wen, et autres
Publié: (2022)
par: Wu, Wen, et autres
Publié: (2022)
NAIST Simultaneous Speech Translation System for IWSLT 2024
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
End-to-End Speech Translation for Low-Resource Languages Using Weakly Labeled Data
par: Pothula, Aishwarya, et autres
Publié: (2025)
par: Pothula, Aishwarya, et autres
Publié: (2025)
SimulTron: On-Device Simultaneous Speech to Speech Translation
par: Agranovich, Alex, et autres
Publié: (2024)
par: Agranovich, Alex, et autres
Publié: (2024)
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
par: Gupta, Mahendra, et autres
Publié: (2024)
par: Gupta, Mahendra, et autres
Publié: (2024)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025)
par: Cheng, Shanbo, et autres
Publié: (2025)
Self-Supervised Learning for Multi-Channel Neural Transducer
par: Kojima, Atsushi
Publié: (2024)
par: Kojima, Atsushi
Publié: (2024)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
par: Wang, Peidong, et autres
Publié: (2025)
par: Wang, Peidong, et autres
Publié: (2025)
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
par: Djanibekov, Amirbek, et autres
Publié: (2026)
par: Djanibekov, Amirbek, et autres
Publié: (2026)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
par: Zhang, Tian-Hao, et autres
Publié: (2023)
par: Zhang, Tian-Hao, et autres
Publié: (2023)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
par: Cheng, Shanbo, et autres
Publié: (2024)
par: Cheng, Shanbo, et autres
Publié: (2024)
Textless Speech-to-Speech Translation With Limited Parallel Data
par: Diwan, Anuj, et autres
Publié: (2023)
par: Diwan, Anuj, et autres
Publié: (2023)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
Recent Advances in End-to-End Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
par: Moritz, Niko, et autres
Publié: (2024)
par: Moritz, Niko, et autres
Publié: (2024)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
par: Kim, Minchan, et autres
Publié: (2024)
par: Kim, Minchan, et autres
Publié: (2024)
REINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech Translation
par: Hirschkind, Nameer, et autres
Publié: (2025)
par: Hirschkind, Nameer, et autres
Publié: (2025)
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation
par: Papi, Sara, et autres
Publié: (2024)
par: Papi, Sara, et autres
Publié: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
par: Ma, Zhengrui, et autres
Publié: (2024)
par: Ma, Zhengrui, et autres
Publié: (2024)
Zero-resource Speech Translation and Recognition with LLMs
par: Mundnich, Karel, et autres
Publié: (2024)
par: Mundnich, Karel, et autres
Publié: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Direct Speech to Speech Translation: A Review
par: Sarim, Mohammad, et autres
Publié: (2025)
par: Sarim, Mohammad, et autres
Publié: (2025)
Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
par: Wang, Peng, et autres
Publié: (2023)
par: Wang, Peng, et autres
Publié: (2023)
Promptformer: Prompted Conformer Transducer for ASR
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
Documents similaires
-
Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition
par: Deng, Keqi, et autres
Publié: (2023) -
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025) -
Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition
par: Deng, Keqi, et autres
Publié: (2024) -
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024) -
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025)