Recent Advances in End-to-End Simultaneous Speech Translation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xiaoqian, Hu, Guoqiang, Du, Yangfan, He, Erfeng, Luo, Yingfeng, Xu, Chen, Xiao, Tong, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025)
par: Cheng, Shanbo, et autres
Publié: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)
par: Wang, Jianjin, et autres
Publié: (2025)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
par: Ma, Zhengrui, et autres
Publié: (2024)
par: Ma, Zhengrui, et autres
Publié: (2024)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
par: Cheng, Shanbo, et autres
Publié: (2024)
par: Cheng, Shanbo, et autres
Publié: (2024)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
par: Wang, Peidong, et autres
Publié: (2024)
par: Wang, Peidong, et autres
Publié: (2024)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025)
par: Labiausse, Tom, et autres
Publié: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
par: Polák, Peter, et autres
Publié: (2023)
par: Polák, Peter, et autres
Publié: (2023)
Simultaneous Speech-to-Speech Translation Without Aligned Data
par: Labiausse, Tom, et autres
Publié: (2026)
par: Labiausse, Tom, et autres
Publié: (2026)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
par: Farhadipour, Aref, et autres
Publié: (2023)
par: Farhadipour, Aref, et autres
Publié: (2023)
SimulMEGA: MoE Routers are Advanced Policy Makers for Simultaneous Speech Translation
par: Le, Chenyang, et autres
Publié: (2025)
par: Le, Chenyang, et autres
Publié: (2025)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
par: Agro, Maha Tufail, et autres
Publié: (2025)
par: Agro, Maha Tufail, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
NAIST Simultaneous Speech Translation System for IWSLT 2024
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025)
par: Deng, Keqi, et autres
Publié: (2025)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
par: Zeng, Aohan, et autres
Publié: (2024)
par: Zeng, Aohan, et autres
Publié: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
Recent Advances in Speech Language Models: A Survey
par: Cui, Wenqian, et autres
Publié: (2024)
par: Cui, Wenqian, et autres
Publié: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
par: Zink, Oswald, et autres
Publié: (2024)
par: Zink, Oswald, et autres
Publié: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Documents similaires
-
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024) -
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025) -
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024) -
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
par: Cheng, Shanbo, et autres
Publié: (2025) -
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)