Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Wuwei, Jin, Renren, Zhang, Wen, Luan, Jian, Wang, Bin, Xiong, Deyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
por: Huang, Wuwei, et al.
Publicado: (2025)
por: Huang, Wuwei, et al.
Publicado: (2025)
Representation Purification for End-to-End Speech Translation
por: Zhang, Chengwei, et al.
Publicado: (2024)
por: Zhang, Chengwei, et al.
Publicado: (2024)
Recent Advances in End-to-End Simultaneous Speech Translation
por: Liu, Xiaoqian, et al.
Publicado: (2024)
por: Liu, Xiaoqian, et al.
Publicado: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024)
por: Ma, Zhengrui, et al.
Publicado: (2024)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024)
por: Wang, Peidong, et al.
Publicado: (2024)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
por: Cheng, Shanbo, et al.
Publicado: (2024)
por: Cheng, Shanbo, et al.
Publicado: (2024)
End-to-End Speech-to-Text Translation: A Survey
por: Sethiya, Nivedita, et al.
Publicado: (2023)
por: Sethiya, Nivedita, et al.
Publicado: (2023)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
por: Cheng, Shanbo, et al.
Publicado: (2025)
por: Cheng, Shanbo, et al.
Publicado: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
por: Moslem, Yasmin
Publicado: (2024)
por: Moslem, Yasmin
Publicado: (2024)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
por: Huang, Jiawen, et al.
Publicado: (2024)
por: Huang, Jiawen, et al.
Publicado: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
por: Hirano, Yuta, et al.
Publicado: (2025)
por: Hirano, Yuta, et al.
Publicado: (2025)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
por: Li, Tianpeng, et al.
Publicado: (2025)
por: Li, Tianpeng, et al.
Publicado: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
por: Liu, Heyang, et al.
Publicado: (2024)
por: Liu, Heyang, et al.
Publicado: (2024)
An End-to-End Speech Summarization Using Large Language Model
por: Shang, Hengchao, et al.
Publicado: (2024)
por: Shang, Hengchao, et al.
Publicado: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
por: Labiausse, Tom, et al.
Publicado: (2025)
por: Labiausse, Tom, et al.
Publicado: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
por: Kocour, Martin, et al.
Publicado: (2025)
por: Kocour, Martin, et al.
Publicado: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
por: Polák, Peter, et al.
Publicado: (2023)
por: Polák, Peter, et al.
Publicado: (2023)
Simultaneous Speech-to-Speech Translation Without Aligned Data
por: Labiausse, Tom, et al.
Publicado: (2026)
por: Labiausse, Tom, et al.
Publicado: (2026)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
por: Farhadipour, Aref, et al.
Publicado: (2023)
por: Farhadipour, Aref, et al.
Publicado: (2023)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
por: Agro, Maha Tufail, et al.
Publicado: (2025)
por: Agro, Maha Tufail, et al.
Publicado: (2025)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers
por: Hentschel, Michael, et al.
Publicado: (2024)
por: Hentschel, Michael, et al.
Publicado: (2024)
End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data
por: Cui, Can, et al.
Publicado: (2023)
por: Cui, Can, et al.
Publicado: (2023)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
por: Higuchi, Yosuke, et al.
Publicado: (2023)
por: Higuchi, Yosuke, et al.
Publicado: (2023)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
por: Min, Anna, et al.
Publicado: (2025)
por: Min, Anna, et al.
Publicado: (2025)
NAIST Simultaneous Speech Translation System for IWSLT 2024
por: Ko, Yuka, et al.
Publicado: (2024)
por: Ko, Yuka, et al.
Publicado: (2024)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
por: Deng, Keqi, et al.
Publicado: (2025)
por: Deng, Keqi, et al.
Publicado: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
por: Shao, Hang, et al.
Publicado: (2023)
por: Shao, Hang, et al.
Publicado: (2023)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
por: Huang, Chao-Wei, et al.
Publicado: (2024)
por: Huang, Chao-Wei, et al.
Publicado: (2024)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
por: Huang, Ailin, et al.
Publicado: (2025)
por: Huang, Ailin, et al.
Publicado: (2025)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
por: Wang, Chen, et al.
Publicado: (2025)
por: Wang, Chen, et al.
Publicado: (2025)
Novel Parasitic Dual-Scale Modeling for Efficient and Accurate Multilingual Speech Translation
por: Le, Chenyang, et al.
Publicado: (2025)
por: Le, Chenyang, et al.
Publicado: (2025)
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
por: Liu, Xiaoqian, et al.
Publicado: (2024)
por: Liu, Xiaoqian, et al.
Publicado: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
por: Futami, Hayato, et al.
Publicado: (2025)
por: Futami, Hayato, et al.
Publicado: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
por: Shakeel, Muhammad, et al.
Publicado: (2024)
por: Shakeel, Muhammad, et al.
Publicado: (2024)
Ejemplares similares
-
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
por: Huang, Wuwei, et al.
Publicado: (2025) -
Representation Purification for End-to-End Speech Translation
por: Zhang, Chengwei, et al.
Publicado: (2024) -
Recent Advances in End-to-End Simultaneous Speech Translation
por: Liu, Xiaoqian, et al.
Publicado: (2024) -
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024) -
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024)