LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Xi, Zhang, Songyang, Bai, Qibing, Chen, Kai, Nakamura, Satoshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SASST: Leveraging Syntax-Aware Chunking and LLMs for Simultaneous Speech Translation
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
DPO-Tuned Large Language Models for Segmentation in Simultaneous Speech Translation
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
StressTransfer: Stress-Aware Speech-to-Speech Translation with Emphasis Preservation
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
TransLLaMa: LLM-based Simultaneous Translation System
di: Koshkin, Roman, et al.
Pubblicazione: (2024)
di: Koshkin, Roman, et al.
Pubblicazione: (2024)
HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track
di: Wei, Xuchen, et al.
Pubblicazione: (2025)
di: Wei, Xuchen, et al.
Pubblicazione: (2025)
Gradient-Informed Training for Low-Resource Multilingual Speech Translation
di: Sun, Ruiyan, et al.
Pubblicazione: (2026)
di: Sun, Ruiyan, et al.
Pubblicazione: (2026)
End-to-end Automatic Speech Recognition and Speech Translation: Integration of Speech Foundational Models and LLMs
di: Luu, Nam, et al.
Pubblicazione: (2025)
di: Luu, Nam, et al.
Pubblicazione: (2025)
MELD-ST: An Emotion-aware Speech Translation Dataset
di: Chen, Sirou, et al.
Pubblicazione: (2024)
di: Chen, Sirou, et al.
Pubblicazione: (2024)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
Representation Purification for End-to-End Speech Translation
di: Zhang, Chengwei, et al.
Pubblicazione: (2024)
di: Zhang, Chengwei, et al.
Pubblicazione: (2024)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
di: Huang, Wuwei, et al.
Pubblicazione: (2025)
di: Huang, Wuwei, et al.
Pubblicazione: (2025)
Exploring the Translation Mechanism of Large Language Models
di: Zhang, Hongbin, et al.
Pubblicazione: (2025)
di: Zhang, Hongbin, et al.
Pubblicazione: (2025)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
di: Sun, Yirong, et al.
Pubblicazione: (2025)
di: Sun, Yirong, et al.
Pubblicazione: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Model
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
Redefining Machine Simultaneous Interpretation: From Incremental Translation to Human-Like Strategies
di: Zhang, Qianen, et al.
Pubblicazione: (2025)
di: Zhang, Qianen, et al.
Pubblicazione: (2025)
Coding Triangle: How Does Large Language Model Understand Code?
di: Zhang, Taolin, et al.
Pubblicazione: (2025)
di: Zhang, Taolin, et al.
Pubblicazione: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
di: Moslem, Yasmin
Pubblicazione: (2024)
di: Moslem, Yasmin
Pubblicazione: (2024)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2024)
di: Wang, Peidong, et al.
Pubblicazione: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
Enhancing Speech-to-Speech Dialogue Modeling with End-to-End Retrieval-Augmented Generation
di: Feng, Pengchao, et al.
Pubblicazione: (2025)
di: Feng, Pengchao, et al.
Pubblicazione: (2025)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Speech Translation Refinement using Large Language Models
di: Dou, Huaixia, et al.
Pubblicazione: (2025)
di: Dou, Huaixia, et al.
Pubblicazione: (2025)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
di: Cheng, Shanbo, et al.
Pubblicazione: (2024)
di: Cheng, Shanbo, et al.
Pubblicazione: (2024)
End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Redefining Machine Simultaneous Interpretation: From Incremental Translation to Human-Like Strategies
di: Zhang, Qianen, et al.
Pubblicazione: (2026)
di: Zhang, Qianen, et al.
Pubblicazione: (2026)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
A Case Study on Filtering for End-to-End Speech Translation
di: Alam, Md Mahfuz Ibn, et al.
Pubblicazione: (2024)
di: Alam, Md Mahfuz Ibn, et al.
Pubblicazione: (2024)
Pushing the Limits of Zero-shot End-to-End Speech Translation
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?
di: Gaido, Marco, et al.
Pubblicazione: (2024)
di: Gaido, Marco, et al.
Pubblicazione: (2024)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
di: Xia, Han, et al.
Pubblicazione: (2024)
di: Xia, Han, et al.
Pubblicazione: (2024)
MaLLaM -- Malaysia Large Language Model
di: Zolkepli, Husein, et al.
Pubblicazione: (2024)
di: Zolkepli, Husein, et al.
Pubblicazione: (2024)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
CMU's IWSLT 2025 Simultaneous Speech Translation System
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
End-to-end Speech Recognition with similar length speech and text
di: Fan, Peng, et al.
Pubblicazione: (2025)
di: Fan, Peng, et al.
Pubblicazione: (2025)
Seed LiveInterpret 2.0: End-to-end Simultaneous Speech-to-speech Translation with Your Voice
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
Me LLaMA: Foundation Large Language Models for Medical Applications
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SASST: Leveraging Syntax-Aware Chunking and LLMs for Simultaneous Speech Translation
di: Yang, Zeyu, et al.
Pubblicazione: (2025) -
DPO-Tuned Large Language Models for Segmentation in Simultaneous Speech Translation
di: Yang, Zeyu, et al.
Pubblicazione: (2025) -
StressTransfer: Stress-Aware Speech-to-Speech Translation with Emphasis Preservation
di: Chen, Xi, et al.
Pubblicazione: (2025) -
TransLLaMa: LLM-based Simultaneous Translation System
di: Koshkin, Roman, et al.
Pubblicazione: (2024) -
HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track
di: Wei, Xuchen, et al.
Pubblicazione: (2025)