Direct Speech to Speech Translation: A Review
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sarim, Mohammad, Shakeel, Saim, Javed, Laeeba, Jamaluddin, Nadeem, Mohammad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
par: Gupta, Mahendra, et autres
Publié: (2024)
par: Gupta, Mahendra, et autres
Publié: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025)
par: Labiausse, Tom, et autres
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Simultaneous Speech-to-Speech Translation Without Aligned Data
par: Labiausse, Tom, et autres
Publié: (2026)
par: Labiausse, Tom, et autres
Publié: (2026)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025)
par: Deng, Keqi, et autres
Publié: (2025)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
par: Akarsh, Sai, et autres
Publié: (2024)
par: Akarsh, Sai, et autres
Publié: (2024)
Advancing Speech Translation: A Corpus of Mandarin-English Conversational Telephone Speech
par: Wotherspoon, Shannon, et autres
Publié: (2024)
par: Wotherspoon, Shannon, et autres
Publié: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
Compact Speech Translation Models via Discrete Speech Units Pretraining
par: Lam, Tsz Kin, et autres
Publié: (2024)
par: Lam, Tsz Kin, et autres
Publié: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Spatial Speech Translation: Translating Across Space With Binaural Hearables
par: Chen, Tuochao, et autres
Publié: (2025)
par: Chen, Tuochao, et autres
Publié: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)
par: Wang, Jianjin, et autres
Publié: (2025)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
par: Hwang, Min-Jae, et autres
Publié: (2024)
par: Hwang, Min-Jae, et autres
Publié: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
NAIST Simultaneous Speech Translation System for IWSLT 2024
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
Accent-Invariant Automatic Speech Recognition via Saliency-Driven Spectrogram Masking
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
Efficient Speech Translation through Model Compression and Knowledge Distillation
par: Moslem, Yasmin
Publié: (2025)
par: Moslem, Yasmin
Publié: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning
par: Peng, Yifan, et autres
Publié: (2025)
par: Peng, Yifan, et autres
Publié: (2025)
ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech
par: Kashyap, Gautam Siddharth, et autres
Publié: (2025)
par: Kashyap, Gautam Siddharth, et autres
Publié: (2025)
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
par: Duret, Jarod, et autres
Publié: (2024)
par: Duret, Jarod, et autres
Publié: (2024)
TranSentence: Speech-to-speech Translation via Language-agnostic Sentence-level Speech Encoding without Language-parallel Data
par: Kim, Seung-Bin, et autres
Publié: (2024)
par: Kim, Seung-Bin, et autres
Publié: (2024)
Bemba Speech Translation: Exploring a Low-Resource African Language
par: Farouq, Muhammad Hazim Al, et autres
Publié: (2025)
par: Farouq, Muhammad Hazim Al, et autres
Publié: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
Documents similaires
-
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024) -
Direct Speech-to-Speech Neural Machine Translation: A Survey
par: Gupta, Mahendra, et autres
Publié: (2024) -
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025) -
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025) -
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)