SimulTron: On-Device Simultaneous Speech to Speech Translation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Agranovich, Alex, Nachmani, Eliya, Rybakov, Oleg, Ding, Yifan, Jia, Ye, Bar, Nadav, Zen, Heiga, Ramanovich, Michelle Tadmor |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Translatotron 3: Speech to Speech Translation with Monolingual Data
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
Zero-Shot Mono-to-Binaural Speech Synthesis
von: Levkovitch, Alon, et al.
Veröffentlicht: (2024)
von: Levkovitch, Alon, et al.
Veröffentlicht: (2024)
Deep Active Speech Cancellation with Mamba-Masking Network
von: Mishaly, Yehuda, et al.
Veröffentlicht: (2025)
von: Mishaly, Yehuda, et al.
Veröffentlicht: (2025)
ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability
von: Nakata, Wataru, et al.
Veröffentlicht: (2025)
von: Nakata, Wataru, et al.
Veröffentlicht: (2025)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
von: Deng, Keqi, et al.
Veröffentlicht: (2025)
von: Deng, Keqi, et al.
Veröffentlicht: (2025)
Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration
von: Karita, Shigeki, et al.
Veröffentlicht: (2025)
von: Karita, Shigeki, et al.
Veröffentlicht: (2025)
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
von: Saeki, Takaaki, et al.
Veröffentlicht: (2024)
von: Saeki, Takaaki, et al.
Veröffentlicht: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
von: Labiausse, Tom, et al.
Veröffentlicht: (2025)
von: Labiausse, Tom, et al.
Veröffentlicht: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
von: Ding, Shaojin, et al.
Veröffentlicht: (2023)
von: Ding, Shaojin, et al.
Veröffentlicht: (2023)
Simultaneous Speech-to-Speech Translation Without Aligned Data
von: Labiausse, Tom, et al.
Veröffentlicht: (2026)
von: Labiausse, Tom, et al.
Veröffentlicht: (2026)
Active Speech Enhancement: Active Speech Denoising Decliping and Deveraberation
von: Yaish, Ofir, et al.
Veröffentlicht: (2025)
von: Yaish, Ofir, et al.
Veröffentlicht: (2025)
FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks
von: Ma, Min, et al.
Veröffentlicht: (2024)
von: Ma, Min, et al.
Veröffentlicht: (2024)
USM RNN-T model weights binarization
von: Rybakov, Oleg, et al.
Veröffentlicht: (2024)
von: Rybakov, Oleg, et al.
Veröffentlicht: (2024)
SimulMEGA: MoE Routers are Advanced Policy Makers for Simultaneous Speech Translation
von: Le, Chenyang, et al.
Veröffentlicht: (2025)
von: Le, Chenyang, et al.
Veröffentlicht: (2025)
NAIST Simultaneous Speech Translation System for IWSLT 2024
von: Ko, Yuka, et al.
Veröffentlicht: (2024)
von: Ko, Yuka, et al.
Veröffentlicht: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
von: Pan, Yu, et al.
Veröffentlicht: (2025)
von: Pan, Yu, et al.
Veröffentlicht: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2024)
SimulSeamless: FBK at IWSLT 2024 Simultaneous Speech Translation
von: Papi, Sara, et al.
Veröffentlicht: (2024)
von: Papi, Sara, et al.
Veröffentlicht: (2024)
Toward Optimal ANC: Establishing Mutual Information Lower Bound
von: Derrida, François, et al.
Veröffentlicht: (2025)
von: Derrida, François, et al.
Veröffentlicht: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
von: Geng, Haopeng, et al.
Veröffentlicht: (2024)
von: Geng, Haopeng, et al.
Veröffentlicht: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
von: Peng, Yifan, et al.
Veröffentlicht: (2024)
von: Peng, Yifan, et al.
Veröffentlicht: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
von: Peng, Yifan, et al.
Veröffentlicht: (2024)
von: Peng, Yifan, et al.
Veröffentlicht: (2024)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
von: Ojha, Shuubham, et al.
Veröffentlicht: (2025)
von: Ojha, Shuubham, et al.
Veröffentlicht: (2025)
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
BENYO-S2ST-Corpus-1: A Bilingual English-to-Yoruba Direct Speech-to-Speech Translation Corpus
von: Adetiba, Emmanuel, et al.
Veröffentlicht: (2025)
von: Adetiba, Emmanuel, et al.
Veröffentlicht: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
von: Liao, Shijia, et al.
Veröffentlicht: (2024)
von: Liao, Shijia, et al.
Veröffentlicht: (2024)
Direct Speech to Speech Translation: A Review
von: Sarim, Mohammad, et al.
Veröffentlicht: (2025)
von: Sarim, Mohammad, et al.
Veröffentlicht: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
von: Futami, Hayato, et al.
Veröffentlicht: (2025)
von: Futami, Hayato, et al.
Veröffentlicht: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
von: Wang, Hui, et al.
Veröffentlicht: (2025)
von: Wang, Hui, et al.
Veröffentlicht: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
von: Ma, Ding, et al.
Veröffentlicht: (2026)
von: Ma, Ding, et al.
Veröffentlicht: (2026)
Leveraging Multimodal Methods and Spontaneous Speech for Alzheimer's Disease Identification
von: Gao, Yifan, et al.
Veröffentlicht: (2024)
von: Gao, Yifan, et al.
Veröffentlicht: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
von: Hirschkind, Nameer, et al.
Veröffentlicht: (2024)
von: Hirschkind, Nameer, et al.
Veröffentlicht: (2024)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
von: Zhou, Rui, et al.
Veröffentlicht: (2024)
von: Zhou, Rui, et al.
Veröffentlicht: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
von: Ma, Zhengrui, et al.
Veröffentlicht: (2024)
von: Ma, Zhengrui, et al.
Veröffentlicht: (2024)
Recent Advances in End-to-End Simultaneous Speech Translation
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqian, et al.
Veröffentlicht: (2024)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
von: Cheng, Shanbo, et al.
Veröffentlicht: (2024)
von: Cheng, Shanbo, et al.
Veröffentlicht: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
von: Gupta, Mahendra, et al.
Veröffentlicht: (2024)
von: Gupta, Mahendra, et al.
Veröffentlicht: (2024)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
von: Akarsh, Sai, et al.
Veröffentlicht: (2024)
von: Akarsh, Sai, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Translatotron 3: Speech to Speech Translation with Monolingual Data
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023) -
Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023) -
Zero-Shot Mono-to-Binaural Speech Synthesis
von: Levkovitch, Alon, et al.
Veröffentlicht: (2024) -
Deep Active Speech Cancellation with Mamba-Masking Network
von: Mishaly, Yehuda, et al.
Veröffentlicht: (2025) -
ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability
von: Nakata, Wataru, et al.
Veröffentlicht: (2025)