Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Jinzheng, Moritz, Niko, Lakomkin, Egor, Xie, Ruiming, Xiu, Zhiping, Zmolikova, Katerina, Ahmed, Zeeshan, Gaur, Yashesh, Le, Duc, Fuegen, Christian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
di: Moritz, Niko, et al.
Pubblicazione: (2024)
di: Moritz, Niko, et al.
Pubblicazione: (2024)
Conversational Speech Naturalness Predictor
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition
di: Lin, Ju, et al.
Pubblicazione: (2024)
di: Lin, Ju, et al.
Pubblicazione: (2024)
Textless Speech-to-Speech Translation With Limited Parallel Data
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
di: Seide, Frank, et al.
Pubblicazione: (2024)
di: Seide, Frank, et al.
Pubblicazione: (2024)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Efficient Streaming LLM for Speech Recognition
di: Jia, Junteng, et al.
Pubblicazione: (2024)
di: Jia, Junteng, et al.
Pubblicazione: (2024)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
M-BEST-RQ: A Multi-Channel Speech Foundation Model for Smart Glasses
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2023)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Latent Speech-Text Transformer
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
Large Model Empowered Streaming Speech Semantic Communications
di: Weng, Zhenzi, et al.
Pubblicazione: (2025)
di: Weng, Zhenzi, et al.
Pubblicazione: (2025)
Streaming Speech-to-Text Translation with a SpeechLLM
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
di: Pan, Jing, et al.
Pubblicazione: (2023)
di: Pan, Jing, et al.
Pubblicazione: (2023)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Speech Loudness in Broadcasting and Streaming
di: Torcoli, Matteo, et al.
Pubblicazione: (2024)
di: Torcoli, Matteo, et al.
Pubblicazione: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Can Speech LLMs Think while Listening?
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Streaming Speech-to-Confusion Network Speech Recognition
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
NAST: Noise Aware Speech Tokenization for Speech Language Models
di: Messica, Shoval, et al.
Pubblicazione: (2024)
di: Messica, Shoval, et al.
Pubblicazione: (2024)
Chunkwise Aligners for Streaming Speech Recognition
di: Teo, Wen Shen, et al.
Pubblicazione: (2026)
di: Teo, Wen Shen, et al.
Pubblicazione: (2026)
Continuous Speech Tokenizer in Text To Speech
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
di: Park, Joonyong, et al.
Pubblicazione: (2025)
di: Park, Joonyong, et al.
Pubblicazione: (2025)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
di: An, Yanjie, et al.
Pubblicazione: (2026)
di: An, Yanjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
di: Moritz, Niko, et al.
Pubblicazione: (2024) -
Conversational Speech Naturalness Predictor
di: Xu, Anfeng, et al.
Pubblicazione: (2026) -
AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition
di: Lin, Ju, et al.
Pubblicazione: (2024) -
Textless Speech-to-Speech Translation With Limited Parallel Data
di: Diwan, Anuj, et al.
Pubblicazione: (2023) -
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)