CTC-based Non-autoregressive Textless Speech-to-Speech Translation
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Qingkai, Ma, Zhengrui, Zhou, Yan, Zhang, Min, Feng, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
Everyday Speech in the Indian Subcontinent
di: P, Utkarsh
Pubblicazione: (2024)
di: P, Utkarsh
Pubblicazione: (2024)
Measuring the Accuracy of Automatic Speech Recognition Solutions
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
di: Robertson, Sean, et al.
Pubblicazione: (2023)
di: Robertson, Sean, et al.
Pubblicazione: (2023)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
di: Sharma, Manali, et al.
Pubblicazione: (2026)
di: Sharma, Manali, et al.
Pubblicazione: (2026)
Syllable based DNN-HMM Cantonese Speech to Text System
di: Wong, Timothy, et al.
Pubblicazione: (2024)
di: Wong, Timothy, et al.
Pubblicazione: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
di: Zhang, Haoyang, et al.
Pubblicazione: (2025)
di: Zhang, Haoyang, et al.
Pubblicazione: (2025)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
Framework for Curating Speech Datasets and Evaluating ASR Systems: A Case Study for Polish
di: Junczyk, Michał
Pubblicazione: (2024)
di: Junczyk, Michał
Pubblicazione: (2024)
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
di: Dua, Karan, et al.
Pubblicazione: (2025)
di: Dua, Karan, et al.
Pubblicazione: (2025)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
di: Costa-jussà, Marta R., et al.
Pubblicazione: (2024)
di: Costa-jussà, Marta R., et al.
Pubblicazione: (2024)
MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr
di: Yang, Xuwen
Pubblicazione: (2025)
di: Yang, Xuwen
Pubblicazione: (2025)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
di: Halpern, Bence Mark, et al.
Pubblicazione: (2024)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
di: Donepudi, Dharma Teja
Pubblicazione: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
di: Wang, Shaowen, et al.
Pubblicazione: (2025)
di: Wang, Shaowen, et al.
Pubblicazione: (2025)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
di: Li, Pengcheng, et al.
Pubblicazione: (2024)
di: Li, Pengcheng, et al.
Pubblicazione: (2024)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
di: Hwang, Min-Jae, et al.
Pubblicazione: (2024)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
di: Fang, Qingkai, et al.
Pubblicazione: (2025)
di: Fang, Qingkai, et al.
Pubblicazione: (2025)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
Unimodal Aggregation for CTC-based Speech Recognition
di: Fang, Ying, et al.
Pubblicazione: (2023)
di: Fang, Ying, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
di: Fang, Qingkai, et al.
Pubblicazione: (2024) -
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
di: Fang, Qingkai, et al.
Pubblicazione: (2024) -
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024) -
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024) -
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)