TranSentence: Speech-to-speech Translation via Language-agnostic Sentence-level Speech Encoding without Language-parallel Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Seung-Bin, Lee, Sang-Hoon, Lee, Seong-Whan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
par: Cho, Deok-Hyeon, et autres
Publié: (2024)
JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical Representation with Auxiliary Classification
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
par: Lee, Seo-Hyun, et autres
Publié: (2023)
par: Lee, Seo-Hyun, et autres
Publié: (2023)
Development of the Listening in Spatialized Noise-Sentences (LiSN-S) Test in Brazilian Portuguese: Presentation Software, Speech Stimuli, and Sentence Equivalence
par: Masiero, Bruno S., et autres
Publié: (2024)
par: Masiero, Bruno S., et autres
Publié: (2024)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
par: Oh, Hyung-Seok, et autres
Publié: (2024)
par: Oh, Hyung-Seok, et autres
Publié: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
par: Kong, Jungil, et autres
Publié: (2023)
par: Kong, Jungil, et autres
Publié: (2023)
Towards Dynamic Neural Communication and Speech Neuroprosthesis Based on Viseme Decoding
par: Park, Ji-Ha, et autres
Publié: (2025)
par: Park, Ji-Ha, et autres
Publié: (2025)
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
par: Saeki, Takaaki, et autres
Publié: (2024)
par: Saeki, Takaaki, et autres
Publié: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
par: Jung, Yeonjoon, et autres
Publié: (2024)
par: Jung, Yeonjoon, et autres
Publié: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
par: Lee, Sang-Hoon, et autres
Publié: (2024)
par: Lee, Sang-Hoon, et autres
Publié: (2024)
Adversarial speech for voice privacy protection from Personalized Speech generation
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
par: Yun, Jun-Hak, et autres
Publié: (2025)
par: Yun, Jun-Hak, et autres
Publié: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
par: Kim, Jaehyeon, et autres
Publié: (2024)
par: Kim, Jaehyeon, et autres
Publié: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
par: Chung, Soo-Whan, et autres
Publié: (2025)
par: Chung, Soo-Whan, et autres
Publié: (2025)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform Generation
par: Lee, Sang-Hoon, et autres
Publié: (2024)
par: Lee, Sang-Hoon, et autres
Publié: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
par: Messica, Shoval, et autres
Publié: (2024)
par: Messica, Shoval, et autres
Publié: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
Simultaneous Speech-to-Speech Translation Without Aligned Data
par: Labiausse, Tom, et autres
Publié: (2026)
par: Labiausse, Tom, et autres
Publié: (2026)
EMALG: An Enhanced Mandarin Lombard Grid Corpus with Meaningful Sentences
par: Li, Baifeng, et autres
Publié: (2023)
par: Li, Baifeng, et autres
Publié: (2023)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
par: Wang, Hsuan-Fu, et autres
Publié: (2024)
par: Wang, Hsuan-Fu, et autres
Publié: (2024)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
par: Han, Seungu, et autres
Publié: (2025)
par: Han, Seungu, et autres
Publié: (2025)
Instance-Specific Test-Time Training for Speech Editing in the Wild
par: Kim, Taewoo, et autres
Publié: (2025)
par: Kim, Taewoo, et autres
Publié: (2025)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
par: Chary, Podakanti Satyajith
Publié: (2024)
par: Chary, Podakanti Satyajith
Publié: (2024)
Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection
par: Kim, Taewoo, et autres
Publié: (2025)
par: Kim, Taewoo, et autres
Publié: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Documents similaires
-
EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2024) -
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023) -
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025) -
EmoSphere++: Emotion-Controllable Zero-Shot Text-to-Speech via Emotion-Adaptive Spherical Vector
par: Cho, Deok-Hyeon, et autres
Publié: (2024) -
JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis
par: Cha, Jun-Hyeok, et autres
Publié: (2025)