Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mhaskar, Shivam Ratnakant, Shah, Nirmesh J., Zaki, Mohammadi, Gudmalwar, Ashishkumar P., Wasnik, Pankaj, Shah, Rajiv Ratn |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?
di: Dasare, Ashwini, et al.
Pubblicazione: (2026)
di: Dasare, Ashwini, et al.
Pubblicazione: (2026)
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
di: Kumar, Lokesh, et al.
Pubblicazione: (2026)
di: Kumar, Lokesh, et al.
Pubblicazione: (2026)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
Enhancing Whisper's Accuracy and Speed for Indian Languages through Prompt-Tuning and Tokenization
di: Tripathi, Kumud, et al.
Pubblicazione: (2024)
di: Tripathi, Kumud, et al.
Pubblicazione: (2024)
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
di: Tripathi, Kumud, et al.
Pubblicazione: (2025)
Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-resource Speech Recognition
di: Menon, Aditya Srinivas, et al.
Pubblicazione: (2026)
di: Menon, Aditya Srinivas, et al.
Pubblicazione: (2026)
Towards a Quantitative Analysis of Coarticulation with a Phoneme-to-Articulatory Model
di: Fan, Chaofei, et al.
Pubblicazione: (2024)
di: Fan, Chaofei, et al.
Pubblicazione: (2024)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
di: Li, Ziwei, et al.
Pubblicazione: (2026)
di: Li, Ziwei, et al.
Pubblicazione: (2026)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
di: Koriyama, Tomoki
Pubblicazione: (2025)
di: Koriyama, Tomoki
Pubblicazione: (2025)
A Phoneme-Scale Assessment of Multichannel Speech Enhancement Algorithms
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2024)
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2025)
di: Salvi, Davide, et al.
Pubblicazione: (2025)
Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model
di: Yang, Dong, et al.
Pubblicazione: (2025)
di: Yang, Dong, et al.
Pubblicazione: (2025)
CC-G2PnP: Streaming Grapheme-to-Phoneme and prosody with Conformer-CTC for unsegmented languages
di: Shirahata, Yuma, et al.
Pubblicazione: (2026)
di: Shirahata, Yuma, et al.
Pubblicazione: (2026)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
Evaluating Multichannel Speech Enhancement Algorithms at the Phoneme Scale Across Genders
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2025)
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2025)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
di: Jinghua, Liang, et al.
Pubblicazione: (2026)
di: Jinghua, Liang, et al.
Pubblicazione: (2026)
VAE-based Phoneme Alignment Using Gradient Annealing and SSL Acoustic Features
di: Koriyama, Tomoki
Pubblicazione: (2024)
di: Koriyama, Tomoki
Pubblicazione: (2024)
Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment
di: Kewei, Li, et al.
Pubblicazione: (2024)
di: Kewei, Li, et al.
Pubblicazione: (2024)
Phoneme-based speech recognition driven by large language models and sampling marginalization
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
di: Ryu, Yerin, et al.
Pubblicazione: (2025)
di: Ryu, Yerin, et al.
Pubblicazione: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
di: Ren, Bo, et al.
Pubblicazione: (2026)
di: Ren, Bo, et al.
Pubblicazione: (2026)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
ROAR: Reinforcing Original to Augmented Data Ratio Dynamics for Wav2Vec2.0 Based ASR
di: Singh, Vishwanath Pratap, et al.
Pubblicazione: (2024)
di: Singh, Vishwanath Pratap, et al.
Pubblicazione: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
WiRD-Gest: Gesture Recognition In The Real World Using Range-Doppler Wi-Fi Sensing on COTS Hardware
di: Sanson, Jessica, et al.
Pubblicazione: (2026)
di: Sanson, Jessica, et al.
Pubblicazione: (2026)
Noise-to-mask Ratio Loss for Deep Neural Network based Audio Watermarking
di: Moritz, Martin, et al.
Pubblicazione: (2024)
di: Moritz, Martin, et al.
Pubblicazione: (2024)
Phoneme-Based Proactive Anti-Eavesdropping with Controlled Recording Privilege
di: Huang, Peng, et al.
Pubblicazione: (2024)
di: Huang, Peng, et al.
Pubblicazione: (2024)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
di: Pritzen, Julia, et al.
Pubblicazione: (2021)
di: Pritzen, Julia, et al.
Pubblicazione: (2021)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
di: Gupta, Shubham, et al.
Pubblicazione: (2024)
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
di: Kolani, Yakov, et al.
Pubblicazione: (2025)
di: Kolani, Yakov, et al.
Pubblicazione: (2025)
Phoneme Hallucinator: One-shot Voice Conversion via Set Expansion
di: Shan, Siyuan, et al.
Pubblicazione: (2023)
di: Shan, Siyuan, et al.
Pubblicazione: (2023)
Text-Driven Voice Conversion via Latent State-Space Modeling
di: Li, Wen, et al.
Pubblicazione: (2025)
di: Li, Wen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024) -
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024) -
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024) -
Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?
di: Dasare, Ashwini, et al.
Pubblicazione: (2026) -
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
di: Kumar, Lokesh, et al.
Pubblicazione: (2026)