Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Menta, Venkata Pushpak Teja |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
par: Menta, Venkata Pushpak Teja
Publié: (2026)
par: Menta, Venkata Pushpak Teja
Publié: (2026)
The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail
par: Menta, Venkata Pushpak Teja
Publié: (2026)
par: Menta, Venkata Pushpak Teja
Publié: (2026)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
par: Arora, Akshit, et autres
Publié: (2024)
par: Arora, Akshit, et autres
Publié: (2024)
Voice Impression Control in Zero-Shot TTS
par: Fujita, Kenichi, et autres
Publié: (2025)
par: Fujita, Kenichi, et autres
Publié: (2025)
Zero-shot Cross-lingual Voice Transfer for TTS
par: Biadsy, Fadi, et autres
Publié: (2024)
par: Biadsy, Fadi, et autres
Publié: (2024)
PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech
par: Menta, Venkata Pushpak Teja
Publié: (2026)
par: Menta, Venkata Pushpak Teja
Publié: (2026)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
par: Zhou, Fangru, et autres
Publié: (2025)
par: Zhou, Fangru, et autres
Publié: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
par: Peng, Puyuan, et autres
Publié: (2025)
par: Peng, Puyuan, et autres
Publié: (2025)
Abusive Speech Detection in Indic Languages Using Acoustic Features
par: Spiesberger, Anika A., et autres
Publié: (2024)
par: Spiesberger, Anika A., et autres
Publié: (2024)
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
par: Tripathi, Kumud, et autres
Publié: (2025)
par: Tripathi, Kumud, et autres
Publié: (2025)
TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Compact Neural TTS Voices for Accessibility
par: Jain, Kunal, et autres
Publié: (2025)
par: Jain, Kunal, et autres
Publié: (2025)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
par: Meng, Ming, et autres
Publié: (2025)
par: Meng, Ming, et autres
Publié: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
A Practical Survey on Emerging Threats from AI-driven Voice Attacks: How Vulnerable are Commercial Voice Control Systems?
par: Wang, Yuanda, et autres
Publié: (2023)
par: Wang, Yuanda, et autres
Publié: (2023)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
par: Li, Junjie, et autres
Publié: (2023)
par: Li, Junjie, et autres
Publié: (2023)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
par: Zheng, Zhisheng, et autres
Publié: (2025)
par: Zheng, Zhisheng, et autres
Publié: (2025)
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2026)
par: Tomashenko, Natalia, et autres
Publié: (2026)
WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables
par: Lin, Zhaojiang, et autres
Publié: (2025)
par: Lin, Zhaojiang, et autres
Publié: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2026)
par: Wang, Zhichao, et autres
Publié: (2026)
Voice Adaptation for Swiss German
par: Stucki, Samuel, et autres
Publié: (2025)
par: Stucki, Samuel, et autres
Publié: (2025)
Marco-Voice Technical Report
par: Tian, Fengping, et autres
Publié: (2025)
par: Tian, Fengping, et autres
Publié: (2025)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
par: Ohmura, Junki, et autres
Publié: (2025)
par: Ohmura, Junki, et autres
Publié: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
par: Choi, Ha-Yeong, et autres
Publié: (2025)
par: Choi, Ha-Yeong, et autres
Publié: (2025)
Custom Data Augmentation for low resource ASR using Bark and Retrieval-Based Voice Conversion
par: Kamble, Anand, et autres
Publié: (2023)
par: Kamble, Anand, et autres
Publié: (2023)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
LearnerVoice: A Dataset of Non-Native English Learners' Spontaneous Speech
par: Kim, Haechan, et autres
Publié: (2024)
par: Kim, Haechan, et autres
Publié: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
VoiceBench: Benchmarking LLM-Based Voice Assistants
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
par: Chen, Ziqi, et autres
Publié: (2025)
par: Chen, Ziqi, et autres
Publié: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
par: Kameoka, Hirokazu, et autres
Publié: (2020)
par: Kameoka, Hirokazu, et autres
Publié: (2020)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Alethia: A Foundational Encoder for Voice Deepfakes
par: Zhu, Yi, et autres
Publié: (2026)
par: Zhu, Yi, et autres
Publié: (2026)
Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use
par: Parcollet, Titouan, et autres
Publié: (2025)
par: Parcollet, Titouan, et autres
Publié: (2025)
Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba
par: Mohammad, Baher, et autres
Publié: (2025)
par: Mohammad, Baher, et autres
Publié: (2025)
Documents similaires
-
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
par: Menta, Venkata Pushpak Teja
Publié: (2026) -
The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail
par: Menta, Venkata Pushpak Teja
Publié: (2026) -
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
par: Arora, Akshit, et autres
Publié: (2024) -
Voice Impression Control in Zero-Shot TTS
par: Fujita, Kenichi, et autres
Publié: (2025) -
Zero-shot Cross-lingual Voice Transfer for TTS
par: Biadsy, Fadi, et autres
Publié: (2024)