In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Jiawei, Yang, Zhihan, Zhou, Yixuan, Wu, Zhiyong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The THU-HCSI Multi-Speaker Multi-Lingual Few-Shot Voice Cloning System for LIMMITS'24 Challenge
par: Zhou, Yixuan, et autres
Publié: (2024)
par: Zhou, Yixuan, et autres
Publié: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
par: Lei, Shun, et autres
Publié: (2023)
par: Lei, Shun, et autres
Publié: (2023)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
par: Niu, Rui, et autres
Publié: (2025)
par: Niu, Rui, et autres
Publié: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
par: Zhou, Yixuan, et autres
Publié: (2024)
par: Zhou, Yixuan, et autres
Publié: (2024)
On Speaker Attribution with SURT
par: Raj, Desh, et autres
Publié: (2024)
par: Raj, Desh, et autres
Publié: (2024)
A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
From Independence to Interaction: Speaker-Aware Simulation of Multi-Speaker Conversational Timing
par: Gedeon, Máté, et autres
Publié: (2025)
par: Gedeon, Máté, et autres
Publié: (2025)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025)
par: Dai, Wang, et autres
Publié: (2025)
GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
par: Yang, Jinhyeok, et autres
Publié: (2024)
par: Yang, Jinhyeok, et autres
Publié: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
par: Yu, Fan, et autres
Publié: (2025)
par: Yu, Fan, et autres
Publié: (2025)
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
par: Ye, Runchuan, et autres
Publié: (2025)
par: Ye, Runchuan, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
par: wu, Weihao, et autres
Publié: (2025)
par: wu, Weihao, et autres
Publié: (2025)
Speaker Anonymisation for Speech-based Suicide Risk Detection
par: Cui, Ziyun, et autres
Publié: (2025)
par: Cui, Ziyun, et autres
Publié: (2025)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
par: Avdeeva, Anastasia, et autres
Publié: (2024)
par: Avdeeva, Anastasia, et autres
Publié: (2024)
Multi-Label Training for Text-Independent Speaker Identification
par: Xue, Yuqi
Publié: (2022)
par: Xue, Yuqi
Publié: (2022)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
par: Chen, Zhiyong, et autres
Publié: (2024)
par: Chen, Zhiyong, et autres
Publié: (2024)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
par: Hou, Yixuan, et autres
Publié: (2025)
par: Hou, Yixuan, et autres
Publié: (2025)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
par: Zhang, Hanlin, et autres
Publié: (2026)
par: Zhang, Hanlin, et autres
Publié: (2026)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2023)
par: Wang, Zhichao, et autres
Publié: (2023)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Erasing Your Voice Before It's Heard: Training-free Speaker Unlearning for Zero-shot Text-to-Speech
par: Lee, Myungjin, et autres
Publié: (2026)
par: Lee, Myungjin, et autres
Publié: (2026)
Generating Novel and Realistic Speakers for Voice Conversion
par: Chen, Meiying Melissa, et autres
Publié: (2025)
par: Chen, Meiying Melissa, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
Documents similaires
-
The THU-HCSI Multi-Speaker Multi-Lingual Few-Shot Voice Cloning System for LIMMITS'24 Challenge
par: Zhou, Yixuan, et autres
Publié: (2024) -
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024) -
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024) -
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
par: Lei, Shun, et autres
Publié: (2023) -
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)