UniTalker: Conversational Speech-Visual Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Yifan, Liu, Rui, Ren, Yi, Yin, Xiang, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
par: Hu, Yifan, et autres
Publié: (2025)
par: Hu, Yifan, et autres
Publié: (2025)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
RefXVC: Cross-Lingual Voice Conversion with Enhanced Reference Leveraging
par: Zhang, Mingyang, et autres
Publié: (2024)
par: Zhang, Mingyang, et autres
Publié: (2024)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)
par: Guo, Zixin, et autres
Publié: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
par: Qi, Tianhua, et autres
Publié: (2026)
par: Qi, Tianhua, et autres
Publié: (2026)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
Exploring Length Generalization For Transformer-based Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2025)
par: Zhang, Qiquan, et autres
Publié: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2024)
par: Zhang, Qiquan, et autres
Publié: (2024)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
par: Xie, Jiamin, et autres
Publié: (2025)
par: Xie, Jiamin, et autres
Publié: (2025)
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
par: Li, Ruiqi, et autres
Publié: (2026)
par: Li, Ruiqi, et autres
Publié: (2026)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
par: Zhang, Qiquan, et autres
Publié: (2025)
par: Zhang, Qiquan, et autres
Publié: (2025)
Direct Preference Optimization for Speech Autoregressive Diffusion Models
par: Liu, Zhijun, et autres
Publié: (2025)
par: Liu, Zhijun, et autres
Publié: (2025)
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zhang, Jie, et autres
Publié: (2023)
par: Zhang, Jie, et autres
Publié: (2023)
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
par: Jia, Zhenqi, et autres
Publié: (2024)
par: Jia, Zhenqi, et autres
Publié: (2024)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
par: Lin, Jingru, et autres
Publié: (2024)
par: Lin, Jingru, et autres
Publié: (2024)
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
par: Hsieh, Tsun-An, et autres
Publié: (2025)
par: Hsieh, Tsun-An, et autres
Publié: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
par: Jiang, Ziyue, et autres
Publié: (2023)
par: Jiang, Ziyue, et autres
Publié: (2023)
Fine-Grained Quantitative Emotion Editing for Speech Generation
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
par: Ma, Duo, et autres
Publié: (2024)
par: Ma, Duo, et autres
Publié: (2024)
SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
par: Huang, Chien-yu, et autres
Publié: (2024)
par: Huang, Chien-yu, et autres
Publié: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
par: Liu, Hexin, et autres
Publié: (2025)
par: Liu, Hexin, et autres
Publié: (2025)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
Documents similaires
-
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
par: Hu, Yifan, et autres
Publié: (2025) -
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024) -
RefXVC: Cross-Lingual Voice Conversion with Enhanced Reference Leveraging
par: Zhang, Mingyang, et autres
Publié: (2024) -
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
par: Liu, Rui, et autres
Publié: (2024) -
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)