SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bai, Bingsong, Lu, Qihang, Yang, Wenbing, Sun, Zihan, Hou, Yueran, Jia, Peilei, Pu, Songbai, Fu, Ruibo, Gao, Yingming, Li, Ya, Gao, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026)
par: Hou, Yueran, et autres
Publié: (2026)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
par: Bai, Bingsong, et autres
Publié: (2024)
par: Bai, Bingsong, et autres
Publié: (2024)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Towards Machine Unlearning for Paralinguistic Speech Processing
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
par: Haq, Attia Nafees ul, et autres
Publié: (2026)
par: Haq, Attia Nafees ul, et autres
Publié: (2026)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
par: Lou, Haowei, et autres
Publié: (2025)
par: Lou, Haowei, et autres
Publié: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
par: Wang, Qiongqiong, et autres
Publié: (2025)
par: Wang, Qiongqiong, et autres
Publié: (2025)
Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
par: Buitrago, Pol, et autres
Publié: (2026)
par: Buitrago, Pol, et autres
Publié: (2026)
ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech
par: Lou, Haowei, et autres
Publié: (2026)
par: Lou, Haowei, et autres
Publié: (2026)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
par: Pešán, Jan, et autres
Publié: (2024)
par: Pešán, Jan, et autres
Publié: (2024)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
par: Cheng, Yifan, et autres
Publié: (2025)
par: Cheng, Yifan, et autres
Publié: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Source Tracing of Synthetic Speech Systems Through Paralinguistic Pre-Trained Representations
par: Girish, et autres
Publié: (2025)
par: Girish, et autres
Publié: (2025)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
par: Ranjan, Rishabh, et autres
Publié: (2025)
par: Ranjan, Rishabh, et autres
Publié: (2025)
AS-Speech: Adaptive Style For Speech Synthesis
par: Li, Zhipeng, et autres
Publié: (2024)
par: Li, Zhipeng, et autres
Publié: (2024)
Influence of Clean Speech Characteristics on Speech Enhancement Performance
par: Hou, Mingchi, et autres
Publié: (2025)
par: Hou, Mingchi, et autres
Publié: (2025)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
par: de Groot, Dimme, et autres
Publié: (2026)
par: de Groot, Dimme, et autres
Publié: (2026)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
par: Wu, Ya-Tse, et autres
Publié: (2026)
par: Wu, Ya-Tse, et autres
Publié: (2026)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
par: Kuhlmann, Michael, et autres
Publié: (2026)
par: Kuhlmann, Michael, et autres
Publié: (2026)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Group Relative Policy Optimization for Text-to-Speech with Large Language Models
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
par: Abilbekov, Adal, et autres
Publié: (2024)
par: Abilbekov, Adal, et autres
Publié: (2024)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
par: Gao, Yuan, et autres
Publié: (2025)
par: Gao, Yuan, et autres
Publié: (2025)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
A Unified Framework for Collecting Text-to-Speech Synthesis Datasets for 22 Indian Languages
par: Sathiyamoorthy, Sujitha, et autres
Publié: (2024)
par: Sathiyamoorthy, Sujitha, et autres
Publié: (2024)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
par: Zhang, Zixing, et autres
Publié: (2024)
par: Zhang, Zixing, et autres
Publié: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Documents similaires
-
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026) -
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
par: Bai, Bingsong, et autres
Publié: (2024) -
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024) -
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025) -
Towards Machine Unlearning for Paralinguistic Speech Processing
par: Phukan, Orchid Chetia, et autres
Publié: (2025)