$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Boyu, Gong, Cheng, Wu, Muyang, Jing, Ruihao, Liu, Fan, Zhang, Xiaolei, Zhang, Chi, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Text adaptation for speaker verification with speaker-text factorized embeddings
di: Yang, Yexin, et al.
Pubblicazione: (2025)
di: Yang, Yexin, et al.
Pubblicazione: (2025)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
CDSD: Chinese Dysarthria Speech Database
di: Wang, Yan, et al.
Pubblicazione: (2023)
di: Wang, Yan, et al.
Pubblicazione: (2023)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
di: Gong, Cheng, et al.
Pubblicazione: (2023)
di: Gong, Cheng, et al.
Pubblicazione: (2023)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
EDTC: enhance depth of text comprehension in automated audio captioning
di: Tan, Liwen, et al.
Pubblicazione: (2024)
di: Tan, Liwen, et al.
Pubblicazione: (2024)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
Self-supervised speech representation and contextual text embedding for match-mismatch classification with EEG recording
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
Exploring compressibility of transformer based text-to-music (TTM) models
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
di: Kanamori, Yusuke, et al.
Pubblicazione: (2025)
di: Kanamori, Yusuke, et al.
Pubblicazione: (2025)
A framework of text-dependent speaker verification for chinese numerical string corpus
di: Zheng, Litong, et al.
Pubblicazione: (2024)
di: Zheng, Litong, et al.
Pubblicazione: (2024)
PAGURI: a user experience study of creative interaction with text-to-music models
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
di: Tang, Haobin, et al.
Pubblicazione: (2024)
di: Tang, Haobin, et al.
Pubblicazione: (2024)
High-precision Voice Search Query Correction via Retrievable Speech-text Embedings
di: Li, Christopher, et al.
Pubblicazione: (2024)
di: Li, Christopher, et al.
Pubblicazione: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
Enhancing Non-Core Language Instruction-Following in Speech LLMs via Semi-Implicit Cross-Lingual CoT Reasoning
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
di: Zou, Jialing, et al.
Pubblicazione: (2024)
di: Zou, Jialing, et al.
Pubblicazione: (2024)
ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning
di: Wang, Junyi, et al.
Pubblicazione: (2026)
di: Wang, Junyi, et al.
Pubblicazione: (2026)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Incremental FastPitch: Chunk-based High Quality Text to Speech
di: Du, Muyang, et al.
Pubblicazione: (2024)
di: Du, Muyang, et al.
Pubblicazione: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
Construction and Evaluation of Mandarin Multimodal Emotional Speech Database
di: Ting, Zhu, et al.
Pubblicazione: (2024)
di: Ting, Zhu, et al.
Pubblicazione: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
di: Niu, Rui, et al.
Pubblicazione: (2025)
di: Niu, Rui, et al.
Pubblicazione: (2025)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
di: Lu, Xikun, et al.
Pubblicazione: (2025)
di: Lu, Xikun, et al.
Pubblicazione: (2025)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
di: Jing, Ruihao, et al.
Pubblicazione: (2025) -
High-Fidelity Generative Audio Compression at 0.275kbps
di: Ma, Hao, et al.
Pubblicazione: (2026) -
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025) -
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
di: Xue, Hongfei, et al.
Pubblicazione: (2025) -
Text adaptation for speaker verification with speaker-text factorized embeddings
di: Yang, Yexin, et al.
Pubblicazione: (2025)