Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Suda, Hitoshi, Takamichi, Shinnosuke, Fukayama, Satoru |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Who Finds This Voice Attractive? A Large-Scale Experiment Using In-the-Wild Data
par: Suda, Hitoshi, et autres
Publié: (2024)
par: Suda, Hitoshi, et autres
Publié: (2024)
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
par: Suda, Hitoshi, et autres
Publié: (2024)
par: Suda, Hitoshi, et autres
Publié: (2024)
JaCappella Corpus: A Japanese a Cappella Vocal Ensemble Corpus
par: Nakamura, Tomohiko, et autres
Publié: (2022)
par: Nakamura, Tomohiko, et autres
Publié: (2022)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
IdolSongsJp Corpus: A Multi-Singer Song Corpus in the Style of Japanese Idol Groups
par: Suda, Hitoshi, et autres
Publié: (2025)
par: Suda, Hitoshi, et autres
Publié: (2025)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
par: Saito, Yuki, et autres
Publié: (2024)
par: Saito, Yuki, et autres
Publié: (2024)
Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment
par: Igarashi, Takuto, et autres
Publié: (2024)
par: Igarashi, Takuto, et autres
Publié: (2024)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
par: Saeki, Takaaki, et autres
Publié: (2024)
par: Saeki, Takaaki, et autres
Publié: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
par: Nobukawa, Rinka, et autres
Publié: (2025)
par: Nobukawa, Rinka, et autres
Publié: (2025)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
par: Bargum, Anders R., et autres
Publié: (2024)
par: Bargum, Anders R., et autres
Publié: (2024)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences
par: Kishi, Minoru, et autres
Publié: (2025)
par: Kishi, Minoru, et autres
Publié: (2025)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
par: Xin, Detai, et autres
Publié: (2023)
par: Xin, Detai, et autres
Publié: (2023)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025)
par: Dai, Shuqi, et autres
Publié: (2025)
DNN-based ensemble singing voice synthesis with interactions between singers
par: Hyodo, Hiroaki, et autres
Publié: (2024)
par: Hyodo, Hiroaki, et autres
Publié: (2024)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
YODAS: Youtube-Oriented Dataset for Audio and Speech
par: Li, Xinjian, et autres
Publié: (2024)
par: Li, Xinjian, et autres
Publié: (2024)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
par: Kanamori, Yusuke, et autres
Publié: (2025)
par: Kanamori, Yusuke, et autres
Publié: (2025)
Building speech corpus with diverse voice characteristics for its prompt-based representation
par: Watanabe, Aya, et autres
Publié: (2024)
par: Watanabe, Aya, et autres
Publié: (2024)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
par: Byun, Kyungguen, et autres
Publié: (2024)
par: Byun, Kyungguen, et autres
Publié: (2024)
Speech Synthesis along Perceptual Voice Quality Dimensions
par: Rautenberg, Frederik, et autres
Publié: (2025)
par: Rautenberg, Frederik, et autres
Publié: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
par: Hou, Yixuan, et autres
Publié: (2025)
par: Hou, Yixuan, et autres
Publié: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Discrete Speech Unit Extraction via Independent Component Analysis
par: Nakamura, Tomohiko, et autres
Publié: (2025)
par: Nakamura, Tomohiko, et autres
Publié: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification
par: Wu, Bin, et autres
Publié: (2024)
par: Wu, Bin, et autres
Publié: (2024)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
par: Avdeeva, Anastasia, et autres
Publié: (2024)
par: Avdeeva, Anastasia, et autres
Publié: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
par: Yu, Fan, et autres
Publié: (2025)
par: Yu, Fan, et autres
Publié: (2025)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
par: Chen, Meiying, et autres
Publié: (2022)
par: Chen, Meiying, et autres
Publié: (2022)
Speech to Speech Synthesis for Voice Impersonation
par: Johnson, Bjorn, et autres
Publié: (2026)
par: Johnson, Bjorn, et autres
Publié: (2026)
Documents similaires
-
Who Finds This Voice Attractive? A Large-Scale Experiment Using In-the-Wild Data
par: Suda, Hitoshi, et autres
Publié: (2024) -
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
par: Suda, Hitoshi, et autres
Publié: (2024) -
JaCappella Corpus: A Japanese a Cappella Vocal Ensemble Corpus
par: Nakamura, Tomohiko, et autres
Publié: (2022) -
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
par: Onda, Kentaro, et autres
Publié: (2025) -
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)