Transfer Learning in Vocal Education: Technical Evaluation of Limited Samples Describing Mezzo-soprano
Fuente:
arXiv
Salvato in:
| Autori principali: | Hou, Zhenyi, Zhao, Xu, Ye, Kejie, Sheng, Xinyu, Jiang, Shanggerile, Xia, Jiajing, Zhang, Yitao, Ban, Chenxi, Luo, Daijun, Chen, Jiaxing, Zou, Yan, Feng, Yuchao, Fan, Guangyu, Yuan, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VocalCrypt: Novel Active Defense Against Deepfake Voice Based on Masking Effect
di: Fei, Qingyuan, et al.
Pubblicazione: (2025)
di: Fei, Qingyuan, et al.
Pubblicazione: (2025)
Separate Anything You Describe
di: Liu, Xubo, et al.
Pubblicazione: (2023)
di: Liu, Xubo, et al.
Pubblicazione: (2023)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
di: Gong, Jingyao
Pubblicazione: (2026)
di: Gong, Jingyao
Pubblicazione: (2026)
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
di: Wu, Sheng, et al.
Pubblicazione: (2024)
di: Wu, Sheng, et al.
Pubblicazione: (2024)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
Network Bending of Diffusion Models for Audio-Visual Generation
di: Dzwonczyk, Luke, et al.
Pubblicazione: (2024)
di: Dzwonczyk, Luke, et al.
Pubblicazione: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
di: Qian, Yikai, et al.
Pubblicazione: (2024)
di: Qian, Yikai, et al.
Pubblicazione: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
di: Cui, Yang, et al.
Pubblicazione: (2025)
di: Cui, Yang, et al.
Pubblicazione: (2025)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
di: Lv, Yishan, et al.
Pubblicazione: (2026)
di: Lv, Yishan, et al.
Pubblicazione: (2026)
TEAdapter: Supply abundant guidance for controllable text-to-music generation
di: Zou, Jialing, et al.
Pubblicazione: (2024)
di: Zou, Jialing, et al.
Pubblicazione: (2024)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
di: Ji, Shulei, et al.
Pubblicazione: (2023)
di: Ji, Shulei, et al.
Pubblicazione: (2023)
Neural Style Transfer for Audio Spectograms
di: Verma, Prateek, et al.
Pubblicazione: (2018)
di: Verma, Prateek, et al.
Pubblicazione: (2018)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
di: Luo, Jing, et al.
Pubblicazione: (2024)
di: Luo, Jing, et al.
Pubblicazione: (2024)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
di: Luo, Jing, et al.
Pubblicazione: (2025)
di: Luo, Jing, et al.
Pubblicazione: (2025)
SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
Target Speech Diarization with Multimodal Prompts
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
Iola Walker: A Mobile Footfall Detection System for Music Composition
di: James, William B.
Pubblicazione: (2025)
di: James, William B.
Pubblicazione: (2025)
LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment
di: Zhang, Huan, et al.
Pubblicazione: (2024)
di: Zhang, Huan, et al.
Pubblicazione: (2024)
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset
di: Wu, Shilong
Pubblicazione: (2025)
di: Wu, Shilong
Pubblicazione: (2025)
RenderBox: Expressive Performance Rendering with Text Control
di: Zhang, Huan, et al.
Pubblicazione: (2025)
di: Zhang, Huan, et al.
Pubblicazione: (2025)
Dialogue Understandability: Why are we streaming movies with subtitles?
di: Martinez, Helard Becerra, et al.
Pubblicazione: (2024)
di: Martinez, Helard Becerra, et al.
Pubblicazione: (2024)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
EveGuard: Defeating Vibration-based Side-Channel Eavesdropping with Audio Adversarial Perturbations
di: Chang, Jung-Woo, et al.
Pubblicazione: (2024)
di: Chang, Jung-Woo, et al.
Pubblicazione: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
Kimi-Audio Technical Report
di: KimiTeam, et al.
Pubblicazione: (2025)
di: KimiTeam, et al.
Pubblicazione: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
di: Kim, Haven, et al.
Pubblicazione: (2025)
di: Kim, Haven, et al.
Pubblicazione: (2025)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
di: Gu, Ke, et al.
Pubblicazione: (2025)
di: Gu, Ke, et al.
Pubblicazione: (2025)
Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving
di: Guo, Ziang, et al.
Pubblicazione: (2026)
di: Guo, Ziang, et al.
Pubblicazione: (2026)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Building Audio-Visual Digital Twins with Smartphones
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Dance2MIDI: Dance-driven multi-instruments music generation
di: Han, Bo, et al.
Pubblicazione: (2023)
di: Han, Bo, et al.
Pubblicazione: (2023)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
di: Li, Yupei, et al.
Pubblicazione: (2024)
di: Li, Yupei, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VocalCrypt: Novel Active Defense Against Deepfake Voice Based on Masking Effect
di: Fei, Qingyuan, et al.
Pubblicazione: (2025) -
Separate Anything You Describe
di: Liu, Xubo, et al.
Pubblicazione: (2023) -
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
di: Gong, Jingyao
Pubblicazione: (2026) -
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
di: Wu, Sheng, et al.
Pubblicazione: (2024) -
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)