A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hung, Tzu-Yun, Wu, Jui-Te, Kuo, Yu-Chia, Hsiao, Yo-Wei, Lin, Ting-Wei, Su, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
par: Luo, Jing, et autres
Publié: (2025)
par: Luo, Jing, et autres
Publié: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)
par: Kim, Minyoung, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
par: Shen, Lipeng, et autres
Publié: (2024)
par: Shen, Lipeng, et autres
Publié: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
par: Gu, Bin, et autres
Publié: (2025)
par: Gu, Bin, et autres
Publié: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
par: Wachter, Maximilian, et autres
Publié: (2026)
par: Wachter, Maximilian, et autres
Publié: (2026)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
par: Lin, Jinwei
Publié: (2024)
par: Lin, Jinwei
Publié: (2024)
DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning
par: Bhattacharya, Aneesh, et autres
Publié: (2023)
par: Bhattacharya, Aneesh, et autres
Publié: (2023)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
par: Jiang, Ziyang, et autres
Publié: (2024)
par: Jiang, Ziyang, et autres
Publié: (2024)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
par: Guo, Hongming, et autres
Publié: (2024)
par: Guo, Hongming, et autres
Publié: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
par: Devaney, Johanna, et autres
Publié: (2024)
par: Devaney, Johanna, et autres
Publié: (2024)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
par: Chou, Huang-Cheng, et autres
Publié: (2024)
par: Chou, Huang-Cheng, et autres
Publié: (2024)
Singer separation for karaoke content generation
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
par: Zeng, Wei, et autres
Publié: (2025)
par: Zeng, Wei, et autres
Publié: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026)
par: Lv, Yishan, et autres
Publié: (2026)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
par: Zhao, Jinzheng, et autres
Publié: (2023)
par: Zhao, Jinzheng, et autres
Publié: (2023)
Is Transfer Learning Necessary for Violin Transcription?
par: Peng, Yueh-Po, et autres
Publié: (2025)
par: Peng, Yueh-Po, et autres
Publié: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
A Traditional Approach to Symbolic Piano Continuation
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
par: Zhou-Zheng, Christian, et autres
Publié: (2025)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
par: Wei, Weixing, et autres
Publié: (2025)
par: Wei, Weixing, et autres
Publié: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025)
par: Kim, Haven, et autres
Publié: (2025)
Documents similaires
-
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
par: Luo, Jing, et autres
Publié: (2025) -
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024) -
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025) -
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026) -
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)