RenderBox: Expressive Performance Rendering with Text Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Huan, Maezawa, Akira, Dixon, Simon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment
par: Zhang, Huan, et autres
Publié: (2024)
par: Zhang, Huan, et autres
Publié: (2024)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
par: Zeng, Wei, et autres
Publié: (2025)
par: Zeng, Wei, et autres
Publié: (2025)
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
par: Hung, Tzu-Yun, et autres
Publié: (2024)
par: Hung, Tzu-Yun, et autres
Publié: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
par: Zhang, Yixiao, et autres
Publié: (2024)
par: Zhang, Yixiao, et autres
Publié: (2024)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
par: Luo, Jing, et autres
Publié: (2025)
par: Luo, Jing, et autres
Publié: (2025)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)
par: Guo, Zixin, et autres
Publié: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
par: Niu, Xinlei, et autres
Publié: (2024)
par: Niu, Xinlei, et autres
Publié: (2024)
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
par: Kumar, Lokesh, et autres
Publié: (2026)
par: Kumar, Lokesh, et autres
Publié: (2026)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
par: Jiang, Ziyang, et autres
Publié: (2024)
par: Jiang, Ziyang, et autres
Publié: (2024)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
par: Wang, Yutian, et autres
Publié: (2024)
par: Wang, Yutian, et autres
Publié: (2024)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025)
par: Kim, Haven, et autres
Publié: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
par: Lin, Jinwei
Publié: (2024)
par: Lin, Jinwei
Publié: (2024)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
par: Wachter, Maximilian, et autres
Publié: (2026)
par: Wachter, Maximilian, et autres
Publié: (2026)
Flexible Control in Symbolic Music Generation via Musical Metadata
par: Han, Sangjun, et autres
Publié: (2024)
par: Han, Sangjun, et autres
Publié: (2024)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
par: Stewart, Shanti, et autres
Publié: (2024)
par: Stewart, Shanti, et autres
Publié: (2024)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2024)
par: Cong, Gaoxiang, et autres
Publié: (2024)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
par: Deng, Jiajun, et autres
Publié: (2025)
par: Deng, Jiajun, et autres
Publié: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
par: Devaney, Johanna, et autres
Publié: (2024)
par: Devaney, Johanna, et autres
Publié: (2024)
SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
par: Yang, Chenyu, et autres
Publié: (2025)
par: Yang, Chenyu, et autres
Publié: (2025)
Iola Walker: A Mobile Footfall Detection System for Music Composition
par: James, William B.
Publié: (2025)
par: James, William B.
Publié: (2025)
M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset
par: Wu, Shilong
Publié: (2025)
par: Wu, Shilong
Publié: (2025)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
Dialogue Understandability: Why are we streaming movies with subtitles?
par: Martinez, Helard Becerra, et autres
Publié: (2024)
par: Martinez, Helard Becerra, et autres
Publié: (2024)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
par: Morrone, Giovanni, et autres
Publié: (2024)
par: Morrone, Giovanni, et autres
Publié: (2024)
Peransformer: Improving Low-informed Expressive Performance Rendering with Score-aware Discriminator
par: He, Xian, et autres
Publié: (2025)
par: He, Xian, et autres
Publié: (2025)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Documents similaires
-
LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment
par: Zhang, Huan, et autres
Publié: (2024) -
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
par: Zeng, Wei, et autres
Publié: (2025) -
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
par: Hung, Tzu-Yun, et autres
Publié: (2024) -
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024) -
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
par: Zhang, Yixiao, et autres
Publié: (2024)