Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Hong-Jie, Shao, Jie-Jing, Yang, Xiao-Wen, Jia, Lin-Han, Guo, Lan-Zhe, Li, Yu-Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
por: Luo, Jing, et al.
Publicado: (2025)
por: Luo, Jing, et al.
Publicado: (2025)
RenCon 2025: Revival of the Expressive Performance Rendering Competition
por: Zhang, Huan, et al.
Publicado: (2026)
por: Zhang, Huan, et al.
Publicado: (2026)
Research on Piano Timbre Transformation System Based on Diffusion Model
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms
por: Wei, Weixing, et al.
Publicado: (2025)
por: Wei, Weixing, et al.
Publicado: (2025)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
por: Zeng, Wei, et al.
Publicado: (2025)
por: Zeng, Wei, et al.
Publicado: (2025)
Towards Practical Real-Time Low-Latency Music Source Separation
por: Wu, Junyu, et al.
Publicado: (2025)
por: Wu, Junyu, et al.
Publicado: (2025)
A Distribution Matching Approach to Neural Piano Transcription with Optimal Transport
por: Wei, Weixing, et al.
Publicado: (2026)
por: Wei, Weixing, et al.
Publicado: (2026)
Rubato: Transcribing Piano Music with Timestamps
por: Tamer, Nazif Can, et al.
Publicado: (2026)
por: Tamer, Nazif Can, et al.
Publicado: (2026)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024)
por: Liu, Shengqiang, et al.
Publicado: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
por: Li, Fu, et al.
Publicado: (2025)
por: Li, Fu, et al.
Publicado: (2025)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
por: Chou, Yi-Hui, et al.
Publicado: (2021)
por: Chou, Yi-Hui, et al.
Publicado: (2021)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
por: Pan, Zihan, et al.
Publicado: (2025)
por: Pan, Zihan, et al.
Publicado: (2025)
PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music
por: Bang, Hayeon, et al.
Publicado: (2025)
por: Bang, Hayeon, et al.
Publicado: (2025)
Amanous: Distribution-Switching for Superhuman Piano Density on Disklavier
por: Bae, Joonhyung
Publicado: (2026)
por: Bae, Joonhyung
Publicado: (2026)
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation
por: Wen, Yadi, et al.
Publicado: (2026)
por: Wen, Yadi, et al.
Publicado: (2026)
PianoVAM: A Multimodal Piano Performance Dataset
por: Kim, Yonghyun, et al.
Publicado: (2025)
por: Kim, Yonghyun, et al.
Publicado: (2025)
MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening
por: Shao, Yongqi, et al.
Publicado: (2025)
por: Shao, Yongqi, et al.
Publicado: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation From Lead sheet
por: Choi, Eunjin, et al.
Publicado: (2026)
por: Choi, Eunjin, et al.
Publicado: (2026)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
por: Qiu, Ke, et al.
Publicado: (2026)
por: Qiu, Ke, et al.
Publicado: (2026)
Siamese Residual Neural Network for Musical Shape Evaluation in Piano Performance Assessment
por: Li, Xiaoquan, et al.
Publicado: (2024)
por: Li, Xiaoquan, et al.
Publicado: (2024)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
por: Chen, Yin, et al.
Publicado: (2025)
por: Chen, Yin, et al.
Publicado: (2025)
A Traditional Approach to Symbolic Piano Continuation
por: Zhou-Zheng, Christian, et al.
Publicado: (2025)
por: Zhou-Zheng, Christian, et al.
Publicado: (2025)
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
por: Gan, Qijun, et al.
Publicado: (2024)
por: Gan, Qijun, et al.
Publicado: (2024)
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
por: Su, Hongju, et al.
Publicado: (2025)
por: Su, Hongju, et al.
Publicado: (2025)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
por: Zhao, Yuan, et al.
Publicado: (2024)
por: Zhao, Yuan, et al.
Publicado: (2024)
EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
por: Jing, Chong, et al.
Publicado: (2026)
por: Jing, Chong, et al.
Publicado: (2026)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
por: Bang, Hayeon, et al.
Publicado: (2024)
por: Bang, Hayeon, et al.
Publicado: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
por: Li, Yaoru, et al.
Publicado: (2025)
por: Li, Yaoru, et al.
Publicado: (2025)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
por: Zhou, Yang-Hao, et al.
Publicado: (2026)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)
por: Huang, Qiaochu, et al.
Publicado: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
por: Peng, Yuezhang, et al.
Publicado: (2025)
por: Peng, Yuezhang, et al.
Publicado: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
por: Wei, Weixing, et al.
Publicado: (2025)
por: Wei, Weixing, et al.
Publicado: (2025)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
por: Feng, Zhou, et al.
Publicado: (2025)
por: Feng, Zhou, et al.
Publicado: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
Ejemplares similares
-
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
por: Luo, Jing, et al.
Publicado: (2025) -
RenCon 2025: Revival of the Expressive Performance Rendering Competition
por: Zhang, Huan, et al.
Publicado: (2026) -
Research on Piano Timbre Transformation System Based on Diffusion Model
por: Hsu, Chun-Chieh, et al.
Publicado: (2026) -
Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms
por: Wei, Weixing, et al.
Publicado: (2025) -
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
por: Zeng, Wei, et al.
Publicado: (2025)