PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
Fuente:
arXiv
Salvato in:
| Autori principali: | Gan, Qijun, Wang, Song, Wu, Shengtao, Zhu, Jianke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PianoVAM: A Multimodal Piano Performance Dataset
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
Two Web Toolkits for Multimodal Piano Performance Dataset Acquisition and Fingering Annotation
di: Park, Junhyung, et al.
Pubblicazione: (2025)
di: Park, Junhyung, et al.
Pubblicazione: (2025)
Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
di: Liu, Zihao, et al.
Pubblicazione: (2025)
di: Liu, Zihao, et al.
Pubblicazione: (2025)
Controllable Dance Generation with Style-Guided Motion Diffusion
di: Wang, Hongsong, et al.
Pubblicazione: (2024)
di: Wang, Hongsong, et al.
Pubblicazione: (2024)
Amanous: Distribution-Switching for Superhuman Piano Density on Disklavier
di: Bae, Joonhyung
Pubblicazione: (2026)
di: Bae, Joonhyung
Pubblicazione: (2026)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
di: Luo, Jing, et al.
Pubblicazione: (2025)
di: Luo, Jing, et al.
Pubblicazione: (2025)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
di: Zeng, Wei, et al.
Pubblicazione: (2025)
di: Zeng, Wei, et al.
Pubblicazione: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
A Traditional Approach to Symbolic Piano Continuation
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
UniMuMo: Unified Text, Music and Motion Generation
di: Yang, Han, et al.
Pubblicazione: (2024)
di: Yang, Han, et al.
Pubblicazione: (2024)
Siamese Residual Neural Network for Musical Shape Evaluation in Piano Performance Assessment
di: Li, Xiaoquan, et al.
Pubblicazione: (2024)
di: Li, Xiaoquan, et al.
Pubblicazione: (2024)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
Learning Musical Representations for Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Streaming Piano Transcription Based on Consistent Onset and Offset Decoding with Sustain Pedal Detection
di: Wei, Weixing, et al.
Pubblicazione: (2025)
di: Wei, Weixing, et al.
Pubblicazione: (2025)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
Benchmarking Cross-Domain Audio-Visual Deception Detection
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
di: Wang, Baisen, et al.
Pubblicazione: (2024)
di: Wang, Baisen, et al.
Pubblicazione: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024)
di: Chen, Zihao, et al.
Pubblicazione: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Segment-Factorized Full-Song Generation on Symbolic Piano Music
di: Chen, Ping-Yi, et al.
Pubblicazione: (2025)
di: Chen, Ping-Yi, et al.
Pubblicazione: (2025)
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
di: Chen, Gehui, et al.
Pubblicazione: (2025)
di: Chen, Gehui, et al.
Pubblicazione: (2025)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PianoVAM: A Multimodal Piano Performance Dataset
di: Kim, Yonghyun, et al.
Pubblicazione: (2025) -
Two Web Toolkits for Multimodal Piano Performance Dataset Acquisition and Fingering Annotation
di: Park, Junhyung, et al.
Pubblicazione: (2025) -
Separate to Collaborate: Dual-Stream Diffusion Model for Coordinated Piano Hand Motion Synthesis
di: Liu, Zihao, et al.
Pubblicazione: (2025) -
Controllable Dance Generation with Style-Guided Motion Diffusion
di: Wang, Hongsong, et al.
Pubblicazione: (2024) -
Amanous: Distribution-Switching for Superhuman Piano Density on Disklavier
di: Bae, Joonhyung
Pubblicazione: (2026)