LargeSHS: A large-scale dataset of music adaptation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Chih-Pin, Kao, Hsuan-Kai, Su, Li, Yang, Yi-Hsuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PiCoGen: Generate Piano Covers with a Two-stage Approach
por: Tan, Chih-Pin, et al.
Publicado: (2024)
por: Tan, Chih-Pin, et al.
Publicado: (2024)
Segment-Factorized Full-Song Generation on Symbolic Piano Music
por: Chen, Ping-Yi, et al.
Publicado: (2025)
por: Chen, Ping-Yi, et al.
Publicado: (2025)
PiCoGen2: Piano cover generation with transfer learning approach and weakly aligned data
por: Tan, Chih-Pin, et al.
Publicado: (2024)
por: Tan, Chih-Pin, et al.
Publicado: (2024)
SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
por: Ahmed, Tawsif, et al.
Publicado: (2025)
por: Ahmed, Tawsif, et al.
Publicado: (2025)
Emotion-Driven Melody Harmonization via Melodic Variation and Functional Representation
por: Huang, Jingyue, et al.
Publicado: (2024)
por: Huang, Jingyue, et al.
Publicado: (2024)
Training-Efficient Text-to-Music Generation with State-Space Modeling
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
METEOR: Melody-aware Texture-controllable Symbolic Orchestral Music Generation via Transformer VAE
por: Le, Dinh-Viet-Toan, et al.
Publicado: (2024)
por: Le, Dinh-Viet-Toan, et al.
Publicado: (2024)
AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing
por: Chang, Chih-Heng, et al.
Publicado: (2026)
por: Chang, Chih-Heng, et al.
Publicado: (2026)
Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods
por: Hsieh, Fang-Chih, et al.
Publicado: (2026)
por: Hsieh, Fang-Chih, et al.
Publicado: (2026)
Hyper Recurrent Neural Network: Condition Mechanisms for Black-box Audio Effect Modeling
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
Emotion-driven Piano Music Generation via Two-stage Disentanglement and Functional Representation
por: Huang, Jingyue, et al.
Publicado: (2024)
por: Huang, Jingyue, et al.
Publicado: (2024)
SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control
por: Liu, Jeng-Yue, et al.
Publicado: (2025)
por: Liu, Jeng-Yue, et al.
Publicado: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
por: Feng, Bo-Han, et al.
Publicado: (2026)
por: Feng, Bo-Han, et al.
Publicado: (2026)
Distortion Recovery: A Two-Stage Method for Guitar Effect Removal
por: Lee, Ying-Shuo, et al.
Publicado: (2024)
por: Lee, Ying-Shuo, et al.
Publicado: (2024)
Exploring State-Space-Model based Language Model in Music Generation
por: Lee, Wei-Jaw, et al.
Publicado: (2025)
por: Lee, Wei-Jaw, et al.
Publicado: (2025)
APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track
por: Miao, Deshui, et al.
Publicado: (2026)
por: Miao, Deshui, et al.
Publicado: (2026)
Local deployment of large-scale music AI models on commodity hardware
por: Zhou, Xun, et al.
Publicado: (2024)
por: Zhou, Xun, et al.
Publicado: (2024)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
MOSA: Music Motion with Semantic Annotation Dataset for Cross-Modal Music Processing
por: Huang, Yu-Fen, et al.
Publicado: (2024)
por: Huang, Yu-Fen, et al.
Publicado: (2024)
MidiCaps: A large-scale MIDI dataset with text captions
por: Melechovsky, Jan, et al.
Publicado: (2024)
por: Melechovsky, Jan, et al.
Publicado: (2024)
MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation
por: Lan, Yun-Han, et al.
Publicado: (2024)
por: Lan, Yun-Han, et al.
Publicado: (2024)
TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation
por: Hsu, Ming-Hao, et al.
Publicado: (2025)
por: Hsu, Ming-Hao, et al.
Publicado: (2025)
Echoes: A semantically-aligned music deepfake detection dataset
por: Pascu, Octavian, et al.
Publicado: (2026)
por: Pascu, Octavian, et al.
Publicado: (2026)
Audio Dialogues: Dialogues dataset for audio and music understanding
por: Goel, Arushi, et al.
Publicado: (2024)
por: Goel, Arushi, et al.
Publicado: (2024)
FROAV: A Framework for RAG Observation and Agent Verification -- Lowering the Barrier to LLM Agent Research
por: Lin, Tzu-Hsuan, et al.
Publicado: (2026)
por: Lin, Tzu-Hsuan, et al.
Publicado: (2026)
BEAST: Online Joint Beat and Downbeat Tracking Based on Streaming Transformer
por: Chang, Chih-Cheng, et al.
Publicado: (2023)
por: Chang, Chih-Cheng, et al.
Publicado: (2023)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
Learning Frame-Wise Emotion Intensity for Audio-Driven Talking-Head Generation
por: Xu, Jingyi, et al.
Publicado: (2024)
por: Xu, Jingyi, et al.
Publicado: (2024)
A Fourier Explanation of AI-music Artifacts
por: Afchar, Darius, et al.
Publicado: (2025)
por: Afchar, Darius, et al.
Publicado: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
por: Chou, Yi-Hui, et al.
Publicado: (2021)
por: Chou, Yi-Hui, et al.
Publicado: (2021)
LEMAS: Large A 150K-Hour Large-scale Extensible Multilingual Audio Suite with Generative Speech Models
por: Zhao, Zhiyuan, et al.
Publicado: (2026)
por: Zhao, Zhiyuan, et al.
Publicado: (2026)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
por: Yeh, Yen-Tung, et al.
Publicado: (2025)
por: Yeh, Yen-Tung, et al.
Publicado: (2025)
Attention-Guided Adaptation for Code-Switching Speech Recognition
por: Aditya, Bobbi, et al.
Publicado: (2023)
por: Aditya, Bobbi, et al.
Publicado: (2023)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline
por: Tsai, Fang-Duo, et al.
Publicado: (2026)
por: Tsai, Fang-Duo, et al.
Publicado: (2026)
Singer separation for karaoke content generation
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation
por: Li, Longhao, et al.
Publicado: (2025)
por: Li, Longhao, et al.
Publicado: (2025)
Music2Fail: Transfer Music to Failed Recorder Style
por: Leong, Chon In, et al.
Publicado: (2024)
por: Leong, Chon In, et al.
Publicado: (2024)
Ejemplares similares
-
PiCoGen: Generate Piano Covers with a Two-stage Approach
por: Tan, Chih-Pin, et al.
Publicado: (2024) -
Segment-Factorized Full-Song Generation on Symbolic Piano Music
por: Chen, Ping-Yi, et al.
Publicado: (2025) -
PiCoGen2: Piano cover generation with transfer learning approach and weakly aligned data
por: Tan, Chih-Pin, et al.
Publicado: (2024) -
SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
por: Ahmed, Tawsif, et al.
Publicado: (2025) -
Emotion-Driven Melody Harmonization via Melodic Variation and Functional Representation
por: Huang, Jingyue, et al.
Publicado: (2024)