LZMidi: Compression-Based Symbolic Music Generation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ding, Connor, Gorle, Abhiram, Bhattacharya, Sagnik, Hasteer, Divija, Sagan, Naomi, Weissman, Tsachy
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909547878154240
author Ding, Connor
Gorle, Abhiram
Bhattacharya, Sagnik
Hasteer, Divija
Sagan, Naomi
Weissman, Tsachy
author_facet Ding, Connor
Gorle, Abhiram
Bhattacharya, Sagnik
Hasteer, Divija
Sagan, Naomi
Weissman, Tsachy
contents Recent advances in symbolic music generation primarily rely on deep learning models such as Transformers, GANs, and diffusion models. While these approaches achieve high-quality results, they require substantial computational resources, limiting their scalability. We introduce LZMidi, a lightweight symbolic music generation framework based on a Lempel-Ziv (LZ78)-induced sequential probability assignment (SPA). By leveraging the discrete and sequential structure of MIDI data, our approach enables efficient music generation on standard CPUs with minimal training and inference costs. Theoretically, we establish universal convergence guarantees for our approach, underscoring its reliability and robustness. Compared to state-of-the-art diffusion models, LZMidi achieves competitive Frechet Audio Distance (FAD), Wasserstein Distance (WD), and Kullback-Leibler (KL) scores, while significantly reducing computational overhead - up to 30x faster training and 300x faster generation. Our results position LZMidi as a significant advancement in compression-based learning, highlighting how universal compression techniques can efficiently model and generate structured sequential data, such as symbolic music, with practical scalability and theoretical rigor.
format Preprint
id arxiv_https___arxiv_org_abs_2503_17654
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle LZMidi: Compression-Based Symbolic Music Generation
Ding, Connor
Gorle, Abhiram
Bhattacharya, Sagnik
Hasteer, Divija
Sagan, Naomi
Weissman, Tsachy
Sound
Information Theory
Recent advances in symbolic music generation primarily rely on deep learning models such as Transformers, GANs, and diffusion models. While these approaches achieve high-quality results, they require substantial computational resources, limiting their scalability. We introduce LZMidi, a lightweight symbolic music generation framework based on a Lempel-Ziv (LZ78)-induced sequential probability assignment (SPA). By leveraging the discrete and sequential structure of MIDI data, our approach enables efficient music generation on standard CPUs with minimal training and inference costs. Theoretically, we establish universal convergence guarantees for our approach, underscoring its reliability and robustness. Compared to state-of-the-art diffusion models, LZMidi achieves competitive Frechet Audio Distance (FAD), Wasserstein Distance (WD), and Kullback-Leibler (KL) scores, while significantly reducing computational overhead - up to 30x faster training and 300x faster generation. Our results position LZMidi as a significant advancement in compression-based learning, highlighting how universal compression techniques can efficiently model and generate structured sequential data, such as symbolic music, with practical scalability and theoretical rigor.
title LZMidi: Compression-Based Symbolic Music Generation
topic Sound
Information Theory
url https://arxiv.org/abs/2503.17654