Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wang, Zan, Zhang, Jingze, Chen, Yixin, Jia, Baoxiong, Liang, Wei, Huang, Siyuan
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866915442275123200
author Wang, Zan
Zhang, Jingze
Chen, Yixin
Jia, Baoxiong
Liang, Wei
Huang, Siyuan
author_facet Wang, Zan
Zhang, Jingze
Chen, Yixin
Jia, Baoxiong
Liang, Wei
Huang, Siyuan
contents Despite significant advancements in human motion generation, current motion representations, typically formulated as discrete frame sequences, still face two critical limitations: (i) they fail to capture motion from a multi-scale perspective, limiting the capability in complex patterns modeling; (ii) they lack compositional flexibility, which is crucial for model's generalization in diverse generation tasks. To address these challenges, we introduce MSQ, a novel quantization method that compresses the motion sequence into multi-scale discrete tokens across spatial and temporal dimensions. MSQ employs distinct encoders to capture body parts at varying spatial granularities and temporally interpolates the encoded features into multiple scales before quantizing them into discrete tokens. Building on this representation, we establish a generative mask modeling model to effectively support motion editing, motion control, and conditional motion generation. Through quantitative and qualitative analysis, we show that our quantization method enables the seamless composition of motion tokens without requiring specialized design or re-training. Furthermore, extensive evaluations demonstrate that our approach outperforms existing baseline methods on various benchmarks.
format Preprint
id arxiv_https___arxiv_org_abs_2508_08991
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
Wang, Zan
Zhang, Jingze
Chen, Yixin
Jia, Baoxiong
Liang, Wei
Huang, Siyuan
Computer Vision and Pattern Recognition
Despite significant advancements in human motion generation, current motion representations, typically formulated as discrete frame sequences, still face two critical limitations: (i) they fail to capture motion from a multi-scale perspective, limiting the capability in complex patterns modeling; (ii) they lack compositional flexibility, which is crucial for model's generalization in diverse generation tasks. To address these challenges, we introduce MSQ, a novel quantization method that compresses the motion sequence into multi-scale discrete tokens across spatial and temporal dimensions. MSQ employs distinct encoders to capture body parts at varying spatial granularities and temporally interpolates the encoded features into multiple scales before quantizing them into discrete tokens. Building on this representation, we establish a generative mask modeling model to effectively support motion editing, motion control, and conditional motion generation. Through quantitative and qualitative analysis, we show that our quantization method enables the seamless composition of motion tokens without requiring specialized design or re-training. Furthermore, extensive evaluations demonstrate that our approach outperforms existing baseline methods on various benchmarks.
title Spatial-Temporal Multi-Scale Quantization for Flexible Motion Generation
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2508.08991